AREX Feed Article
Cohere 开源 North Micro Vision:迄今最小,2.4B,Apache 2.0
8 月 12 日 16:07(UTC),宣布 North Micro Vision 加入模型家族:这是公司迄今最小的视觉语言模型(VLM),面向"复杂文档理解",Apache 2.0 开源,权重上架 Hugging Face。给出 2.4B 参数,以及原生分辨率处理、图文多轮对话、空间推理与视觉定位、多语言图像理解四项能力。
权重当天挂在 ,署名同日发布。最扎眼的数字来自 DocVQA:0.921,高于博客对比表中所有视觉模型——3.8B 的 Ministral-3-3B 是 0.896,2.2B 的 Qwen3-VL-2B 是 0.825,只有纯文本模型 Qwen3.5-2B-Instruct(0.926)排在它前面。
一页 A4 按 200 dpi 原样进模型
North Micro Vision 与多数小模型最大的区别在输入端:不把每张图压成小正方形,而是保留原分辨率和宽高比。据技术博客,训练的第三阶段把原生分辨率上限推到 1654×2339 像素,等于 200 dpi 下的一页 A4,整页表格、表单和小字号文本不用先被缩成糊块。
2.4B 由两部分拼成:一个 400M 的定制视觉编码器,加 2B 的自研语言模型 North Micro LLM。
编码器从 SigLIP 2 SO400M 检查点继续预训练,用 2D RoPE 加可学习的一维位置嵌入(C-RoPE)保持空间结构;语言模型沿用 Command A+ 架构,三层滑动窗口注意力加一层全局注意力。视觉 patch 按 DeepStack 的思路注入 LLM 前几层,让语言模型看到不同抽象层次的视觉特征。
训练分四阶段:Stage 1 用 1000 万样本在 384×384 固定分辨率下只训编码器和投影器,数据是 60% 密集描述加 40% OCR;Stage 2 先升到 1024×1024(1300 万样本)、再推到 A4 上限(1000 万样本),全模型联合训练。
Stage 3 用 5000 万样本做原生分辨率指令微调,OCR 与图表数据各占 17.8%;Stage 4 用 50 万偏好样本做简化版 MPO——DPO 加 15% 权重的 SFT 损失,只训语言模型,补安全和输出格式。
DocVQA 0.921 领跑,STEM 掉到榜尾
评测统一用 VLMEvalKit,生成上限 1024 token,对比组限定为指令微调、非推理模型。文档与图表是它的主场:DocVQA 0.921 在全部视觉模型里最高;ChartQA 0.808,高于 Qwen3-VL-2B 的 0.693 和 Ministral-3-3B 的 0.791;InfoVQA 0.652、AI2D 0.775。差距最大的是视觉定位:RefCOCO 平均 0.732,Qwen3-VL-2B 只有 0.304,Ministral-3-3B 是 0.317。
离开文档场景,分数明显回落:通用 VQA 的 MMBench 0.687(Qwen3-VL-2B 为 0.744)、MMStar 0.518;STEM 的 MMMU 只有 0.329,在表里垫底;OCRBench v2 0.367;纯文本 MMLU 0.504。博客自己的结论也直白:基准画像在文档理解和视觉定位上最强。
视觉模型从 219B 缩到 2.4B
"迄今最小"不是修辞。上,Command A Plus 系列的 Image-Text-to-Text 模型挂着 219B 和 126B 两档,North Micro Vision 的 2.4B 只有 126B 档的约五十分之一。2025 年 7 月 31 日,该组织发布过 Command A Vision,定位"为商业而生的多模态";今年 6 月 9 日,North Mini Code 以 30B 规模上线,是 Cohere"首个面向开发者的模型"。North Micro Vision 是这条模型线上最小的节点。
博客把这次发布挂进更大的路线:Cohere 的 sovereign AI 工作,用清晰的许可、开放的权重和透明的评测来配套模型开发。在 8 月 12 日晚发帖强调,权重发布在 Hugging Face 让视觉理解应用"可以在本地运行"。
评论区在争 OCR 商品化,也有人追问显存
截至 8 月 14 日,主推文累计 7.1 万余次浏览、793 个赞、79 次转发。评论区的讨论集中在几个话题。海得拉巴的创业者 Jayadeep Reddy :以 Apache 2.0 开源一个做文档理解的微视觉模型,等于把企业 OCR 商品化,"瓶颈会从模型规模转移到本地推理引擎处理高分辨率图像块的效率"。
自称 CS/AI 博士、在做 agentic 基础设施的 Andrii Bidochko ,这类模型正是"边缘与本地文档处理工作流缺的那块拼图",不必依赖大规模云端推理管线就能原生处理复杂文档结构和 OCR,对企业隐私是"一场大胜"。
也有人泼冷水。独立开发者 Idov Mamane Apache 2.0"很慷慨",但他担心"'最小'通常带着没人提前说明的隐性让步"。另一位用户 直接问:跑这个模型需要多少 RAM/VRAM。
官方边界:不推理、不调工具、8K 上下文
模型卡把自己的边界写得比评论区还细:它是用于定制的紧凑底座,不是大型通用聊天助手的替代品;不是推理模型,数学和代码生成能力有限;不支持工具调用和 agentic 工作流;没有用 system prompt 训练;多模态上下文验证到 8K token,尽管语言后端本身支持 128K;原生分辨率输入还会随图像尺寸增加显存占用和延迟。
部署栈目前有缺口:推理需要 Transformers 5.16.0,正式版发布前得从源码安装;Flash Attention 2 可选;公共 vLLM 支持还写着"即将上线"。生态端动作不少:社区已贡献 MLX-VLM 权重,NVIDIA 合作提供 AutoModel 配方用于在 NVIDIA GPU 上微调和部署,另有 Axolotl 微调支持。博客称,配上合适的推理栈和量化,这个规模可以跑在笔记本甚至边缘、移动级硬件上。
发布当天,权重、模型卡、博客和基准表都能拿到,只有生产推理常用的一环还欠着:vLLM 支持。要不要把它接进现有管线,得等官方把这最后一块补上。