Hugging Face 发布 NeoMME:260M/800M 多模态多语言编码器
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个版本,不使用独立预训练视觉塔或因果语言模型,由单个双向 Transformer 同时处理文本 token 与原始图像 patch,并以掩码离散扩散目标从零训练。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个版本,不使用独立预训练视觉塔或因果语言模型,由单个双向 Transformer 同时处理文本 token 与原始图像 patch,并以掩码离散扩散目标从零训练。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言并可在单个容器中自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,独立标注者在 600 多份文档的盲评中平均 72% 更偏好其输出。
推荐理由:OCR 4 在文本之外返回边界框、块分类与置信度,读者可据此判断它如何改变 RAG 与智能体的文档处理流程。
Mistral AI 发布 Codestral Embed,这是其首个专为代码打造的嵌入模型,在真实代码检索任务上表现优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。