昨天,Liquid AI 发布了LFM2.5-VL-3B。这是一个拥有 31 亿参数的视觉语言模型,专为设备端部署而设计。该模型能够读取移动设备、网页和桌面设备上的数字屏幕。它可以将物体映射到坐标,解析文档和图表,并根据文本或图像输入调用工具。Liquid AI 报告称,该模型在 28 项视觉基准测试中的平均得分为 69.4 分。这一成绩与 InternVL-3.5-4B 持平,仅比 Qwen3.5-4B 低 0.7 分,这两个模型的参数量均为 47 亿。该模型不具备推理能力,因此能够直接给出答案,从而保持较低的延迟。它占用约 3 GB 内存,在 Apple M5 Max 上每秒可解码 228 个词元。

它可以部署吗?
是的,该检查点提供四种格式:原生格式、GGUF、ONNX 和 MLX。首发支持的运行时包括 llama.cpp、MLX、vLLM、SGLang 和 ONNX。它大约占用 3 GB 内存。
- 公司级别限制:LFM 开源许可证 v1.0基于 Apache 2.0,但有一项改动:公司年收入达到 1000 万美元后,免费商业使用权即告终止。因此,年收入低于 1000 万美元的独立开发者、初创公司和中小企业可以免费进行商业发布。年收入高于 1000 万美元的企业则必须与 Liquid AI 协商商业许可。研究、教育和非营利用途不受收入限制。
- 行业领域:消费电子、汽车、工业和机器人、金融服务、医疗保健和电子商务。此外,还包括提供图形用户界面自动化服务的质量保证和RPA供应商。
- 应用领域:设备端屏幕代理、GUI 测试自动化、带布局标签的 PDF 转结构化文本、发票和收据 OCR、车辆近实时物体检测、菜单和路标的离线翻译以及多图像比较。
新功能
LFM2.5-VL-3B 在四个轴向对 LFM2-VL-3B 进行了扩展。
- 屏幕和用户界面理解:该模型在ScreenSpot-v2上的平均得分为80.7,其中桌面端(78.7)、移动端(81.2)和网页端(82.2)的得分均在该水平。Liquid AI的报告显示,Gemma-4-E4B得分为51.2,Qwen3.5-4B得分为78.5,而规模更大的InternVL-3.5-4B以84.1的得分领先。
- 函数调用:这是 VL 系列中的新功能。ToolSandbox 的得分从 26.4 提升至 59.5,BFCL v4 则从 20.5 提升至 32.5。工具调用以 Python 风格的调用形式输出,位于
<|tool_call_start|>和<|tool_call_end|> 标记之间。 - 锚定:RefCOCO-avg 的 precision@1 指标从 57.1 提升至 87.9,这一 30 点的提升主要得益于缩放后的合成锚定数据。
- 多图像输入:BLINK 得分从 50.2 提升至 61.5,MuirBench 得分从 34.9 提升至 58.3。
架构与训练
语言模型 backbone 采用 LFM2.5-2.6B。视觉模型采用 SigLIP2 NaFlex 形状优化型 400M 编码器。NaFlex 通过将大尺寸图像分割为互不重叠的 512×512 补丁,并生成一张经过缩放的全图缩略图,来处理原生分辨率。上下文长度为 32,768 个令牌,支持 16 种语言。
预训练使用了约 34T 个令牌。通过就地扩展现有令牌化器,词汇量翻倍至 128K,从而提升了对非拉丁字母脚本的覆盖率。视觉预训练在令牌数量上扩大了 4 倍,数据包括精心整理和合成的图注、OCR、定位以及遵循指令数据。
后训练采用 SFT 方法,结合来自更大规模“教师”模型的知识蒸馏和 Antidoom 训练,随后进行多奖励强化学习。
该模型不进行推理。它直接给出答案,这也是其延迟特性的设计选择。
基准
Liquid AI 使用 vLLM 0.26.0 在非推理模式下,针对 28 个视觉基准测试进行了评估。LFM2.5-VL-3B 的平均得分为 69.4,与 InternVL-3.5-4B (69.4) 持平,但比 Qwen3.5-4B (70.1) 低 0.7 分。这两个对比模型的参数量均为 47 亿。
值得注意的个别结果:RealWorldQA 73.1 对比 InternVL-3.5-4B 67.7,TextVQA 84.3 对比 Qwen3.5-4B 81.2,MMStar 63.3,MathVista-mini 68.5,ChartQA 81.3,DocVQA 91.1,OCRBench v1 84.2。CountBenchQA 从上一版本的 92.2 下降到 87.3。
仅以文本进行评估时,IFEval 得分达到 82.3,高于之前的 72.9。Gemma-4-E4B 仍然以 87.9 的得分领先。
要点总结
- LFM2.5-VL-3B 在 28 项视觉基准测试中平均得分 69.4,与 4.7B 级模型相当。
- ScreenSpot-v2 评分从上一版本的 57.1 跃升至 80.7,RefCOCO-avg 评分从上一版本的 57.1 跃升至 87.9。
- 函数调用是 VL 系列的新功能:ToolSandbox 26.4 → 59.5,BFCL v4 20.5 → 32.5。
- 运行内存约 3 GB,在 M5 Max 上解码速度为 228 tok/s,在 Galaxy S26 Ultra 上解码速度为 20 tok/s。
- LFM Open License v1.0 仅对年收入低于 1000 万美元的商业用途免费开放。
参考资料:
https://www.liquid.ai/blog/lfm2-5-vl-3b
https://huggingface.co/LiquidAI/LFM2.5-VL-3B
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/71132.html