一个3B模型,把屏幕理解做到了80.7分
Liquid AI 今天发布的 LFM2.5-VL-3B,用 3B 参数在屏幕理解上超过更大的模型,还能跑在手机上。读懂屏幕、调用工具、离线运行,小模型的 Agent 时代可能要来了。
今天,Liquid AI 发布了一个 3B 参数的视觉语言模型,LFM2.5-VL-3B。它最擅长的是看屏幕,不是聊天。
最抢眼的数字是 ScreenSpot-v2 的 80.7。这个成绩比 8B 的 Gemma-4-E4B(51.2)高了近 30 分,也超过了不少 4B 级模型。一个 3B 模型,在屏幕理解上把更大的模型甩在身后,这比“大模型又刷了个榜”有意思得多。

模型基于 LFM2.5-2.6B 文本底座,加上 SigLIP2 400M 视觉编码器。预训练约 34T tokens,词表扩大到 128K,上下文长度 32K,支持 16 种语言。它是一个非推理模型,直接给答案,不输出思考过程,所以延迟很低。它支持移动端、网页和桌面屏幕理解,能把物体定位到坐标,读文档和图表,还能从文本或图像输入直接调用工具。
其他基准同样不弱:RealWorldQA 73.1,超过 InternVL-3.5-4B 的 67.7;TextVQA 84.3,超过 Qwen3.5-4B 的 81.2。更明显的是提升幅度:视觉定位 RefCOCO 从 57.1 涨到 87.9,工具调用 ToolSandbox 从 26.4 翻倍到 59.5。上一代做不到的事,这一代补上了。
小模型的价值在部署端体现得更直接。LFM2.5-VL-3B 在 Apple M5 Max 上解码 228 tokens/s,在 AMD Ryzen AI Max+ 395 上 116 tokens/s,内存占用约 3GB。它甚至能在 Galaxy S26 Ultra 上跑出 20 tokens/s。一个能读屏、能调工具的视觉模型,现在可以完全离线运行在手机里。

GPU 上的表现也值得一提。单张 H100 上,5帧视频片段的首 token 延迟约 34ms,Gemma 系列要 200ms。高并发下输出吞吐约 11K tokens/s,接近 4B 级模型的两倍。算下来,单卡一天能生成近 10 亿 tokens。

训练上,Liquid AI 把视觉预训练数据量扩大了 4 倍,用知识蒸馏和多奖励 RL 做对齐。词表是通过原地扩展完成的,没从头训。模型发布当天就支持 llama.cpp、MLX、vLLM、SGLang、ONNX,属于端到端都给你铺好了路。
社区里已经有人开始玩了。有网友说,3B 模型做到 80.7 的 ScreenSpot,比大模型刷榜更有价值。也有网友在纯 CPU 笔记本上跑出了 10 tokens/s 的图表分析速度。当然,也有人抱怨 Playground 里找不到新模型——发布日的常规操作。
模型已经开放权重,可以在 Hugging Face 下载。官方还提供了 [Playground](https://playground.liquid.ai/chat?model=LFM2.5-VL-3B)、[文档](https://docs.liquid.ai/lfm/models/lfm25-vl-3b) 和[演示视频](https://www.youtube.com/playlist?list=PLVuOiwBjnwy8)。
一个能跑在手机上的 3B 模型,把屏幕理解做到了 80 分以上。这不是实验室里的玩具。对做 Agent 的人来说,这意味着很多场景可以不用再依赖云端大模型。数据不出设备,延迟更低,成本也低得多。未来的 Agent,也许就藏在手机里。一个 3B 模型,够了。
发布时间: 2026-08-13 13:45