做Agent的开发者应该都有同感——让模型看懂一张截图、解析UI界面、识别表格图表,一直是多模态能力的硬门槛。要么花钱接闭源的GPT-4V,要么自己搭视觉模块,成本和复杂度都不低。DeepSeek今天给出了一个新选择。
V4-Flash-Vision-Exp在Hugging Face正式开源了,这是DeepSeek V4家族第一款"能看图"的实验性模型。305B总参数,每token只激活13B,激活率低到4.6%。MIT协议,可以零成本商用。
跑分很能打。ZeroBench拿到35分,反超了Opus-4.8的34分。真实软件工程测试DeepSWE以59.3%登顶第一。图表理解Chartography 64.3分,文本Agent任务Terminal Bench 83.9分。最关键的,它不只看图厉害,还保留了完整的文本推理和Agent能力——不是砍掉一只翅膀换另一只,是真的两只手都能干活。
开源内容给得也很实在:模型权重、Tokenizer、Prompt Encoding参考实现、最小化PyTorch推理代码,视觉编码器、Aligner、MoE路由、Hyper-Connections这些核心模块全都有。配合mxFP4量化,消费级显卡上也能跑或微调。
对开发者来说,这意味着什么?做一个能读网页截图、能分析Excel图表、能识别APP界面的Agent,不再需要额外接一个视觉服务。一个模型,文本、视觉、Agent全包,部署和调用的复杂度直接砍半。更关键的是,它是开源的,权重在自己手里,不用看API供应商的脸色。
国产大模型从"文本能打"走到"多模态也能打",DeepSeek这一步走得不算早,但够扎实。模型越来越强,接入成本却越来越低。像EasyAPI这类聚合平台,可以把多模型统一接入和路由打包成一层网关,不用为每个模型单独维护对接代码,一个接口就能灵活调用。省下来的时间,比省下来的钱更值钱。


2766

被折叠的 条评论
为什么被折叠?



