DeepSeek 为 V4-Flash 增加了视觉能力,并推出实验版本 DeepSeek-V4-Flash-Vision-Exp。这个版本已经通过 deepseek-v4-flash-vision-exp 这一 model id 在 DeepSeek API 平台开放调用。
这次更新的价值不只是“模型能看图”了。更关键的是,视觉能力被补进了一个原本就面向 Agent、推理和世界知识任务的模型系列,意味着同一个工作流可以同时处理文本、截图、文档图片和界面状态。
纯文本能力保持稳定
从摘要披露的信息看,Vision-Exp 在纯文本能力上没有相对 V4-Flash 正式版降级,覆盖 Agent、推理、世界知识等能力。
这对实际接入很重要。多模态模型经常面临一个取舍:加入视觉编码能力后,文本推理、工具调用或长流程稳定性可能受到影响。如果 Vision-Exp 能在文本任务上保持 V4-Flash 的表现,开发者就不必为文本和视觉任务维护两套完全不同的模型路由。
可以把它理解为一条更简单的调用路径:
- 普通问答继续发送纯文本。
- 用户上传截图时,直接增加图片内容。
- Agent 观察网页或应用界面时,把当前画面作为输入交给同一个模型。
- 后续的推理、规划和工具调用仍然沿用原有 Agent 流程。
不过,Vision-Exp 仍然是实验版本。生产系统需要通过自己的数据集确认文本回归、响应延迟、成本、图片尺寸限制和错误处理行为,不能只根据公开指标切换默认模型。
视觉能力改变了 Agent 的输入边界
视觉能力的真正用处,不是让聊天机器人描述一张图片,而是让 Agent 能够读取过去只能由人眼判断的状态。
例如,一个自动化 Agent 可以观察:
- 网页是否出现登录失效、验证码或弹窗。
- 数据看板中的趋势图是否异常。
- 移动应用当前停留在哪个页面。
- 扫描件、表格截图或流程图中的关键信息。
- IDE、终端和后台管理系统中的错误提示。
这会减少很多脆弱的结构化适配代码。过去,Agent 可能只能依赖 DOM、固定 CSS 选择器或专用 OCR;当页面结构变化时,自动化流程就会中断。视觉模型可以作为另一层观察手段,帮助系统理解“当前画面发生了什么”。
但视觉输入也带来新的边界。截图中的文字可能模糊,图表读数可能被误判,页面上的按钮状态也可能因为遮挡或分辨率不足而识别错误。因此,涉及付款、删除、发布、权限变更等高风险操作时,视觉判断应当触发确认或二次校验,而不是直接执行。
用 API 试跑一个视觉请求
下面是一个可以改造的 curl 示例。它假设 DeepSeek API 使用 OpenAI 兼容的聊天接口和多模态消息格式;实际使用前,请以 DeepSeek API 控制台中的 endpoint、鉴权方式和图片输入要求为准。
将 YOUR_DEEPSEEK_API_KEY 替换为 API Key,将图片 URL 换成可访问的图片地址:
curl https://api.deepseek.com/chat/completions \
-H 'Content-Type: application/json' \
-H 'Authorization: Bearer YOUR_DEEPSEEK_API_KEY' \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "请读取这张后台截图:指出最严重的异常,并给出下一步排查建议。不要臆测截图中没有出现的信息。"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/dashboard.png"
}
}
]
}
],
"temperature": 0.2
}'
对于 Agent 场景,建议把视觉观察和动作执行拆成两个阶段。模型先输出结构化观察结果,再由程序判断是否允许调用工具:
{
"observation": "页面显示订单列表,顶部出现会话已过期提示",
"confidence": 0.93,
"next_action": "request_relogin",
"requires_confirmation": false
}
这里的字段是应用层设计示例,不是模型 API 的固定返回格式。实际项目中可以使用 JSON Schema、函数调用或服务端解析逻辑约束输出,并为无法解析的结果设置重试和人工接管路径。
接入时应重点验证什么
建议用一组同时包含文本和视觉任务的回归集评估模型,而不是只跑几张清晰截图:
- 纯文本 Agent 是否仍能正确规划多步任务。
- 图片中的小字、表格、图表和错误提示是否能被识别。
- 同一张图片重复请求时,关键结论是否稳定。
- 图片加载失败、格式不支持或内容不清晰时,模型是否明确拒答或请求补充信息。
- 视觉判断与工具调用之间是否存在越权风险。
- 平均延迟、峰值延迟和单次请求成本是否满足业务要求。
可以采用分阶段路由:纯文本请求继续使用稳定版本;包含图片的请求先送到 Vision-Exp;当模型无法确认关键状态时,转入人工审核或专用 OCR、规则引擎。这样既能利用视觉能力,也不会把实验模型直接变成所有业务的单点依赖。
结语:值得试用,但要把它当实验能力管理
deepseek-v4-flash-vision-exp 让 V4-Flash 从文本 Agent 向多模态 Agent 迈出了一步。纯文本能力不降级这一点,降低了统一模型路由的迁移成本;视觉能力的加入,则扩展了 Agent 能够观察和操作的现实环境。
它适合从低风险、可回放的任务开始验证,例如截图分类、后台状态诊断、文档初步抽取和 UI 测试辅助。对于支付、删除、发布和权限管理等操作,应保留结构化校验、权限控制和人工确认。等自己的回归数据、稳定性指标和成本模型跑通之后,再决定是否扩大流量。