众力资讯网

DeepSeek V4-Flash 上视觉了👀 DeepSeek 刚刚在 AP

DeepSeek V4-Flash 上视觉了👀
DeepSeek 刚刚在 API 平台上线了一款实验性多模态模型:
DeepSeek-V4-Flash-Vision-Exp
简单说,它在 V4-Flash 原有的文本、推理和 Agent 能力上,增加了视觉理解。
官方公布的几个重点:
🔹 文本能力与 V4-Flash 相当 包括 Agent、推理和世界知识等能力。
🔹 多模态 Agent 能力明显提升 DeepSeek 称,在相关基准测试中,新模型的表现已经接近 Opus-4.8。注意,这是官方测试结论,还需要更多第三方实测验证。
🔹 支持文字+图片混合输入 图片可以通过 Base64、外部链接或 Files API 传入。
🔹 接入方式比较完整 支持 Chat Completions、Messages 和 Responses 三类接口。
🔹 图片成本相对可控 每张图片最多按 384 tokens 计费,沿用 V4-Flash 的价格。
🔹 Files API 同步上线 目前可以免费使用。图片上传一次后,可以通过 file_id 在不同请求中重复调用,减少重复上传和带宽消耗。
开发者可以直接使用:
model="deepseek-v4-flash-vision-exp"
DeepSeek Harness 也更新到了 0.1.1,已经原生支持这款模型。
我觉得这次更新最值得关注的,是“视觉理解+工具调用”的组合。以后 Agent 不仅能读文字,还可以理解网页截图、图表、操作界面,再接着调用工具完成任务。
不过要注意:目前官方明确的是 API 平台上线,且模型仍处于实验阶段,并不代表 DeepSeek App 或网页版已经同步开放。
你最想让它看图完成什么任务?我先想到的是:看懂网页界面后,自己完成操作。👀
多模态 deepseek