DeepSeek V4 首个视觉实验版本开放

8月31日 19:35
它在 Hugging Face 开放权重,采用 MIT 许可,基于 V4-Flash-0731 扩展图像理解,并先以 API 提供图文调用,后续支持本地部署。

DeepSeek 在 Hugging Face 放出 V4 系列首款具备原生图片输入能力的实验视觉模型 DeepSeek-V4-Flash-Vision-Exp,并同步采用 MIT 许可。架构层面,它以 V4-Flash-0731 为基础,加入视觉编码器与对齐模块,从而在原有文本能力之上形成图文混合处理路径。按公开时间安排,该模型先在 2026 年 8 月 21 日进入 DeepSeek API,允许调用方传入文字和图片;大约十天后,权重及本地运行材料才对外公布。

随附资料涵盖模型本体、Tokenizer、提示编码参考代码和一套最小化的 PyTorch 推理脚本,技术栈涉及视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark。图片输入范围包含 JPEG、PNG、GIF 与 WebP,可用于图像说明、截屏文本提取与图表解析。官方将其重心放在多模态 Agent 场景,例如读取网页截图、软件界面和统计图形后继续完成工具调用;Hugging Face 页面同时已有 7 个适配 llama.cpp、LM Studio 与 Ollama 的量化版本。

评测口径显示,加入视觉通路后,文本侧的 Agent、推理与世界知识结果未被明显削弱,整体维持 V4-Flash 正式版的水平。单项成绩中,Terminal Bench 2.1 从 82.7 升至 83.9;DeepSWE 从 54.4 升到 59.3,高于 Opus-4.8 的 58.0。另有七项纯文本智能体测试呈 5 胜 1 平 1 负,Toolathlon-Verified 拿到 75.9%,距离 Opus-4.8 仅 0.3 个百分点;NL2Repo 与 DSBench-Hard 两项则仍有约 10% 的分差。这也让本地部署、二次开发以及面向屏幕信息的自动化工具链获得更开放的起点。