原创DeepSeek V4 多模态模型开源,Agent 能力接近 Opus4.8
DeepSeek V4 Flash Vision Exp是 DeepSeek V4 系列首款多模态模型,现已登陆 Hugging Face 并以 MIT 协议开源。项目提供权重、分词器以及 PyTorch 推理示例,涵盖全部核心模块。该模型支持图片输入,识图、OCR、解析图表都能完成,文本能力延续 V4Flash,多模态 Agent 表现接近 Opus4.8。
一、开源相关情况
1、开源资源说明:采用 MIT 协议开源,提供权重、分词器和完整的最简推理参考代码。
2、模块完整度:示例代码包含视觉编码器、MoE 等全部关键核心组件。
3、上线进度:8 月 21 日下午就已经在官方 API 文档页面提前露出该模型。
二、图像使用能力
1、图片输入支持:属于 V4 系列首个原生视觉模型,可接收图片搭配文本进行交互。
2、图像任务范围:支持看图描述、截图文字识别、图表解析,兼容市面上主流图片格式。
三、模型性能表现
1、Agent 适配效果:适配多种智能 Agent 框架,可调用工具,适用于各类实际业务场景。
2、文本基准能力:纯文本推理、知识问答任务,性能看齐 V4Flash 正式版本。
3、多模态水准:视觉 Agent 相比旧版提升很大,综合能力接近 Opus4.8 水平。