视觉能力解锁,DeepSeek-V4多模态模型开源
DeepSeek-V4系列模型在一个月内迎来了第六次更新。8月31日,该系列首个实验性多模态模型DeepSeek-V4-Flash-Vision-Exp正式开源,此前它已于8月21日上线DeepSeek API平台。这一动作标志着DeepSeek在视觉理解赛道上的首次落子,也为开发者提供了更丰富的多模态工具选择。
架构与能力:从文本到视觉的跨越

这款新模型基于DeepSeek-V4-Flash架构,通过集成视觉模块并经过持续训练,成功解锁了视觉理解能力。基准测试显示,与上一代DeepSeek-V4-Flash-0731相比,新模型在多模态智能体能力上有所提升,在7项纯文本智能体任务中取得了5胜1平1负的成绩,展现出稳健的进步。
实测成绩:多项测试登顶,复杂任务仍有差距

在真实世界软件工程测试DeepSWE中,该模型以59.3%的成绩反超Opus-4.8,排名第一。工具调用能力方面,它在Toolathlon-Verified中得分75.9%,仅落后Opus-4.8 0.3个百分点。然而,在自然语言转代码仓库测试NL2Repo和数据科学测试DSBench-Hard上,它与Opus-4.8仍有约10%的差距,表明在高度复杂、结构化的数据科学任务上仍有优化空间。
多模态方面,在零样本视觉推理测试ZeroBench(Pass@5)和Agents' Last Exam综合智能体测试中,该模型击败Opus-4.8,登顶榜首。

更新节奏:一个月六次迭代
过去一个月,DeepSeek-V4系列完成了多轮密集更新:7月31日,DeepSeek-V4-Flash正式版API上线公测;8月13日,DeepSeek-V4-Pro正式版API发布,同日DeepSeek Harness开发者预览版(v0.1版本)公测并开源;8月19日,DeepSeek Harness迭代至v0.1.0-rc.8版本;8月21日,DeepSeek-V4-Flash-Vision-Exp上线API平台,并于今日正式开源。
高频的版本迭代反映出DeepSeek在模型能力打磨上的急迫感,也透露出其试图在多模态与智能体领域快速卡位的意图。从纯文本到视觉理解,DeepSeek-V4系列正在拓宽能力边界,但数据科学等复杂任务的短板也提醒我们,多模态智能体的完全成熟仍需时日。随着开源生态的参与,后续版本能否补齐这些差距,值得持续关注。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05