当前位置: 首页 > news >正文

DeepSeek多模态视觉理解模型上线

DeepSeek 又给 V4 系列补上了一块重要拼图。其官方宣布,实验性质的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台。

与此前主要处理文本的 V4-Flash 不同,新模型可以直接接收图片,并将视觉理解能力接入 Agent 工作流。

这也意味着,DeepSeek 的多模态能力开始从模型展示进一步走向 API 服务。

来源:https://api-docs.deepseek.com/updates/

文本能力基本不变,视觉 Agent 能力明显提升

从官方公布的测试结果来看,V4-Flash-Vision-Exp 并不是简单地在文本模型之外“加上看图能力”。

在 Agent、推理、世界知识等纯文本任务上,V4-Flash-Vision-Exp 与正式版 V4-Flash 基本持平。而在需要处理视觉信息的 Agent Benchmark 中,新模型相比 V4-Flash 出现了明显提升。

DeepSeek 特别提到,在 ApexBench、Agents’ Last Exam 等测试中,纯文本版 V4-Flash 会忽略其中包含的多模态元素,因此无法充分完成相关任务。

而加入视觉能力之后,V4-Flash-Vision-Exp 在这些场景中的表现大幅跃升,官方称其多模态 Agent 能力已经接近 Opus-4.8。

多模态能力正式进入 API

对于开发者来说,这次更新更重要的部分还是 API。

据官方介绍,开发者可以通过设置 model='deepseek-v4-flash-vision-exp' 调用新模型。API 支持 Chat Completions、Messages 和 Responses 三种调用格式,可以直接接入现有 Agent 框架。

在输入方式上,模型支持图文混合输入,图片可以通过三种方式传入:

  • Base64 内联

  • 外部 URL

  • Files API

图片在 API 服务中会转换成 Token 进行计费,单张图片最多占用 384 Tokens,价格则与 V4-Flash 保持一致。

这意味着开发者不需要为多模态能力单独适配一套完全不同的调用方式,现有的 Agent 工作流也可以比较方便地加入视觉输入。

Files API 同步上线

与多模态 API 一起开放的,还有 DeepSeek 的 Files API。它主要解决的是图片重复上传的问题。

开发者可以先把图片上传到 DeepSeek 平台,之后在请求中直接通过 file_id 引用。这样一来,同一张图片需要被多次调用时,就不必每次都重新上传,也能减少请求过程中的带宽消耗。目前 Files API 不收取费用。

从这次更新来看,DeepSeek 正在把视觉能力与 Agent 工具调用进一步结合起来,而不是仅仅增加一个“图片输入”的模型接口。

当然,V4-Flash-Vision-Exp 目前仍然带有 Exp(Experimental) 标识,意味着它本质上还是实验性质的模型。实际效果、稳定性以及后续是否进入正式版本,仍需要更多开发者使用和测试。

但至少从 API 开放这一点来看,DeepSeek V4 系列已经开始从纯文本 Agent,向能够同时处理文字、图片和工具的多模态 Agent 继续迈进。

来源:V4-Flash-Vision-Exp 上线,开启多模态 API 服务

http://www.cnnetsun.cn/news/4197115.html

相关文章:

  • 从数学建模到工业优化:数据驱动下的催化剂组合与反应条件智能寻优
  • 基于改进MOEA/D的双目标模糊柔性作业车间调度优化
  • 计算机毕业设计之会议预约系统设计与实现
  • AI Agent 面试题 362:如何设计Agent的工具依赖管理和冲突解决?
  • ESP32 下载失败自救指南:5 分钟定位 4 类故障现场,3 条备用通路一次讲清
  • 【BFS/DFS 解决 FloodFill 算法】图像渲染
  • libuiohook 全局键盘鼠标钩子 C 库入门指南
  • GoldenDict-ng:免费词典查询工具,从装好到查出第一个词的 3 分钟攻略
  • [SQL]数据库设计手记:从范式到窗口函数,一个开发者的实战笔记
  • 番茄小说下载器 fanqienovel-downloader 完整指南:输入一个 id,整本书存成离线电子书
  • ESP32局域网实时音频流硬件链路搭建与四大经典坑位解析
  • [C++]《C++ 开发避坑指南:从基础类型到高级构造的常见问题与解决方案》
  • 零成本AI建站:用Kimi K3+Vercel快速生成部署个人网页
  • 大模型后训练护栏如何塑造统一文风并使其文本可被检测
  • VLA模型本地部署实战:从环境搭建到项目包装的完整指南
  • CTIFoundry:索引时构建结构,如何提升智能体F1分数与RAG效果
  • 深入解析TCP状态机:从协议原理到Linux内核实现与故障排查
  • 2026优质SEOGEO服务商精选:7家全栈机构测评+企业选型避坑全攻略
  • 【单片机毕业设计推荐】基于 STM32 的多模式智能门禁锁系统设计与实现 基于 STM32 的指纹刷卡密码门禁及阿里云远程控制系统设计(012507)
  • p和np问题
  • 去除马赛克视频播放器+视频教程
  • 带货视频生成工具全流程项目复盘
  • Linux下Nvidia显卡风扇控制:从底层原理到systemd服务实战
  • ncmdump 拖拽即转:NCM 无损变 MP3,整专辑 3 分钟批量搞定,告别在线转换
  • 华为OD机试:数列计算与斐波那契优化实战
  • QModMaster:ModBus 调试工具使用指南
  • DFT硅后诊断与良率提升技术
  • 用Jellyfin搭家庭照片服务器:3步建好私有云相册
  • 【计算机毕业设计单片机案例】集成 JQ8400 语音播报的病床无线呼叫硬件系统设计 基于 STM32/51 单片机的医患双向呼叫信号采集系统设计(020204)
  • 在树莓派上配置yolo