国内模型多模态与视觉理解能力说明

标签口径

  • 视觉理解=是:模型可以接收图片或视频等视觉输入,并输出文本形式的识别、分析、问答或推理结果。
  • 视觉理解=部分:模型可以处理视觉语义,但输出通常是向量或检索特征,不直接输出自然语言问答。
  • 视觉理解=否:模型属于文本生成、图像生成、视频生成、3D 生成等能力,不作为视觉问答/理解模型标注。
  • 多模态=是:模型涉及两种或以上模态的输入或输出,例如文本到视频、图片到向量、文本/图片/视频到文本。

模型清单

常用文本模型

文本输入、文本输出的语言模型,适用于对话、写作、代码、翻译、推理和 Agent 等常规任务。

模型名称生产商支持视觉理解是否多模态输入模态输出模态标签
qwen3.7-max阿里云 / 通义千问文本文本文本生成、推理/编码、Agent
qwen3.6-max-preview阿里云 / 通义千问文本文本文本生成、推理/编码、Agent
qwen3-max阿里云 / 通义千问文本文本文本生成、推理/编码、Agent
qwen3-max-preview阿里云 / 通义千问文本文本文本生成、推理/编码、Agent
doubao-seed-character火山引擎 / 豆包文本文本文本生成
doubao-seed-code火山引擎 / 豆包文本文本文本生成
doubao-seed-translation火山引擎 / 豆包文本文本文本生成
doubao-seed-2.0-code火山引擎 / 豆包文本文本文本生成
doubao-seed-1.6-lite火山引擎 / 豆包文本文本文本生成
doubao-1.5-lite-32k火山引擎 / 豆包文本文本文本生成
doubao-1.5-pro-32k火山引擎 / 豆包文本文本文本生成
glm-5.2智谱 AI文本文本文本生成、Agent/Coding
glm-5.1智谱 AI文本文本文本生成、Agent/Coding
glm-5智谱 AI文本文本文本生成、Agent/Coding
glm-4.7智谱 AI文本文本文本生成、Agent/Coding
deepseek-v4-flashDeepSeek文本文本文本生成、推理/编码
deepseek-v4-proDeepSeek文本文本文本生成、推理/编码
deepseek-v3.2DeepSeek文本文本文本生成、推理/编码
deepseek-r1DeepSeek文本文本文本生成、推理/编码
MiniMax-m2.7MiniMax文本文本文本生成、Agent/Coding、工具调用
MiniMax-m2.5MiniMax文本文本文本生成、Agent/Coding、工具调用

多模态/视觉理解模型

可接收图片或视频等视觉输入,并输出文本理解结果,适合视觉问答、图文分析、截图/票据/表格识别等场景。

模型名称生产商支持视觉理解是否多模态输入模态输出模态标签
qwen3.7-plus阿里云 / 通义千问文本、图像、视频文本多模态、视觉理解、视频理解、文本生成、上下文
qwen3.6-flash阿里云 / 通义千问文本、图像、视频文本多模态、视觉理解、视频理解、文本生成、上下文
qwen3.6-plus阿里云 / 通义千问文本、图像、视频文本多模态、视觉理解、视频理解、文本生成、上下文
qwen3.5-flash阿里云 / 通义千问文本、图像、视频文本多模态、视觉理解、视频理解、文本生成、上下文
qwen3.5-plus阿里云 / 通义千问文本、图像、视频文本多模态、视觉理解、视频理解、文本生成、上下文
doubao-seed-2.0-lite火山引擎 / 豆包文本、图片、视频文本多模态、视觉理解、视频理解、深度思考、文本生成
doubao-seed-2.0-lite(音频输入)火山引擎 / 豆包文本、图片、视频、音频文本多模态、视觉理解、视频理解、音频输入、深度思考、文本生成
doubao-seed-2.0-mini火山引擎 / 豆包文本、图片、视频文本多模态、视觉理解、视频理解、深度思考、文本生成
doubao-seed-2.0-mini(音频输入)火山引擎 / 豆包文本、图片、视频、音频文本多模态、视觉理解、视频理解、音频输入、深度思考、文本生成
doubao-seed-2.0-pro火山引擎 / 豆包文本、图片、视频文本多模态、视觉理解、视频理解、深度思考、文本生成
doubao-seed-1.8火山引擎 / 豆包文本、图片、视频文本多模态、视觉理解、视频理解、深度思考、文本生成
doubao-seed-1.6火山引擎 / 豆包文本、图片、视频文本多模态、视觉理解、视频理解、深度思考、文本生成
doubao-seed-1.6-flash火山引擎 / 豆包文本、图片、视频文本多模态、视觉理解、视频理解、深度思考、文本生成
doubao-seed-1.6-vision火山引擎 / 豆包文本、图片、视频文本多模态、视觉理解、视频理解、深度思考、文本生成
doubao-1.5-vision-pro火山引擎 / 豆包文本、图片、视频文本多模态、视觉理解、视频理解、文本生成
kimi-k2.6月之暗面 / Kimi文本、图片、视频文本多模态、视觉理解、视频理解、文本生成、Agent/Coding
kimi-k2.5月之暗面 / Kimi文本、图片文本多模态、视觉理解、文本生成、Agent/Coding

视觉语义/向量模型

将文本、图片或视频映射为向量,用于多模态检索、相似度召回和图文/视频搜索,不直接输出自然语言问答。

模型名称生产商支持视觉理解是否多模态输入模态输出模态标签
qwen3-vl-embedding阿里云 / 通义千问部分文本、图像、视频向量多模态、视觉语义、Embedding、图文/视频检索
doubao-embedding-vision火山引擎 / 豆包部分文本、图片、视频向量多模态、视觉语义、Embedding、图文/视频检索

图像、视频和 3D 生成模型

用于文生图、图生图、文生视频、图生视频、3D 资产生成等内容生产场景,不按视觉问答类模型标注。

模型名称生产商支持视觉理解是否多模态输入模态输出模态标签
doubao-seedream-5.0-lite火山引擎 / 豆包文本、图片图片多模态、图像生成、图片编辑、文生图/图生图
doubao-seedream-4.5火山引擎 / 豆包文本、图片图片多模态、图像生成、图片编辑、文生图/图生图
doubao-seedream-4.0火山引擎 / 豆包文本、图片图片多模态、图像生成、图片编辑、文生图/图生图
doubao-seed3d-2.0火山引擎 / 豆包文本、图片3D模型多模态、3D生成、文生3D、图生3D
doubao-seedance-2.0火山引擎 / 豆包文本、图片、视频、音频(需搭配图片/视频)视频多模态、视频生成、文生视频、图生视频、视频参考输入、音频输入
doubao-seedance-2.0-fast火山引擎 / 豆包文本、图片、视频、音频(需搭配图片/视频)视频多模态、视频生成、文生视频、图生视频、视频参考输入、音频输入
doubao-seedance-2.0-mini火山引擎 / 豆包文本、图片、视频、音频(需搭配图片/视频)视频多模态、视频生成、文生视频、图生视频、视频参考输入、音频输入
doubao-seedance-1.5-pro火山引擎 / 豆包文本、图片视频多模态、视频生成、文生视频、图生视频
doubao-seedance-1.0-pro火山引擎 / 豆包文本、图片视频多模态、视频生成、文生视频、图生视频
doubao-seedance-1.0-pro-fast火山引擎 / 豆包文本、图片视频多模态、视频生成、文生视频、图生视频
happyhorse-1.0-i2v阿里云 / HappyHorse文本、图片视频多模态、视频生成、图生视频
happyhorse-1.0-r2v阿里云 / HappyHorse文本、参考素材视频多模态、视频生成、参考生视频
happyhorse-1.0-t2v阿里云 / HappyHorse文本视频跨模态生成、视频生成、文生视频
Hitem3D-2.0阿里云 / 3D 生成文本、图片3D模型多模态、3D生成、文生3D、图生3D
Hyper3D-Gen2阿里云 / 3D 生成文本、图片3D模型多模态、3D生成、文生3D、图生3D
联系我们
预约咨询
微信咨询
电话咨询
邮件咨询