国内模型多模态与视觉理解能力说明
标签口径
- 视觉理解=是:模型可以接收图片或视频等视觉输入,并输出文本形式的识别、分析、问答或推理结果。
- 视觉理解=部分:模型可以处理视觉语义,但输出通常是向量或检索特征,不直接输出自然语言问答。
- 视觉理解=否:模型属于文本生成、图像生成、视频生成、3D 生成等能力,不作为视觉问答/理解模型标注。
- 多模态=是:模型涉及两种或以上模态的输入或输出,例如文本到视频、图片到向量、文本/图片/视频到文本。
模型清单
常用文本模型
文本输入、文本输出的语言模型,适用于对话、写作、代码、翻译、推理和 Agent 等常规任务。
| 模型名称 | 生产商 | 支持视觉理解 | 是否多模态 | 输入模态 | 输出模态 | 标签 |
|---|---|---|---|---|---|---|
| qwen3.7-max | 阿里云 / 通义千问 | 否 | 否 | 文本 | 文本 | 文本生成、推理/编码、Agent |
| qwen3.6-max-preview | 阿里云 / 通义千问 | 否 | 否 | 文本 | 文本 | 文本生成、推理/编码、Agent |
| qwen3-max | 阿里云 / 通义千问 | 否 | 否 | 文本 | 文本 | 文本生成、推理/编码、Agent |
| qwen3-max-preview | 阿里云 / 通义千问 | 否 | 否 | 文本 | 文本 | 文本生成、推理/编码、Agent |
| doubao-seed-character | 火山引擎 / 豆包 | 否 | 否 | 文本 | 文本 | 文本生成 |
| doubao-seed-code | 火山引擎 / 豆包 | 否 | 否 | 文本 | 文本 | 文本生成 |
| doubao-seed-translation | 火山引擎 / 豆包 | 否 | 否 | 文本 | 文本 | 文本生成 |
| doubao-seed-2.0-code | 火山引擎 / 豆包 | 否 | 否 | 文本 | 文本 | 文本生成 |
| doubao-seed-1.6-lite | 火山引擎 / 豆包 | 否 | 否 | 文本 | 文本 | 文本生成 |
| doubao-1.5-lite-32k | 火山引擎 / 豆包 | 否 | 否 | 文本 | 文本 | 文本生成 |
| doubao-1.5-pro-32k | 火山引擎 / 豆包 | 否 | 否 | 文本 | 文本 | 文本生成 |
| glm-5.2 | 智谱 AI | 否 | 否 | 文本 | 文本 | 文本生成、Agent/Coding |
| glm-5.1 | 智谱 AI | 否 | 否 | 文本 | 文本 | 文本生成、Agent/Coding |
| glm-5 | 智谱 AI | 否 | 否 | 文本 | 文本 | 文本生成、Agent/Coding |
| glm-4.7 | 智谱 AI | 否 | 否 | 文本 | 文本 | 文本生成、Agent/Coding |
| deepseek-v4-flash | DeepSeek | 否 | 否 | 文本 | 文本 | 文本生成、推理/编码 |
| deepseek-v4-pro | DeepSeek | 否 | 否 | 文本 | 文本 | 文本生成、推理/编码 |
| deepseek-v3.2 | DeepSeek | 否 | 否 | 文本 | 文本 | 文本生成、推理/编码 |
| deepseek-r1 | DeepSeek | 否 | 否 | 文本 | 文本 | 文本生成、推理/编码 |
| MiniMax-m2.7 | MiniMax | 否 | 否 | 文本 | 文本 | 文本生成、Agent/Coding、工具调用 |
| MiniMax-m2.5 | MiniMax | 否 | 否 | 文本 | 文本 | 文本生成、Agent/Coding、工具调用 |
多模态/视觉理解模型
可接收图片或视频等视觉输入,并输出文本理解结果,适合视觉问答、图文分析、截图/票据/表格识别等场景。
| 模型名称 | 生产商 | 支持视觉理解 | 是否多模态 | 输入模态 | 输出模态 | 标签 |
|---|---|---|---|---|---|---|
| qwen3.7-plus | 阿里云 / 通义千问 | 是 | 是 | 文本、图像、视频 | 文本 | 多模态、视觉理解、视频理解、文本生成、上下文 |
| qwen3.6-flash | 阿里云 / 通义千问 | 是 | 是 | 文本、图像、视频 | 文本 | 多模态、视觉理解、视频理解、文本生成、上下文 |
| qwen3.6-plus | 阿里云 / 通义千问 | 是 | 是 | 文本、图像、视频 | 文本 | 多模态、视觉理解、视频理解、文本生成、上下文 |
| qwen3.5-flash | 阿里云 / 通义千问 | 是 | 是 | 文本、图像、视频 | 文本 | 多模态、视觉理解、视频理解、文本生成、上下文 |
| qwen3.5-plus | 阿里云 / 通义千问 | 是 | 是 | 文本、图像、视频 | 文本 | 多模态、视觉理解、视频理解、文本生成、上下文 |
| doubao-seed-2.0-lite | 火山引擎 / 豆包 | 是 | 是 | 文本、图片、视频 | 文本 | 多模态、视觉理解、视频理解、深度思考、文本生成 |
| doubao-seed-2.0-lite(音频输入) | 火山引擎 / 豆包 | 是 | 是 | 文本、图片、视频、音频 | 文本 | 多模态、视觉理解、视频理解、音频输入、深度思考、文本生成 |
| doubao-seed-2.0-mini | 火山引擎 / 豆包 | 是 | 是 | 文本、图片、视频 | 文本 | 多模态、视觉理解、视频理解、深度思考、文本生成 |
| doubao-seed-2.0-mini(音频输入) | 火山引擎 / 豆包 | 是 | 是 | 文本、图片、视频、音频 | 文本 | 多模态、视觉理解、视频理解、音频输入、深度思考、文本生成 |
| doubao-seed-2.0-pro | 火山引擎 / 豆包 | 是 | 是 | 文本、图片、视频 | 文本 | 多模态、视觉理解、视频理解、深度思考、文本生成 |
| doubao-seed-1.8 | 火山引擎 / 豆包 | 是 | 是 | 文本、图片、视频 | 文本 | 多模态、视觉理解、视频理解、深度思考、文本生成 |
| doubao-seed-1.6 | 火山引擎 / 豆包 | 是 | 是 | 文本、图片、视频 | 文本 | 多模态、视觉理解、视频理解、深度思考、文本生成 |
| doubao-seed-1.6-flash | 火山引擎 / 豆包 | 是 | 是 | 文本、图片、视频 | 文本 | 多模态、视觉理解、视频理解、深度思考、文本生成 |
| doubao-seed-1.6-vision | 火山引擎 / 豆包 | 是 | 是 | 文本、图片、视频 | 文本 | 多模态、视觉理解、视频理解、深度思考、文本生成 |
| doubao-1.5-vision-pro | 火山引擎 / 豆包 | 是 | 是 | 文本、图片、视频 | 文本 | 多模态、视觉理解、视频理解、文本生成 |
| kimi-k2.6 | 月之暗面 / Kimi | 是 | 是 | 文本、图片、视频 | 文本 | 多模态、视觉理解、视频理解、文本生成、Agent/Coding |
| kimi-k2.5 | 月之暗面 / Kimi | 是 | 是 | 文本、图片 | 文本 | 多模态、视觉理解、文本生成、Agent/Coding |
视觉语义/向量模型
将文本、图片或视频映射为向量,用于多模态检索、相似度召回和图文/视频搜索,不直接输出自然语言问答。
| 模型名称 | 生产商 | 支持视觉理解 | 是否多模态 | 输入模态 | 输出模态 | 标签 |
|---|---|---|---|---|---|---|
| qwen3-vl-embedding | 阿里云 / 通义千问 | 部分 | 是 | 文本、图像、视频 | 向量 | 多模态、视觉语义、Embedding、图文/视频检索 |
| doubao-embedding-vision | 火山引擎 / 豆包 | 部分 | 是 | 文本、图片、视频 | 向量 | 多模态、视觉语义、Embedding、图文/视频检索 |
图像、视频和 3D 生成模型
用于文生图、图生图、文生视频、图生视频、3D 资产生成等内容生产场景,不按视觉问答类模型标注。
| 模型名称 | 生产商 | 支持视觉理解 | 是否多模态 | 输入模态 | 输出模态 | 标签 |
|---|---|---|---|---|---|---|
| doubao-seedream-5.0-lite | 火山引擎 / 豆包 | 否 | 是 | 文本、图片 | 图片 | 多模态、图像生成、图片编辑、文生图/图生图 |
| doubao-seedream-4.5 | 火山引擎 / 豆包 | 否 | 是 | 文本、图片 | 图片 | 多模态、图像生成、图片编辑、文生图/图生图 |
| doubao-seedream-4.0 | 火山引擎 / 豆包 | 否 | 是 | 文本、图片 | 图片 | 多模态、图像生成、图片编辑、文生图/图生图 |
| doubao-seed3d-2.0 | 火山引擎 / 豆包 | 否 | 是 | 文本、图片 | 3D模型 | 多模态、3D生成、文生3D、图生3D |
| doubao-seedance-2.0 | 火山引擎 / 豆包 | 否 | 是 | 文本、图片、视频、音频(需搭配图片/视频) | 视频 | 多模态、视频生成、文生视频、图生视频、视频参考输入、音频输入 |
| doubao-seedance-2.0-fast | 火山引擎 / 豆包 | 否 | 是 | 文本、图片、视频、音频(需搭配图片/视频) | 视频 | 多模态、视频生成、文生视频、图生视频、视频参考输入、音频输入 |
| doubao-seedance-2.0-mini | 火山引擎 / 豆包 | 否 | 是 | 文本、图片、视频、音频(需搭配图片/视频) | 视频 | 多模态、视频生成、文生视频、图生视频、视频参考输入、音频输入 |
| doubao-seedance-1.5-pro | 火山引擎 / 豆包 | 否 | 是 | 文本、图片 | 视频 | 多模态、视频生成、文生视频、图生视频 |
| doubao-seedance-1.0-pro | 火山引擎 / 豆包 | 否 | 是 | 文本、图片 | 视频 | 多模态、视频生成、文生视频、图生视频 |
| doubao-seedance-1.0-pro-fast | 火山引擎 / 豆包 | 否 | 是 | 文本、图片 | 视频 | 多模态、视频生成、文生视频、图生视频 |
| happyhorse-1.0-i2v | 阿里云 / HappyHorse | 否 | 是 | 文本、图片 | 视频 | 多模态、视频生成、图生视频 |
| happyhorse-1.0-r2v | 阿里云 / HappyHorse | 否 | 是 | 文本、参考素材 | 视频 | 多模态、视频生成、参考生视频 |
| happyhorse-1.0-t2v | 阿里云 / HappyHorse | 否 | 是 | 文本 | 视频 | 跨模态生成、视频生成、文生视频 |
| Hitem3D-2.0 | 阿里云 / 3D 生成 | 否 | 是 | 文本、图片 | 3D模型 | 多模态、3D生成、文生3D、图生3D |
| Hyper3D-Gen2 | 阿里云 / 3D 生成 | 否 | 是 | 文本、图片 | 3D模型 | 多模态、3D生成、文生3D、图生3D |
联系我们
