一、评估背景:为什么需要一份大厂通用大模型的专属评估?
2026年,中国大模型行业进入“落地为王”的新阶段。从调用量看,中国大模型单周调用量已连续十四周超过美国,全球调用量排名前五均为中国AI大模型。从商业化看,字节豆包日均Token调用量突破180万亿,大模型业务ARR(年化收入)达40亿美元;小米MiMo单周调用量达10.5万亿Token,登顶全球榜首。从技术看,阿里Qwen3.8-Max总参数突破2.4万亿,正式进入“两万亿俱乐部”;美团LongCat-2.0成为业界首个在五万卡国产算力集群上完成全流程训练的万亿参数模型。
然而,大厂通用大模型的评估逻辑与DeepSeek、智谱AI等独立AI厂商的通用大模型存在很大差异,这也是海比研究院将“大厂系”与“独立系”分开两篇文章进行评估的核心原因。
两者最大的区别在于:大厂大模型的竞争是“生态级”的,独立厂商大模型的竞争是“技术级”的。
大厂拥有独立厂商无法复制的三重壁垒:一是场景壁垒——阿里有电商和云计算,腾讯有社交和游戏,字节有推荐引擎和短视频,华为有鸿蒙和昇腾,小米有“人车家”全生态,这些场景既是大模型天然的“试验场”,也是其商业变现的核心通道。二是资源壁垒——大厂在AI领域的年度投入以百亿计,拥有万卡乃至十万卡集群的算力储备,以及数万人的算法工程师团队。三是生态壁垒——大厂可以将大模型与云服务、办公软件、操作系统、智能终端深度绑定,形成“模型+平台+应用”的完整闭环。
相比之下,DeepSeek、智谱AI、月之暗面等独立厂商的通用大模型,其竞争焦点更多集中在模型架构的原创性、训练效率的突破和开源生态的建设上,没有大厂的场景和资源背书,只能靠“技术硬实力”说话。
因此,大厂通用大模型的选型评估,必须将上述生态和资源的差异纳入考量——选大厂的模型,往往选的是一个“模型+算力+场景+生态”的综合体。这正是本次评估的核心视角,也是本报告区别于独立厂商大模型评估的根本所在。
然而,市面上的大模型评测报告,大多以通用能力和C端体验为核心指标,无法回答用户最关心的问题:“这个模型在我的业务场景中表现如何?”“调用成本是否合理?”“生态是否开放、能否长期依赖?”正是基于这一需求缺口,海比研究院联合清华大学、北京大学、中国信通院等权威机构的知名专家,对海比研究院“数智产品六力评估模型”进行了专门优化,形成了适用于大厂通用大模型的专属评估体系。
二、海比研究院大厂通用大模型六力评估模型
海比研究院在“数智产品六力评估模型”标准版基础上,针对大厂通用大模型“技术驱动、生态为王、商业化验证”的特性,对评估模型进行了专门优化,形成本评估框架。
评估模型权重配置
维度 |
权重 |
评估核心 |
品牌能力 |
12% |
行业排名、调用量规模、厂商战略定位 |
产品能力 |
22% |
多模态能力、模型尺寸覆盖、产品形态丰富度、应用场景深度 |
技术能力 |
26% |
架构原创性、训练效率、评测成绩、国产算力适配 |
服务能力 |
14% |
MaaS平台成熟度、开发者生态、商业化套餐 |
安全能力 |
16% |
数据安全、合规认证、开源可信 |
价值能力 |
10% |
商业化收入、赋能规模、性价比 |
本次评估对象:十家国内大厂通用大模型
序号 |
厂商 |
大模型体系 |
2026年核心动态 |
1 |
阿里巴巴 |
通义千问(Qwen) |
8月3日发布Qwen3.8-Max,总参数2.4万亿 |
2 |
百度 |
文心大模型(ERNIE) |
5月发布文心5.1,预训练成本仅为业界6% |
3 |
腾讯 |
混元大模型(Hunyuan) |
7月正式发布Hy3,调用量一周增长超68倍 |
4 |
字节跳动 |
豆包(Seed) |
日均Token调用量突破180万亿,ARR达40亿美元 |
5 |
华为 |
盘古(openPangu) |
6月开源openPangu 2.0,深度适配昇腾算力 |
6 |
小米 |
MiMo |
4月公测,7月端侧模型通过国家备案 |
7 |
美团 |
LongCat |
6月发布LongCat-2.0,1.6万亿参数,全国产算力训练 |
8 |
快手 |
快意/ 可灵AI |
可灵AI完成近30亿美元融资,估值180亿美元 |
9 |
京东 |
JoyAI |
7月WAIC首次系统展示JoyAI模型矩阵 |
10 |
科大讯飞 |
星火(Spark) |
6月发布星火X2-VL,唯一全国产算力训练的主流多模态大模型 |
三、企业部署大模型,到底要解决什么核心问题?
企业在选择大模型时,首先要回答一个问题:我要用大模型解决什么核心业务问题?
不同的业务目标,对应完全不同的选型标准。以下是当前企业部署大模型最典型的五类核心诉求:
核心诉求一:让大模型“干活”,而不只是“聊天”
这是当前最迫切的诉求。企业不再满足于大模型写文案、做摘要,而是希望它能真正融入业务流程——编写代码、生成报告、处理工单、辅助决策。大模型需要从“问答工具”进化为“生产力工具”。
为什么这是个问题?87%的企业宣称已大规模部署AI,但真正从中获得生产价值的只有10%。当前大多数企业的AI应用仍停留在问答助手、简单文案生成等浅层工具,报销、采购、生产排产、质检等核心业务流程几乎未被AI改造。
选型关注:模型在编程、办公自动化、数据分析等生产性任务上的实际表现。
核心诉求二:让大模型“懂我”,而不只是“懂通用知识”
通用大模型虽具备泛化能力,但并不天然理解企业的产品体系、客户结构及行业术语。缺乏企业专属数据与知识的注入,AI的输出往往“看着对,用不了”。
为什么这是个问题?企业端AI整体渗透率不足10%。AI是否真正理解该企业、该组织——涵盖组织架构、业务规划、岗位信息等组织上下文——是决定落地成败的关键。
选型关注:模型是否支持企业知识库注入、行业数据微调、专属Agent定制。
核心诉求三:让大模型“用得起”,而不是“烧钱黑洞”
大模型的Token消耗正在成为企业IT预算的“灰犀牛”。高盛预测,受AI智能体大规模调用驱动,2030年全球Token消耗量将达到2026年的24倍。现有的粗放式管理模式将导致企业完全无法支付这一增长速度。
为什么这是个问题?员工已经大量使用AI,预算不断增长,Token消耗越来越高,但一些企业却没有获得预期中的回报。Token账单失控正在成为企业规模化部署AI的最大障碍之一。
选型关注:模型的推理成本、Token定价、有无成本优化工具。
核心诉求四:让大模型“跑在国产算力上”,而不被“卡脖子”
国资委2025年2月召开中央企业“AI+”专项行动深化部署会,对央企来说,接入大模型从一道选择题变成了一项任务。国产芯片品牌、架构和软件栈各不相同,模型部署往往需要重复完成编译、算子优化和推理适配。
为什么这是个问题?对于企业级AI而言,“卡够不够”只是第一步,更大的挑战在于“卡能不能稳定、高效地跑起来”。大规模国产算力集群的部署和运维是长期面临的底层掣肘。
选型关注:模型是否适配国产芯片(昇腾、海光、昆仑芯等)?是否支持私有化部署?
核心诉求五:让大模型“可管可控”,而不是“黑箱操作”
大模型进不了内网之后,企业AI的生意才真正开始。原本可能按Token支付给云厂商的钱,开始流向一体机、私有化部署、系统集成和长期运维。企业对数据安全、合规认证、输出可控性的要求越来越高。
为什么这是个问题?模型训练出来了,推理框架搭好了,可一接上企业内部的真实数据,问题就全暴露了。数据孤岛和数据质量问题是核心障碍。
选型关注:模型是否支持私有化部署?数据是否用于训练?是否通过国家备案?
四、十家厂商竞争格局:五大流派,各有所长
流派 |
厂商 |
核心打法 |
差异化标签 |
办公赋能派 |
阿里、字节 |
以企业级Agent和规模化落地为核心,大模型即生产力 |
调用量最大、商业化最快 |
极致效率派 |
百度、腾讯 |
以降本增效为核心,用更少算力跑更强智能 |
成本最低、性价比最高 |
国产算力派 |
华为、美团、科大讯飞 |
以国产算力适配和全栈自主可控为核心 |
全国产化、昇腾原生 |
端云协同派 |
小米 |
以端侧+云端完整模型矩阵为核心 |
端云一体、人车家全生态 |
物理世界派 |
快手、京东 |
以视频生成和物理世界感知为核心 |
多模态最强、场景最实 |
办公赋能派(阿里、字节):阿里Qwen3.8已能独立完成真实项目交付;字节豆包日均调用量180万亿、ARR达40亿美元。两家都在推动大模型从“对话工具”进化为“生产力工具”。问题是:规模上去了,利润呢?
极致效率派(百度、腾讯):百度文心5.1预训练成本仅为业界6%;腾讯Hy3以210亿激活参数比肩大尺寸旗舰模型。两家都在证明“大模型不一定要烧大钱”。问题是:效率极致了,能力天花板在哪?
国产算力派(华为、美团、科大讯飞):华为openPangu深度适配昇腾;美团LongCat在五万卡国产集群完成训练;讯飞星火X2-VL是唯一全国产算力训练的主流大模型。三家共同定义“国产算力大模型”的标准。问题是:国产算力的性能天花板何时能追上英伟达?
端云协同派(小米):MiMo覆盖从云端到端侧的完整模型矩阵,端侧模型已通过国家备案。问题是:端侧模型的智能水平能否满足复杂任务需求?
物理世界派(快手、京东):快手可灵专注视频生成;京东JoyAI专注供应链和物理世界感知。两家都在让大模型“走出数字世界、进入物理世界”。问题是:场景够深,但通用能力够强吗?
五、大厂通用大模型未来趋势
趋势一:从“参数竞赛”到“落地竞赛”
2026年,大模型竞争已脱离单纯比拼参数规模的初级逻辑。参数是入场券,落地能力才是胜负手。阿里Qwen3.8发布的同时推出Agent产品“千问办公”,是业内首款同时支持桌面端Agent、云端Agent和企业协同Agent的产品;字节将飞书产品团队与豆包团队整合,成立新的豆包产品团队,把豆包从C端聊天机器人改造为嵌入企业工作流的B端AI助手。国产大模型正从“技术竞赛”进入“应用变现”的新阶段。
趋势二:开源成为“标准配置”
不开源的大模型正在失去开发者的信任。腾讯Hy3采用Apache2.0协议开源,发布一周后调用量增长超68倍;华为openPangu 2.0正式开源上线;美团LongCat-2.0同步开放国产卡推理代码;小米MiMo全系列开源;阿里宣布Qwen3.8-Max将于下周开源,这是Qwen-Max级别模型首次面向社会开源。开源正从“可选项”变成“必选项”。
趋势三:国产算力从“能用”走向“好用”
国产算力大模型正在从“追赶者”变成“定义者”。美团LongCat-2.0是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型;华为openPangu单卡吞吐率达行业主流开源模型两倍;科大讯飞星火X2-VL是唯一全国产算力训练的主流多模态大模型。华为昇腾、摩尔线程、沐曦股份等国产芯片厂商已同步完成对LongCat-2.0的推理适配。
趋势四:Agent成为大模型的“终极形态”
大模型的未来不是“聊天机器人”,而是“数字员工”。阿里Qwen3.8可以从空文件夹出发,自主完成十数天的真实项目交付;腾讯Hy3已在WorkBuddy/CodeBuddy、元宝、Marvis、ima等多个业务接入;百度在WAIC 2026集中升级发布多款智能体产品。AI企业服务正在从粗放的“大模型能力竞争”阶段,正式步入AI“应用落地和商业化竞争”深水区。
趋势五:从“数字世界”走向“物理世界”
大模型正在从“处理信息”走向“改造物理世界”。快手可灵AI 3.0支持文本、图像、音频和视频的全模态输入与输出,完成近30亿美元融资;京东JoyAI面向物理世界,已应用于3000多个业务场景;小米发布Xiaomi-Robotics-U0多模态具身基础模型,参数量达380亿,是具身智能领域首款可统一处理四类核心任务的生成式模型。
六、品牌能力:阿里领跑,梯队分明
评分:阿里5.0 | 字节4.5 | 百度4.5 | 腾讯4.0 | 华为4.0 | 小米4.0 | 美团3.5 | 快手3.5 | 科大讯飞3.5 | 京东3.5
大厂通用大模型的品牌格局,阿里处于领先地位。
阿里巴巴品牌壁垒最深。Qwen3.8在Arena榜单中仅次于Anthropic的Claude系列,整体性能处于全球大模型第一梯队。Qwen系列在Hugging Face累计下载量超10亿,为全球榜首模型。从品牌认知到技术实力到开源生态,阿里构建了最完整的品牌护城河。
字节跳动品牌以调用量和商业化增速取胜。豆包日均Token调用量突破180万亿,ARR达40亿美元。豆包月活跃用户达3.82亿,同比增长172.1%,与千问(1.67亿)、DeepSeek(1.3亿)构成AI原生应用的第一梯队。“规模最大、增长最快”的品牌标签已经确立。
百度品牌以“效率之王”立足。文心5.1预训练成本仅为业界6%,在LMArena搜索榜斩获全球第四、国内第一。品牌认知度高。
腾讯Hy3品牌认知度快速攀升。发布一周后调用量增长超68倍。“高性价比实用模型”的品牌定位正在形成。7月腾讯将混元多模态模型部门与大语言模型部门合并,成立基础模型部。
华为盘古品牌以“昇腾原生+开源”为标签。openPangu 2.0正式开源。品牌在信创和国产化市场有天然优势。
小米MiMo品牌以“调用量登顶”破圈。单周调用量10.5万亿Token登顶全球榜首。7月端侧大模型通过国家网信办备案。
美团LongCat品牌在技术圈层认可度高。“业界首个五万卡国产集群训练万亿模型”的标签具有独特性。
快手可灵AI品牌以“视频生成融资之王”立足。完成近30亿美元融资。
科大讯飞星火品牌以“全国产算力”为差异化标签。但在互联网大厂的包围中,品牌声量相对有限。
京东JoyAI品牌刚刚亮相,认知度处于早期阶段。
采购动作:品牌是选型的“第一印象”,但大厂品牌差异正在缩小。更关键的是看实际调用量、客户规模和生态活跃度。
七、产品能力:各具特色,各有侧重
评分:阿里5.0 | 字节4.5 | 百度4.5 | 腾讯4.0 | 华为4.0 | 小米4.0 | 美团3.5 | 快手4.0 | 京东3.5 | 科大讯飞3.5
产品能力的竞争,从“有没有模型”进入“模型好不好用、能不能落地”。
阿里巴巴产品能力最强。Qwen3.8-Max总参数2.4万亿,支持视觉理解、1M上下文。在科研复现评测PaperBench等编程智能体评测中以93.0分录得新高;在指令遵循IF Bench评测中斩获82.8分;在OSWorld-Verified评测中以86.1分位居主流模型首位。同步推出Agent产品“千问办公”,是业内首款同时支持桌面端Agent、云端Agent和企业协同Agent的产品。阿里真武M890超节点已成功适配Qwen3.8。
字节跳动豆包2.1 Pro在编程能力、智能体构建、视觉语言理解三大方向实现显著突破,多项权威评测结果超越Claude Opus 4.6。7月发布视频生成模型Seedance 2.5,单段视频生成长度最高30秒。产品从文本到视频到Agent形成了完整矩阵。
百度文心5.1在智能体、知识、推理、深度搜索方面表现出色。7月WAIC上集中升级发布多款智能体产品。文心5.0正式版总参数2.4万亿。
腾讯Hy3在软件开发、办公生产、金融建模等生产力任务上进步显著。已构建图像、视频、语音、3D生成模型等完整模型矩阵。
华为openPangu 2.0提供Pro(5050亿总参数)和Flash(920亿总参数)两个版本。针对鸿蒙系统完成专项优化。
小米MiMo已完成大语言、多模态、语音等全系列模型矩阵闭环。7月发布Xiaomi-Robotics-U0多模态具身基础模型。
美团LongCat-2.0专为Agentic Coding任务构建,原生支持1M超长上下文。
快手可灵AI 3.0支持文本、图像、音频和视频的全模态输入与输出。
京东JoyAI模型矩阵包括JoyAI-Talker实时语音交互模型和JoyAI-Video-Edit实时视频编辑模型。
采购动作:列出自己的核心场景——代码开发、内容创作、办公协同——逐个实测。不是功能越多越好,是场景适配度越高越好。
八、技术能力:原创性、效率、算力的三角博弈
评分:阿里5.0 | 百度5.0 | 美团4.5 | 华为4.5 | 字节4.5 | 腾讯4.0 | 小米4.0 | 科大讯飞4.0 | 快手3.5 | 京东3.5
技术能力的核心问题:架构是否原创?效率是否领先?算力是否国产?
阿里巴巴技术综合实力最强。Qwen3.8通过稀疏MoE架构与混合注意力机制的联合优化,首次将总参数量拓展至2.4T。阿里真武M890超节点已成功适配Qwen3.8。
百度技术以“极致效率”见长。文心5.1采用“多维弹性预训练”技术,预训练算力成本仅为业界同规模模型的6%。文心5.0正式版采用原生全模态建模及超大规模稀疏MoE结构,总参数2.4万亿。
美团技术以“国产算力+万亿参数”为标签。LongCat-2.0是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型。架构上创新引入LongCat稀疏注意力和N-gram Embedding。
华为技术以“昇腾原生优化”为核心。openPangu 2.0深度适配昇腾算力。Pro版总参数5050亿。
字节跳动豆包2.1 Pro在多项权威评测中超越Claude Opus 4.6。
腾讯Hy3采用MoE架构,总参数2950亿、激活参数210亿。
小米MiMo单周调用量10.5万亿Token。
科大讯飞星火X2-VL是唯一全国产算力训练的主流多模态大模型。
采购动作:技术评估问三句话——架构是否自研?训练效率多高?是否适配国产算力?
九、服务能力:MaaS平台成为标配
评分:阿里4.5 | 字节4.5 | 百度4.0 | 腾讯4.0 | 华为3.5 | 小米3.5 | 美团3.5 | 科大讯飞3.5 | 快手3.0 | 京东3.0
服务能力正在从“加分项”变成“入场券”。
阿里巴巴Qwen3.8 API已上线千问AI平台。国内每百万Tokens输入12元、输出36元。“千问办公”已初步打通钉钉IM。
字节跳动豆包通过火山引擎提供MaaS服务。火山引擎Token份额达49.5%。飞书产品团队与豆包团队整合后,办公场景的服务能力大幅提升。
百度文心5.0已在千帆平台上线。
腾讯Hy3 API已在腾讯云TokenHub及多个海外平台上线。
华为openPangu 2.0通过开源社区提供服务。
采购动作:服务评估要签合同——API稳定性、技术支持响应、定制化开发能力。
十、安全能力:合规是底线,开源是信任
评分:华为4.5 | 科大讯飞4.5 | 阿里4.0 | 百度4.0 | 腾讯4.0 | 字节4.0 | 小米4.0 | 美团3.5 | 快手3.5 | 京东3.5
安全能力在大厂大模型中差异缩小,但国产算力和合规认证仍是关键分水岭。
华为openPangu基于昇腾全栈国产化,在信创市场有天然优势。
科大讯飞星火X2-VL是唯一全国产算力训练的主流大模型,全栈自主可控程度最高。
小米MiMo端侧大模型已通过国家网信办备案。
腾讯Hy3采用Apache2.0开源协议,开源透明度高。
采购动作:安全评估要实测——是否全栈国产化?数据是否用于训练?是否通过国家备案?
十一、价值能力:商业化是终极检验
评分:字节5.0 | 阿里4.5 | 小米4.0 | 百度3.5 | 腾讯3.5 | 美团3.5 | 快手3.5 | 科大讯飞3.5 | 华为3.0 | 京东3.0
价值能力的核心问题:谁赚到了钱?谁证明了商业模式的可持续性?
字节跳动商业化验证最充分。豆包日均Token调用量突破180万亿,ARR达40亿美元。“调用量最大、收入最高”的双料冠军。
阿里巴巴Qwen3.8以高性价比定价策略推动商业化。“千问办公”Agent产品开辟了企业级收费场景。
小米MiMo以开源免费策略快速扩大用户基础。计划未来三年在AI领域投入不低于600亿元。
快手可灵AI完成近30亿美元融资。
采购动作:价值评估看三个数字——调用量规模、ARR增速、单位成本。
十二、六力综合与采购决策
厂商 |
品牌 |
产品 |
技术 |
服务 |
安全 |
价值 |
阿里巴巴(通义千问) |
5.0 |
5.0 |
5.0 |
4.5 |
4.0 |
4.5 |
字节跳动(豆包) |
4.5 |
4.5 |
4.5 |
4.5 |
4.0 |
5.0 |
百度(文心) |
4.5 |
4.5 |
5.0 |
4.0 |
4.0 |
3.5 |
腾讯(混元) |
4.0 |
4.0 |
4.0 |
4.0 |
4.0 |
3.5 |
华为(盘古) |
4.0 |
4.0 |
4.5 |
3.5 |
4.5 |
3.0 |
小米(MiMo) |
4.0 |
4.0 |
4.0 |
3.5 |
4.0 |
4.0 |
美团(LongCat) |
3.5 |
3.5 |
4.5 |
3.5 |
3.5 |
3.5 |
快手(可灵AI) |
3.5 |
4.0 |
3.5 |
3.0 |
3.5 |
3.5 |
科大讯飞(星火) |
3.5 |
3.5 |
4.0 |
3.5 |
4.5 |
3.5 |
京东(JoyAI) |
3.5 |
3.5 |
3.5 |
3.0 |
3.5 |
3.0 |
排名是假象,适配才是真相。
选型场景化建议
以下按客户实际业务场景提供选型建议——十款大模型各自擅长解决不同类型的问题,客户应根据自身最紧迫的业务需求进行匹配。
场景一:代码开发/智能体编程
需要大模型辅助或替代软件开发工作,对Coding能力和Agent能力要求高。
场景二:企业级生产环境/高并发调用
需要大模型支撑大规模业务系统,对稳定性、并发能力和商业化成熟度要求最高。
场景三:追求极致性价比/成本敏感
希望用最低的成本获得最强的模型能力,对Token价格和训练效率敏感。
场景四:国产算力/信创合规
必须运行在国产芯片上,对全栈自主可控有硬性要求。
场景五:视频生成/多模态内容创作
需要大模型生成视频、图像、音频等多模态内容。
场景六:端侧部署/边缘计算
需要大模型在手机、IoT设备等端侧运行。
场景七:物理世界/供应链/物流场景
需要大模型理解物理世界、处理真实场景数据。
十三、结语
十家国内大厂通用大模型,五大流派,一个共同使命——让中国AI从“追赶”走向“引领”。
办公赋能派(阿里、字节)走的是最猛的路。阿里Qwen3.8已能独立完成真实项目交付,字节豆包ARR达40亿美元。规模是优势,但利润是考题。
极致效率派(百度、腾讯)走的是最巧的路。百度文心5.1成本仅为业界6%,腾讯Hy3以210亿激活参数比肩旗舰模型。效率是标签,但能力天花板是隐忧。
国产算力派(华为、美团、科大讯飞)走的是最硬的路。华为openPangu昇腾原生,美团LongCat五万卡国产集群训练,讯飞星火唯一全国产算力。自主是壁垒,但性能追赶是长跑。
端云协同派(小米)走的是最全的路。MiMo覆盖端侧到云端完整矩阵。生态是护城河,但端侧智能是挑战。
物理世界派(快手、京东)走的是最特的路。快手可灵专注视频生成,京东JoyAI专注供应链场景。场景是深度,但通用能力是短板。
中国大模型的“追赶”不是终点,“引领”才是。阿里Qwen3.8的编程突破、百度文心5.1的成本革命、美团LongCat的国产算力壮举、字节豆包的商业化奇迹——十家厂商正在用各自的方式重新定义“中国AI”的高度。
选型的时候,别问“谁排名最高”,问“谁最适配我的场景、谁在我出问题的时候能找到人、谁能陪我走得更远”。