上一篇文章介绍了几个比较流行的AI智能体,如果你已经成功安装了,证明你已经有了一个机器人的躯壳,现在我们需要为这个机器人安装一个大脑,这个大脑的名字叫LLM。

一、什么是LLM

LLM 是英文 Large Language Model 的缩写,中文叫大语言模型,拆开看其实就三个词:大、语言、模型。

模型,就是一个用来做预测的程序,语言,说明它处理的对象是文字,大,指的是它的规模(里面的参数动辄上千亿,训练时吃掉了海量的文字数据)。

它的工作方式说起来有点像“文字接龙”:你把一段话喂给它,它根据前面所有内容,预测下一个最有可能出现的字或者词,然后把预测结果接回去,继续预测下一个,一个字一个字地“接”出完整回答,你看到的那些流畅的回复、代码、文章,本质上都是这么一步步“接”出来的。

这中间有个关键概念叫 Token,模型不认字,只认数字,中间靠分词器把文字翻译成数字,Token 也不等于词,一个汉字大概对应一个多 Token,英文一个单词大概零点几个,模型的“记性”也来自这里(它并没有真正的记忆,而是每次把整段对话历史重新拼进请求里),这段历史能装多大,就看它的上下文窗口(Context Window)有多大,现在主流的旗舰模型都已经到了百万级别,能一次性装下好几本书的内容。

LLM 的底子是 Transformer 架构,2017 年由谷歌提出,后来 OpenAI 用 GPT 系列把它引爆,2022 年底 GPT-3.5 横空出世,2023 年 GPT-4 发布,大模型时代正式开启,到现在,国内外的大模型已经多到数不过来了。

二、LLM 在整个 AI 流程中充当什么样的角色

用一句话说:LLM 是 AI 系统的“大脑”,负责思考,而 Agent 是“躯壳”,负责行动。

上一篇文章里介绍的 AI Agent,本质上是一个壳子,它能把你的指令拆解成步骤、调用各种工具、操作电脑、读写文件,但这些“动手”能力背后,做判断、写内容、想方案的,都是 LLM。

一个完整的 AI 工作流大概是这样的:你发出指令,Agent 收到后把任务拆解,需要思考的地方交给 LLM,需要执行的地方调用工具,工具返回结果后再交给 LLM 理解和整理,最后输出给你,整个过程里,LLM 是那个反复被调用、负责“想”的核心,Agent 是那个来回跑腿、负责“做”的外壳。

AI工作流示意图

画成图就是这么个循环:你发出指令,Agent 拆解任务、调起工具,中间所有需要动脑子的地方都是 LLM 在干活,工具把结果拿回来后,LLM 再理解整理,最后输出给你。

打个比方:Agent 像一个手脚麻利的员工,LLM 是他的大脑,员工知道该打哪个电话、该跑哪个部门,但“该说什么话、该怎么处理这件事”的判断,都是大脑做的,大脑的水平,直接决定了这个员工的上限。

三、国外头部两大模型

先看国外,目前全球公认的第一梯队就是 OpenAI 和 Anthropic 两家,国内能直接用的主要是它们的 API 或者订阅,门槛高一些,但能力确实是标杆,很多国产模型都拿它们当对比对象。

1、GPT-5.6(OpenAI)

  • 出品方:OpenAI。

OpenAI 就是做 ChatGPT 那家公司,GPT 系列是它的招牌,GPT-5.6 是 2026 年 7 月 9 日发布的旗舰,分三个档:Sol 是旗舰、Terra 均衡、Luna 快速低价,你可以理解成高配、中配、低配。

  • 是否开源:不开源。

闭源专有,权重不公开,也没法自己部署,只能通过官方 API 或者 ChatGPT 用。

  • 幻觉程度:未找到公开的量化评测数据。

社区里有人说它在一些看似简单的数学问题上还会翻车,但这属于能力短板,不完全是幻觉,整体上没有系统性的幻觉评测公开,一般默认头部闭源模型的幻觉控制相对成熟。

  • 模型特性:文本加图像输入,文本输出,上下文 105 万 token。

强项是复杂编码和 Agent 任务,Terminal-Bench 编码榜全球第一,Sol 档还有个 Ultra 模式,能同时调度多个子 Agent 并行干活,Terra 档性能接近上一代旗舰、价格只要一半,Luna 档主打便宜快,语音和图像生成是走另外的专用模型,不在这代本体里。

  • 性价比:API 输入输出每百万 token 分别是 Sol 5 美元 30 美元,Terra 2.5 美元 15 美元,Luna 1 美元 6 美元。

订阅的话 ChatGPT Plus 大约 20 美元一个月,Pro 大约 200 美元,三档定价覆盖高中低,从省钱到堆算力都有得选,是目前国外模型里定价分层做得最细的。

2、Claude Opus 5(Anthropic)

  • 出品方:Anthropic。

Anthropic 就是做 Claude 那家美国公司,OpenAI 之外另一极,Claude Opus 5 是 2026 年 7 月 24 日发布的最新旗舰,还有个更猛的 Claude Fable 5 是它家 2026 年 6 月发的顶级模型,综合能力全球第一,但价格翻倍而且取消了订阅制只能按量付费,普通用户够不着,日常用 Opus 5 就够了。

  • 是否开源:不开源。

Anthropic 明确表态走闭源路线,权重不公开。

  • 幻觉程度:未找到公开的量化评测数据。

官方强调的是对齐和安全性,号称是“最不容易被诱导”的模型,安全审计得分最低,这跟幻觉不完全是一回事,但侧面说明它在事实性输出上比较谨慎。

  • 模型特性:文本加图像输入,输出还带很强的可视化能力,上下文 100 万 token。

强项是代码、长时程 Agent 任务和知识工作,同价位下能力比上一代翻倍,还特别能“自我验证”,会自己检查结果对不对,在数值推理、金融、法律这些专业场景,客户评测普遍比上一代高 8 到 22 个百分点。

  • 性价比:API 输入输出每百万 token 5 美元 25 美元,和上一代 Opus 4.8 同价。

订阅 Claude Pro 大约 20 美元一个月,Max 档 100 到 200 美元,跟 Fable 5 比,Opus 5 价格只有一半、能力接近,是 Anthropic 家目前最值得用的档位。

四、国产大模型盘点

国外两款讲完,重点来了,国产大模型这两年发展特别快,数量多到眼花缭乱,我挑市面上讨论度最高的十款,逐个从出品方、是否开源、幻觉程度、模型特性、性价比五个维度讲清楚。

3、DeepSeek v4(深度求索)

  • 出品方:深度求索(DeepSeek)。

杭州的一家 AI 公司,靠开源模型火遍全球,2026 年 4 月发布 v4 系列,7 月 19 日正式商用,分 flash 和 pro 两个档,flash 轻量、pro 旗舰。

  • 是否开源:开源。

MIT 协议,权重公开,Pro 档 1.6T 参数 MoE 架构,社区可以直接下载部署。

  • 幻觉程度:综合评测里表现均衡,中文 70.98 分国内第一,社区口碑是“Agent 全场景稳”,没有明显的幻觉翻车记录。

  • 模型特性:文本单模态,上下文 100 万 token。

强项是综合能力最均衡,Token 效率最高,同样的活它花的钱最少,SWE-bench 代码修复 80.6%,LiveCodeBench 93.5% 超国外旗舰,短板是复杂工程的大规模代码重构质量不如 GLM-5.2。

  • 性价比:国产里最便宜的一档,flash 输入输出每百万 token 1 元 2 元,pro 3 元 6 元。

官方已经预告近期要涨价,想薅羊毛的趁早,支持 OpenAI 和 Anthropic 两种接口格式,接 Claude Code 这类工具很方便,是国内玩 Agent 的首选模型。

4、GLM-5.2(智谱 AI)

  • 出品方:智谱 AI。

北京的公司,做 GLM 系列,是国内最早一批做大模型的团队之一,GLM-5.2 是 2026 年 6 月 13 日发布的旗舰。

  • 是否开源:开源。

MIT 协议,开放权重,754B 参数 MoE 架构,社区评价是“国产最强代码模型”。

  • 幻觉程度:未找到公开的量化评测数据,社区反馈正常,没有集中翻车的记录。

  • 模型特性:文本单模态(不支持图像输入),上下文 100 万 token 真实可用。

强项是代码,SWE-Bench Pro 62% 超过 GPT-5.2,KingBench 世界第三,国产第一,长程 Agent 任务能稳定跑 12 个小时以上,中文场景和大代码库分析优势明显,短板是没有多模态能力,前端审美弱,速度偏慢。

  • 性价比:API 按量输入 8 元、输出 28 元每百万 token(缓存命中 2 元),GLM Coding Plan 订阅 Lite 49 元、Pro 149 元、Max 469 元一个月。

订阅制对重度代码用户来说比纯按量划算,它是 ZCode 编程工具的原生适配模型,也是“免费平替 Claude Code”社区叙事的核心。

5、Kimi K3(月之暗面)

  • 出品方:月之暗面(Moonshot AI)。

北京的公司,Kimi 智能助手就是它家的,K3 是 2026 年 7 月 17 日发布的旗舰,号称全球首个 3 万亿级开源大模型。

  • 是否开源:开源。

2.8T 参数 MoE 架构,开源权重,是目前开源模型里规模最大的之一。

  • 幻觉程度:社区反馈偏高。

内测用户反馈它的幻觉高于闭源头部,在需要严格事实核对的场景要注意复核,这是它家模型被提得比较多的问题。

  • 模型特性:文本单模态为主,上下文 256K 到 1M 视版本而定。

强项是前端开发能力全球第一,Code Arena 前端 1679 分登顶,有人实测 3000 行前后端改造一次通过,diff 干净,速度还快,架构推理 83 分略胜 Qwen3.8,短板是贵,还有上面说的幻觉问题。

  • 性价比:国产定价天花板,输入输出每百万 token 20 元 100 元,最低充值 10 元。

有人实测 99 元档一个任务烧掉 68% 的额度,能力确实强,但钱包压力大,适合对前端代码质量有硬要求的场景。

6、豆包 Seed2.1(字节跳动)

  • 出品方:字节跳动。

做抖音那家公司,豆包是它的 AI 品牌,Seed2.1 是 2026 年 6 月 23 日发布的旗舰,主打“真实生产力加效率优先”。

  • 是否开源:不开源。

闭源商业模型,走火山方舟平台提供 API。

  • 幻觉程度:未找到公开的量化评测数据,数学能力垫底(70 分),但数学弱不等于幻觉,日常使用没有集中翻车反馈。

  • 模型特性:文本为主,Turbo 档速度很快。

强项是代码生成最强(85.7 分)和速度快,Turbo 95 tokens/s 超过上代 Pro 还便宜一半,短板是 Agentic 能力弱(53.52 分),数学垫底,做长程自主任务不如 Qwen 和 GLM。

  • 性价比:官方按量 Pro 输入 6 元、输出 30 元每百万 token,Turbo 输入 3 元、输出 15 元(缓存命中再打折,批量推理减半)。

字节有算力补贴,配合 Trae 编程工具内置免费使用,对国内用户很友好。

7、通义千问 Qwen3.8(阿里)

  • 出品方:阿里巴巴。

Qwen 系列是阿里云的大模型家族,国际开源社区里最有存在感的国产系列,Qwen3.8-Max 是 2026 年 7 月 19 日发布的预览版。

  • 是否开源:权重待开源,但 Qwen 系列历来开源,社区称它是“开源最强候选”。

  • 幻觉程度:官方公开过幻觉率数据,从 44.2% 降到 22.9%。

这是国产模型里少有的主动公布幻觉数据的,说明在幻觉控制上下了功夫。

  • 模型特性:文本为主,上下文 100 万 token,2.4T MoE 架构。

强项是长程自主执行,Terminal Bench 69.7 超过 DeepSeek v4 Pro,能自主跑 35 个小时的复杂任务,是 Agent 场景的强手,缺点是标准跑分没公布,部分榜单查不到成绩。

  • 性价比:API 按量输入 12 元、输出 36 元每百万 token(缓存命中 1.5 元,Batch 半价),Token Plan 订阅 Lite 39 元、Standard 139 元、Pro 499 元一个月,千问网页版免费。

对 Agent 长程任务来说性价比突出,官方称能力仅次于 Fable 5,但标准成绩存疑。

8、MiniMax M3(MiniMax)

  • 出品方:MiniMax。

上海的公司,主打多模态,M3 是 2026 年 6 月 1 日上线的旗舰。

  • 是否开源:不开源。

闭源商业模型,走自家平台提供 API。

  • 幻觉程度:未找到公开的量化评测数据,社区没有集中翻车反馈。

  • 模型特性:原生多模态,文本图像音频都支持,上下文 100 万 token。

它是首个把“编码前沿加 1M 上下文加原生多模态”三合一的模型,BrowseComp 83.5 超过 Opus 4.7,文献复现能自主跑 12 个小时,强项是全面,短板是 Coding Plan 改版后重度用户成本涨了 257%。

  • 性价比:输入 2.1 元、输出 8.4 元每百万 token(512k 内永久五折后),Token Plan 订阅 Plus 49 元、Max 119 元、Ultra 469 元一个月。

改版前重度用户 49 元能搞定,改版后按新档位算成本明显上涨,涨得有点狠,适合轻中度使用。

9、文心 ERNIE 5.1(百度)

  • 出品方:百度。

国内最早做大模型的厂商之一,文心一言就是它家的,ERNIE 5.1 是 2026 年 5 月 9 日发布的旗舰。

  • 是否开源:不开源。

闭源商业模型,走百度千帆平台提供 API,历史版本有开源但旗舰一直闭源。

  • 幻觉程度:未找到公开的量化评测数据。

  • 模型特性:文本为主,多模态能力由配套模型提供。

强项是中文理解和创作,ERNIE 5.1 在 LMArena 中文榜排第一、全球第 13,预训练成本只有同级模型的 6%,推理能力全面升级,依托百度搜索生态,知识问答类场景有优势。

  • 性价比:API 按量输入 4 元、输出 18 元每百万 token(32k 内档,超长上下文档位略高),无订阅套餐,走资源包或按量。

适合百度生态内、重视中文创作和知识问答的用户。

10、阶跃星辰 Step 3.7(阶跃星辰)

  • 出品方:阶跃星辰。

上海的公司,创始人是前微软全球副总裁姜大昕,主打多模态和 Agent,Step 3.7 Flash 是目前的旗舰,2026 年发布。

  • 是否开源:开源。

GitHub 有官方仓库,Flash 档权重公开。

  • 幻觉程度:未找到公开的量化评测数据。

  • 模型特性:原生多模态,文本图像都能理解,上下文视版本而定。

强项是 Agent 场景,官方宣称“面向生产级 Agent 的高效率模型”,原生多模态理解加联网搜索加高可靠工具调用,还针对 Claude Code、Hermes Agent、OpenClaw 这些主流框架做了兼容优化,Step 3.5 Flash 主打快,Step 2 是万亿参数底座。

  • 性价比:API 按量输入 1.35 元、输出 8.1 元每百万 token(缓存命中 0.27 元),是国产里最便宜的一档,跟 DeepSeek 有得一拼。

特点是跟主流 Agent 框架兼容好,接进去就能用,省配置的功夫。

11、讯飞星火 X2(科大讯飞)

  • 出品方:科大讯飞。

合肥的公司,语音识别起家,星火大模型是它的 AI 品牌,X2 是目前的深度推理旗舰。

  • 是否开源:不开源。

闭源商业模型,走讯飞开放平台提供 API。

  • 幻觉程度:未找到公开的量化评测数据。

  • 模型特性:文本为主,强项是语音相关场景。

讯飞的老本行是语音,星火在语音识别、语音合成、超拟人交互这些场景有天然优势,深度推理 X2 档主打推理能力,短板是通用大模型能力跟头部相比不算突出。

  • 性价比:官方给的是区间价,Spark X2 大概 2 到 3 元每百万 token,X2 Flash 1 到 2 元,不拆输入输出,套餐包买得越多越便宜(200 元 1 亿 token 起)。

适合语音交互、办公场景和讯飞生态内的用户。

12、腾讯混元(腾讯)

  • 出品方:腾讯。

混元是腾讯的大模型品牌,2023 年推出,2025 到 2026 年持续迭代。

  • 是否开源:不开源。

闭源商业模型,走腾讯云提供 API,部分历史版本开源过(如 3D 模型)。

  • 幻觉程度:未找到公开的量化评测数据。

  • 模型特性:文本为主,配套多模态模型。

混元深度集成在腾讯生态里,微信、QQ、腾讯文档、腾讯会议这些产品都能看到它的影子,强项是中文场景和腾讯系应用的无缝衔接,独立评测里的存在感不如前面几家强。

  • 性价比:混元生文主力型号输入 2.4 元、输出 9.6 元每百万 token,免费额度 100 万 token,官方已公告逐步迁移到 TokenHub 计费。

适合腾讯生态重度用户,模型本身能力不算第一梯队,但胜在方便。

五、选择大模型的技巧

十二款讲完了,信息量确实大,我按上面的维度做了张对比图,大家可以参考下。

八款主流大模型横向对比

价格这块单独做了一张表,全部是官方定价页 时间是2026 年 8 月 8 日获取的数据,每百万 token 的输入输出价,方便你们对照。

十二款大模型官方API价格对比

我现在主力用的是 DeepSeek v4 flash,日常的写作、查资料、简单代码、跑 Agent 都是它,便宜、均衡、Agent 场景稳,Token 效率高,一天到晚跑也花不了几个钱,遇到个别难度大的项目,比如复杂的大规模代码重构,我会切到 DeepSeek v4 pro,参数更大、上限更高。

为什么我选 DeepSeek 而不是别的?因为我的创作偏向跑代码(网站运维)和 Agent,这两个场景它正好都稳,而且开源、便宜、国内直连、接口兼容性好,接各种工具都方便。

你们可以照这个思路来:先列自己的高频场景,再看每个模型在这些场景的口碑和价格,最后挑一两款真实用起来,别光看榜单,适合自己需求才是最好的。

六、总结

大模型选型的核心就一句话:没有最好的模型,只有最适合你工作流的模型。

国外头部两款,GPT-5.6 和 Claude Opus 5,能力是标杆,但贵、要翻Q、要海外支付,适合不差钱的重度专业用户,国产十款里,日常均衡首选 DeepSeek,复杂工程代码选 GLM-5.2,前端开发选 Kimi K3,追求速度和便宜选豆包,长程 Agent 任务选 Qwen 或 GLM,多模态全面选 MiniMax,中文创作选文心,语音场景选星火,腾讯生态选混元。

最后提醒一句:模型更新太快,我今天写的版本和价格,过几个月可能就变了,大家按自己的工作流去试一下,充值10元做过体验,试完觉得顺手,就是最适合你的。

温馨提醒:以上这么多款模型,我只深度用过 DeepSeek v4 系列,其他模型的信息来源是官方资料、知识库和网友反馈,仅供参考。