No.001国产旗舰开源 · MIT
DeepSeek-V4-Pro
深度求索(DeepSeek)
深度求索2026年4月发布的旗舰大模型,MoE架构,总参数1.6万亿,激活49B,原生支持100万Token上下文,MIT协议完全开源。SWE-bench Verified得分80.6%,Codeforces 3206分,性能比肩全球顶级闭源模型。
架构
MoE + Compressed Sparse Attention
SWE-bench_Verified 80.6%Codeforces 3206
输出成本 / M tokens空闲时段¥13.5CNY
输入·未命中 ¥4.5·缓存命中 ¥0.15最大输出 384K Tokens
⚡ 高峰 输入 ¥9 · 输出 ¥279:00-12:00 / 14:00-18:00
※ 2026年8月起峰谷计费:空闲时段半价,高峰为北京时间9-12点、14-18点;缓存命中输入空闲¥0.15/高峰¥0.30
复杂逻辑推理大型代码工程百万级长文档理解+2
No.002经济之选开源 · MIT
DeepSeek-V4-Flash
深度求索(DeepSeek)
DeepSeek V4系列经济版,总参数2840亿,激活130亿,主打高并发与极致性价比,1M上下文,MIT协议开源。
输出成本 / M tokens空闲时段¥4.5CNY
输入·未命中 ¥1.5·缓存命中 ¥0.05
⚡ 高峰 输入 ¥3 · 输出 ¥99:00-12:00 / 14:00-18:00
※ 2026年8月起峰谷计费:空闲时段半价,高峰为北京时间9-12点、14-18点;缓存命中输入空闲¥0.05/高峰¥0.10
高并发日常对话轻量文本生成成本敏感批量处理+1
No.003国际旗舰闭源
Claude Fable 5
Anthropic
Anthropic于2026年6月9日发布的Mythos级旗舰模型,首个面向公众的Mythos级模型。编码、长时程Agent任务和复杂推理大幅领先,支持Adaptive Thinking自适应推理,可连续数小时完成复杂任务链。
输出成本 / M tokens$50USD
输入·未命中 $10·缓存命中 $0.25最大输出 128K Tokens
※ 官方 API 价(anthropic.com 2026-09 口径):输入 $10 / 缓存读取 $0.25 / 输出 $50(USD/百万tokens),缓存写入 $12.5;约为Opus两倍;2026年7月20日起纳入Max/Team Premium订阅;Batch 50%折扣
大型代码库迁移重构长时程自主Agent复杂多步推理+2
No.006国际旗舰闭源
GPT-5.5
OpenAI
OpenAI 2026年旗舰模型,105万Token上下文,13万最大输出,原生多模态(文本/图像/音频),多项Benchmark领先。
输出成本 / M tokens$30USD
输入·未命中 $5最大输出 130,000 Tokens
专业编码多模态理解生成企业级推理+2
No.007高性价比闭源
GPT-5.4
OpenAI
OpenAI面向编码和专业工作的更实惠模型,105万Token上下文,性能均衡。
输出成本 / M tokens$15USD
输入·未命中 $2.5最大输出 130,000 Tokens
日常编码辅助专业文档处理多语言翻译+1
No.008主流闭源
Gemini 3.6 Flash
Google DeepMind
Google 2026年7月21日发布,3.5 Flash后继。输出token减少17%、速度翻倍(303 tok/s),知识截止2026年3月,内置Computer Use。
DeepSWE 49%OSWorld-Verified 83.0%
输出成本 / M tokens$7.5USD
输入·未命中 $1.5最大输出 64K
※ 输出价较3.5 Flash降低17%($9→$7.50);有免费额度;Batch 50%折扣
Agent工作流多模态理解高并发轻量推理+2
No.009国际旗舰闭源
Gemini 3.0 Pro
Google DeepMind
Google Gemini 3旗舰推理模型,ARC-AGI-2得分77.1%,支持深度思考模式。
ARC-AGI-2 77.1%
输出成本 / M tokens$12USD
输入·未命中 $2
复杂科学推理多步骤问题求解长视频理解+1
月之暗面2026年4月20日发布并开源的万亿参数MoE多模态Agent大模型,32B激活参数,256K上下文,原生支持图片和视频输入。支持300个子Agent并行、4000协作步骤,单次任务可不间断编码13小时、编写超4000行代码。Modified MIT License开源。
SWE-bench_Pro Surpasses GPT-5.4HLE_with_tools Open-source SOTA
输出成本 / M tokens¥27CNY
输入·未命中 ¥6.5·缓存命中 ¥1.1
※ 官方按量价(platform.kimi.com 2026-08 口径):输入 6.5 元 / 缓存命中 1.1 元 / 输出 27 元(元/百万tokens),256K 上下文不分档、不分思考模式;第三方平台特惠价:输入2.5元/输出9.9元
长周期自主编码(13小时不间断)300 Agent并行协作多模态视觉转代码+3
No.011国产旗舰开源
GLM-5.1
智谱AI(Zhipu AI)
智谱AI 2026年4月8日发布的新一代开源旗舰模型,744B参数(激活40B),采用DeepSeek稀疏注意力+Multi-Token Prediction技术,SWE-bench-Verified 77.8%,Terminal Bench 2.0得分56.2,代码能力逼近Claude Opus 4.5。Artificial Analysis全球第四。
架构
MoE + DeepSeek Sparse Attention + Multi-Token Prediction
SWE-bench-Verified 77.8%Terminal_Bench_2.0 56.2
输出成本 / M tokens¥24CNY
输入·未命中 ¥6·缓存命中 ¥1.3
※ 官方按量价(open.bigmodel.cn 2026-08 口径),按输入长度分档:<32K 输入 6 元/输出 24 元/缓存命中 1.3 元;≥32K 输入 8 元/输出 28 元/缓存命中 2 元(元/百万tokens);缓存存储限时免费
复杂系统工程长周期智能体任务AI编程(Claude Code/Cursor/Cline)+2
No.012经济之选闭源
Doubao-Seed-2.0-Pro(豆包2.0 Pro)
字节跳动(ByteDance)/ 火山引擎
字节跳动2026年2月14日发布的旗舰大模型,IMO/CMO数学竞赛和ICPC编程竞赛金牌水平,超越Gemini 3 Pro的Putnam基准。多模态、科学推理、Agent全能,月活破亿。
IMO_CMO Gold medalICPC Gold medal
输出成本 / M tokens¥16CNY
输入·未命中 ¥3.2
※ Lite版输入0.6元/输出3.6元;Mini版输入0.2元/输出2元
数学竞赛级推理多模态内容创作日常对话(月活破亿)+2
No.014高性价比闭源
Grok 4.5
SpaceXAI(原xAI,马斯克旗下)
SpaceXAI(原xAI)2026年7月9日发布,基于1.5万亿参数V9底座,与Cursor联合训练。Token效率为竞品2倍,推理速度80TPS,SWE-bench Pro 64.7%超越GPT-5.5。定价极具侵略性,成本仅为Opus的1/4。
SWE-bench_Pro 64.7%Terminal-bench_2.1 83.3%
输出成本 / M tokens$6USD
输入·未命中 $2
※ 比Claude Opus便宜60%+;Token效率为竞品2倍
AI编程(Cursor深度集成)实时信息检索与分析高并发Agent任务+2
Meta 2025年4月发布的开源MoE多模态模型系列。Scout:109B总参/17B激活,10M超长上下文(业界最长);Maverick:400B总参/17B激活,1M上下文。原生多模态,支持12+语言。
总参数
Scout 109B / Maverick 400B
输出成本 / M tokens$0.6USD
输入·未命中 $0.2
※ 开源免费本地部署;云服务商按算力计费(AWS Bedrock Scout 约$0.17/$0.66,Maverick 约$0.24/$0.97);此处取托管API参考价
超长文档处理(10M上下文)多语言应用本地私有化部署+2
腾讯2026年7月6日正式发布的第三代大语言模型,MoE架构295B总参/21B激活,256K上下文。Agent能力追平GPT-5.5,Apache 2.0完全开源。已批量接入腾讯内部业务线。
输出成本 / M tokens¥4CNY
输入·未命中 ¥1
※ Apache 2.0开源,可本地部署免费使用
智能体(Agent)任务代码生成与调试企业办公自动化+2
No.017高性价比开源
MiniMax M3
稀宇科技(MiniMax)
稀宇科技2026年6月1日发布并开源的新一代旗舰模型,自研MSA稀疏注意力架构(非MoE),1M上下文,原生多模态。SWE-Bench Pro 59.0%超越GPT-5.5,BrowseComp 83.5分超越Claude Opus 4.7。发布一周OpenRouter全球调用量第三。
SWE-Bench_Pro 59.0%BrowseComp 83.5 (surpassing Opus 4.7's 79.3)
输出成本 / M tokens¥16.8CNY
输入·未命中 ¥4.2
※ 512K上下文以内定价;发布首周API五折优惠;Token Plan订阅制可选
AI Coding(仓库级代码分析)多模态Agent长文档/视频理解+2
No.020高性价比闭源
Meta Muse Spark 1.1
Meta
Meta 2026年7月9日发布的全新闭源多模态推理模型,首个面向外部开发者的付费商用API。主打高级智能体工作流编排、多智能体并行协作、零样本工具调用、计算机操控能力。100万Token上下文。
输出成本 / M tokens$4.25USD
输入·未命中 $1.25
※ 新注册赠$20免费额度;Meta首个付费商用API
端到端软件开发Bug检测与修复多Agent工作流编排+2
月之暗面2026年7月发布的2.8T参数前沿旗舰模型,896专家MoE架构、每token激活16个专家,1M上下文统一定价无分级加价。KDA混合注意力机制带来6.3倍解码加速,前端编程能力全球第一,编码与推理对标Claude Opus而成本低一半。2026年7月27日开放权重。
架构
MoE + KDA hybrid attention
Frontend_coding #1 globallyArtificial_Analysis_Index Top tier
输出成本 / M tokens¥100CNY
输入·未命中 ¥20·缓存命中 ¥2最大输出 128K Tokens
※ 官方按量价(platform.kimi.com 2026-08 口径):输入缓存未命中 20 元 / 缓存命中 2 元 / 输出 100 元(元/百万tokens),1M 上下文不分档;自动上下文缓存默认开启(prompt >256 tokens 可命中前缀缓存);不区分思考/非思考档价
编码Agent长上下文推理复杂多步骤任务+1
No.022国产旗舰开源 · MIT
GLM-5.2
智谱AI(Zhipu AI)
智谱AI(Z.ai)2026年发布的开源旗舰模型,MIT协议开放权重,HuggingFace可下载。综合能力与Claude Opus 4.8接近而价格便宜80%,综合成本约为Claude Opus的20%,发布首周调用量暴涨27倍,被硅谷知名工程师盛赞“以零头成本比肩美国系统”。
vs_Claude_Opus_4.8 ~parity, 80% cheaper
输出成本 / M tokens¥28CNY
输入·未命中 ¥8·缓存命中 ¥2最大输出 128K Tokens
※ 官方按量价(bigmodel.cn 2026-08 口径):输入 8 元 / 输出 28 元 / 缓存命中 2 元(元/百万tokens);缓存存储限时免费
通用推理AI编程低成本Claude替代+1
MiniMax 的高效主力模型,按 API 调用量计稳居全球前三。消费级应用的性价比极佳。
Global call volume Top 3
输出成本 / M tokens¥8.4CNY
输入·未命中 ¥2.1·缓存命中 ¥0.21最大输出 64K Tokens
※ 官方按量价(platform.minimaxi.com 2026-08 口径,已列入历史模型区):输入 2.1 元 / 缓存读取 0.21 元 / 输出 8.4 元(元/百万tokens),不分档、无五折(五折仅限 M3);highspeed 版 4.2/16.8;按调用量计全球前列
角色扮演与聊天高吞吐 Agent多模态
No.026国际旗舰闭源
Claude Opus 5
Anthropic
2026年7月24日发布。性能逼近Fable 5、价格仅一半。Frontier-Bench超Opus 4.8两倍,Claude Max默认模型。支持effort思考档位与Fast模式(2.5倍速)。
DeepSWE v1.1 68.8%FrontierCode v1.1 53.4%
输出成本 / M tokens$25USD
输入·未命中 $5·缓存命中 $0.5最大输出 128K
※ 与Opus 4.8同价;Fast模式$10/$50;Batch 50%折扣;缓存命中$0.50/MTok(省90%),缓存写入 $6.25/MTok
复杂Agent编程企业级代码审查长链路自主任务+1
No.027高性价比闭源
Claude Sonnet 5
Anthropic
2026年6月30日发布,最强Agent属性Sonnet。性能接近Opus 4.8,成本仅四成。Free/Pro版默认模型。
SWE-Bench Pro 63.2%
输出成本 / M tokens$10USD
输入·未命中 $2·缓存命中 $0.2
※ 官方现行价(anthropic.com 2026-08 口径):输入 $2 / 缓存读取 $0.2 / 输出 $10(USD/百万tokens),缓存写入 $2.5;促销期至2026-08-31,之后恢复 $3/$15;Batch 50%折扣
日常编程高并发Agent研究分析
阿里巴巴2026年8月发布的新一代旗舰多模态大模型(本代为Qwen3.8-Max),总参数2.4万亿、激活参数95B,基于Qwen 3.5架构基础打造。编程与专业办公能力大幅提升,Arena榜单整体性能位居全球第二(仅次于Anthropic Claude系列)。支持1M上下文与文本+图像多模态输入,API已上线并接入企业级Agent产品"千问办公";系首个开源权重的Qwen-Max级模型,权重将在Hugging Face与ModelScope发布。
Arena 2nd globally (behind Claude family)
输出成本 / M tokens¥36CNY
输入·未命中 ¥12·缓存命中 ¥1.5最大输出 65,536 Tokens
※ 官方按量价(platform.qianwenai.com 2026-08 口径):输入 12 元 / 输出 36 元 / 缓存命中 1.5 元(元/百万tokens),不分档;显式缓存创建 15 元、显式缓存命中 1 元
专业编程专业办公企业级Agent+2
No.029国际旗舰闭源
GPT-5.6
OpenAI
OpenAI于2026年7月9日发布的新一代前沿模型系列,分旗舰Sol、主力Terra、轻量Luna三档。Sol具备深度推理与统一多模态能力,事实错误率较前代降低约68%;Luna主打低成本高吞吐,事实错误率比GPT-5.5 Instant低约62%。7月30日起永久降价:Luna降80%、Terra降20%,Sol新增Fast模式(2.5倍速、价格翻倍)。
Artificial Analysis Luna beats DeepSeek V4-Pro on cost-efficiency
输出成本 / M tokens$30USD
输入·未命中 $5
※ 旗舰Sol定价;2026年7月30日起永久降价:Terra $2/$12(降20%)、Luna $0.2/$1.2(降80%);Sol Fast模式2倍价格换2.5倍速
高难度编程复杂分析与推理批量文本处理+1
No.031国产旗舰开源
GLM-5.3
智谱AI(Zhipu AI)
智谱AI 2026年8月14日发布的新一代旗舰模型,743B参数,与GLM-5.2同基座,通过后训练Scaling(IndexShare、SAO及开源Slime强化学习框架)编程能力较GLM-5.2提升50%,Terminal Bench 3.0、Agents' Last Exam (CLI) 开源第一,Agent能力与Kimi K3、Claude Opus 4.8、Claude Fable 5同一水平。已上线ZCode、AutoClaw及GLM Coding Plan全量用户,完整权重两周内开源,API即将上线。
Terminal_Bench_3.0 Open-source #1Agents_Last_Exam_CLI Open-source #1
输出成本 / M tokens¥28CNY
输入·未命中 ¥8·缓存命中 ¥2最大输出 128K Tokens
※ 官方按量价(bigmodel.cn 2026-08 口径):输入 8 元 / 输出 28 元 / 缓存命中 2 元(元/百万tokens),与 GLM-5.2 同价;按量 API 即将上线,当前可通过 GLM Coding Plan 订阅使用
AI编程(ZCode/Claude Code等编码平台)长周期智能体任务复杂软件工程+1
No.032国际旗舰闭源
GPT-5.6 Luna
OpenAI
OpenAI于2026年7月9日发布的新一代模型家族,分为三个层级:旗舰级Sol、主力型号Terra和轻量级Luna。Luna旨在实现低成本高吞吐量,其事实性错误比GPT-5.5 Instant少约62%。自7月30日起永久降价:Luna降价80%,Terra降价20%;Sol新增Fast模式(价格翻倍,速度提升2.5倍)。
Artificial Analysis Luna beats DeepSeek V4-Pro on cost-efficiency
输出成本 / M tokens$1.2USD
输入·未命中 $0.2
※ Luna定价;自2026-07-30起永久降价:Terra $2/$12 (-20%),Luna $0.2/$1.2 (-80%);Sol Fast模式2倍价格,速度提升2.5倍
批量文本处理高吞吐量智能体企业级智能体
No.033高性价比闭源
Claude Haiku 4.5
Anthropic
Anthropic 官网定价页当前在售的最快、最经济档位,适合高并发分类、信息抽取与实时助手场景。
输出成本 / M tokens$5USD
输入·未命中 $1·缓存命中 $0.1
※ 官方现行价(claude.com/pricing,2026-08-31 核对):输入 $1 / 缓存读取 $0.1 / 输出 $5(USD/百万tokens),缓存写入 $1.25
高并发分类信息抽取实时助手
No.034国产旗舰闭源
Kimi K2.7 Code
月之暗面(Moonshot AI)
月之暗面面向代码场景的编程模型,在长上下文中更可靠地遵循指令,编程任务成功率更高;支持文本、图片与视频输入,仅思考模式,上下文 256K。
输出成本 / M tokens¥27CNY
输入·未命中 ¥6.5·缓存命中 ¥1.3
※ 官方价(platform.kimi.com 定价页,2026-08-31 核对):输入 ¥6.5 / 缓存命中 ¥1.3 / 输出 ¥27(元/百万tokens);高速版 kimi-k2.7-code-highspeed 为 ¥13 / ¥54 / 缓存 ¥2.6
AI 编程大型代码库编码 Agent
No.035国产旗舰闭源
GLM-5.3-Flash
智谱AI(Zhipu AI)
智谱 GLM-5.3 的轻量多模态版本,1M 上下文,支持图片、视频、文件与文本输入,缓存存储限时免费。
输出成本 / M tokens¥2.8CNY
输入·未命中 ¥0.8·缓存命中 ¥0.23
※ 官方刊例价(open.bigmodel.cn 价格页,2026-08-31 核对):输入 ¥0.8 / 缓存命中 ¥0.23 / 输出 ¥2.8(元/百万tokens),1M 上下文;上线初期限时 5 折活动价 ¥0.4/¥1.4 不计入本表
高并发廉价推理多模态理解长文档处理
No.036高性价比闭源
Qwen3.7-Plus(通义千问)
阿里云 / 通义实验室
阿里云百炼当前推荐的主力通用模型,1M 上下文,能力与成本均衡,完整支持 Function Calling、内置工具与结构化输出。
输出成本 / M tokens¥8CNY
输入·未命中 ¥2
※ 官方刊例价(阿里云百炼计费页,2026-08-31 核对,≤256K 输入档):输入 ¥2 / 输出 ¥8(元/百万tokens);256K–1M 档 ¥6/¥24;当前限时 8 折,支持上下文缓存与 Batch 半价
日常编程Agent 工作流长文档办公
No.037经济之选闭源
Qwen3.8-Flash(通义千问)
阿里云 / 通义实验室
阿里云百炼新一代轻量模型,原生支持百万级上下文,适合超长文档、大型代码仓库与复杂对话的低成本处理。
输出成本 / M tokens¥2.7CNY
输入·未命中 ¥0.8
※ 官方刊例价(阿里云百炼计费页,2026-08-31 核对,≤1M 输入档):输入 ¥0.8 / 输出 ¥2.7(元/百万tokens);支持上下文缓存
超长文档低成本批处理实时对话
No.038国产旗舰闭源
ERNIE 5.1(文心)
百度(Baidu)
百度千帆当前在售的新一代文心旗舰模型,按输入长度分档计费,已取代原 ERNIE 4.5 档位。
输出成本 / M tokens¥18CNY
输入·未命中 ¥4
※ 官方按量后付费价(百度千帆模型服务计费页,2026-08-27 更新):输入 ¥4 / 输出 ¥18(元/百万tokens,输入≤32K 档);32K–128K 档 ¥6/¥22
政企应用中文内容生成知识问答
No.039经济之选闭源
ERNIE 4.5 Turbo(文心)
百度(Baidu)
百度千帆的高性价比文心模型,128K 上下文,配合批量推理与预置量包可进一步降本。
输出成本 / M tokens¥3.2CNY
输入·未命中 ¥0.8·缓存命中 ¥0.2
※ 官方按量后付费价(百度千帆模型服务计费页,2026-08-27 更新):输入 ¥0.8 / 缓存命中 ¥0.2 / 输出 ¥3.2(元/百万tokens);批量推理 ¥0.32/¥1.28
高并发客服批量文本处理低成本推理
No.040国产旗舰开源
腾讯混元 Hy4 preview
腾讯(Tencent)
腾讯于2026年8月28日发布并开源的新一代旗舰大语言模型,MoE架构770B总参/49B激活,1M上下文(最大输入960K、最大输出64K),主打“懂规划、能执行、可靠交付”的Agent能力。开源预览版(Preview),非GA稳定版,已上线腾讯云TokenHub与OpenRouter。
输出成本 / M tokens¥18CNY
输入·未命中 ¥6·缓存命中 ¥0.3最大输出 64K Tokens
※ 官方2026-08-28发布刊例价(国内站):输入 ¥6 / 缓存命中 ¥0.3 / 输出 ¥18(元/百万tokens);腾讯云国际(新加坡)同模型 $0.834/$2.501/缓存$0.042;Preview早期预览版,非GA
复杂Agent任务长文档/代码理解企业级推理+1
No.041国际旗舰闭源
Claude Fable 5.1
Anthropic
Anthropic于2026年9月初在Fable 5基础上发布的点升级版本(point release)。继承Mythos级旗舰能力,编码、长时程Agent任务与复杂推理持续领先,支持Adaptive Thinking自适应推理、可连续数小时完成复杂任务链;5.1重点打磨了长上下文稳定性、工具调用可靠性与指令遵循。
输出成本 / M tokens$50USD
输入·未命中 $10·缓存命中 $0.25最大输出 128K Tokens
※ 沿用 Claude Fable 5 官方 API 价(anthropic.com 2026-09 口径):输入 $10 / 缓存读取 $0.25 / 输出 $50(USD/百万tokens),缓存写入 $12.5;Batch 50%折扣
大型代码库迁移重构长时程自主Agent复杂多步推理+2