2026 年 9 月 LLM API 价格崩盘:GPT-6 Astra / Fable 5.1 / Gemini 3.8 Flash 等 5 大厂商完整对比表

2026 年 9 月第一周,OpenAI GPT-6 Astra、Anthropic Claude Fable 5.1、Google Gemini 3.8 Flash 同期发布,加上 Sonnet 5 定价永久化、DeepSeek V4 Pro 大幅降价,五大厂商同周改写 LLM API 价格曲线。本文给出完整的每百万 token 输入/输出价格对比表、缓存价格、上下文窗口与实测 benchmark,并给出基于 NixAPI 的统一路由接入建议。

NixAPI Team 2026年9月8日 约17 分钟阅读
2026 年 9 月 LLM API 价格崩盘 五家厂商每百万 token 价格对比表

2026 年 9 月的第一周,AI 行业上演了一场前所未有的「同周撞档」:Anthropic Claude Fable 5.1(9/1)、Google Gemini 3.8 Flash(9/2)、OpenAI GPT-6 Astra(9/3)先后发布,DeepSeek 也在同一窗口完成 V4 Pro 0813 的降价放量。叠加 Anthropic 把 Sonnet 5 的引流价 $2/$10 永久化,五大厂商在五天内把整个 LLM API 价格曲线重写了一遍。

这不是一次普通的版本迭代,而是「价格 - 能力双重竞争」进入新阶段的信号:三家头部厂商步调一致地推 1M 上下文、对齐 agentic coding,并把缓存价格当成新的竞争焦点。

本文给你一张完整的、可执行的对比表:每百万 token 的输入/输出价格、缓存读取、上下文窗口、核心 bench mark,以及这次价格波动里真正的隐藏成本——思考 token(thinking tokens)也按输出计费


一、核心价格对比表(2026 年 9 月 8 日更新)

价格为每百万 token、标准档(Standard)美元价。Batch/Flex 通常为 50% off,Fast/Priority 通常为 2x。

模型供应商输入 $/M输出 $/M缓存读取 $/M上下文上线日期
GPT-6 AstraOpenAI$10.00$50.00$1.001.05M9/3 发布 · 9/4 API
GPT-5.6 SolOpenAI$4.00$20.00$0.40参考
Claude Fable 5.1Anthropic$10.00$50.00$0.251M9/1
Gemini 3.8 FlashGoogle$0.75*$3.75*$0.0751.048M9/2
DeepSeek V4 Pro 0813DeepSeek$0.435$0.87$0.00361M8/12 GA
Claude Sonnet 5Anthropic$2.00$10.001M定价永久化

* Gemini 3.8 Flash 的 $0.75/$3.75 为年终促销价,到 2026-12-31 截止;2027-01-01 起恢复标准价 $1.50/$7.50(输入/输出)。

一眼看懂这张表

  • 最便宜:DeepSeek V4 Pro 无悬念——输入 $0.435、输出 $0.87,比 GPT-6 Astra 便宜一个数量级;
  • 最贵:GPT-6 Astra 与 Claude Fable 5.1 并列第一梯队,均 $10/$50;
  • 价格 - 能力前沿最佳:Gemini 3.8 Flash 的 $0.75/$3.75,是 Astra/Fable 的 1/13,但 Terminal-Bench 2.1 已到 90.8%(官方)——接近昂贵旗舰的水平;
  • 隐藏赢家:Anthropic 把 Fable 5.1 的缓存读取从 $1 砍到 $0.25(降 75%),对长上下文 agentic 工作负载的成本影响巨大。

二、五家到底在拼什么?

1. OpenAI GPT-6 Astra:旗舰价格再上一个台阶

GPT-6 Astra 于 9 月 3 日发布、9 月 4 日上线 API,模型代号 gpt-6-astra,上下文 1,050,000 token、最大输出 128K。

定价:标准 $10/$50;缓存读取 $1(缓存写入 $12.50);超过 272K 输入 token 的长上下文按 2x 输入/1.5x 输出计费。

它比 GPT-5.6 Sol($4/$20)贵 2.5 倍。它和 Claude Fable 5.1 同为当前第一贵的旗舰,也是 OpenAI 首个把缓存写入单独列为 $12.50 计费项(1.25x 未缓存输入)的模型——对长 prompt 的 agentic 任务,缓存成本被单列出来

2. Claude Fable 5.1:真正的「价格屠夫」在缓存

Fable 5.1 的表面价与 Fable 5 相同($10/$50),真正的杀招是缓存读取从 $1 砍到 $0.25(降 75%,为 Fable 5 的 1/4)。

Anthropic 官方估计:典型工作负载总成本降约 25%,复杂编码 / agentic 场景最多可省约 45%——因为 agentic 任务会反复读取同一段持久上下文。

对跑长会话 agent / 批量编码的团队,Fable 5.1 的实际成本竞争力远超表面价格。

3. Gemini 3.8 Flash:把「成本-性能前沿」拉低 13 倍

Google 在 3.6/3.7 之后,六周内第三次发 Flash 序列(3.8 Flash),这一次直接用 $0.75/$3.75 年终促销价入场。

  • Terminal-Bench 2.1:90.8%(官方)/ 89.4%(AA 独立实测)——逼近甚至超过部分昂贵旗舰;
  • DeepSWE 1.1(长程软件工程):73.7%(AA)——「处理复杂工程任务时超过大多数更大旗舰模型」;
  • HLE-Verified:54.9%——多步推理与专业领域能力。

关键点:思考 token 按输出计费,且 API 里 thoughtsTokenCountcandidatesTokenCount 分开返回,两桶都按 $3.75 计。预算跨过 2026-12-31 的,得按 1 月起的 $1.50/$7.50 算。

4. DeepSeek V4 Pro 0813:绝对低价 + 峰谷计费转型

DeepSeek V4 Pro 0813(8/12 GA)把 cache-miss 输入定在 $0.435、输出 $0.87,缓存命中仅 $0.0036——是目前主流大型模型中无可争议的最低价

注意它已从 8/16(UTC) 起转入峰谷计费:低谷价比峰值价低一半,但新的低谷价仍比 0813 现价高 50% 以上。规划长期预算要看清楚自己的调用时段落在峰还是谷。

5. Claude Sonnet 5:引流价「永久化」

Sonnet 5 的 $2/$10 原本是限时促销,如今 Anthropic 宣布永久化——把一个中端 1M 上下文模型的定价腰斩成历史常态。这是竞争姿态:Sonnet 5 用比 Opus/Fable 便宜 5 倍的价格,主打「快 + 便宜 + 够用」的日常生产负载。


三、真正的成本暗礁:thinking tokens & 缓存

这次价格崩盘里,有两个容易被表象误导的细节:

3.1 思考 token 按「输出」计费

Gemini 3.8 Flash、GPT-6 Astra、Claude Fable 5.1 都在推理前「想再想」。这些思考 token 全部按输出价计费,不是按便宜的输入价。

  • Gemini 3.8 Flash:思考 + 可见答案都在 $3.75(输出桶);
  • GPT-6 Astra / Fable 5.1:思考 token 按 $50/百万 输出价算。

实操含义:一个「看起来便宜」的输入价(如 Flash 的 $0.75)只反映 prompt 灌入成本;真正的 bill 由输出侧决定。选型时要用「每任务成本」而非「每 token 价格」比较——例如 Artificial Analysis 实测 Gemini 3.8 Flash 由于多生成约 30% 输出 token,单任务成本 $0.58,高于 3.7 Flash 的 $0.40。

3.2 缓存价才是 agentic 的胜负手

长上下文 agent 会不断重读同一前缀。五家缓存读取价对比:

模型缓存读取 $/Mvs 输入价
Claude Fable 5.1$0.252.5% 输入价
GPT-5.6 Sol$0.4010%
GPT-6 Astra$1.0010%
Gemini 3.8 Flash$0.07510%
DeepSeek V4 Pro$0.0036<1%

DeepSeek 的缓存命中价低到 $0.0036(几乎免费),Fable 5.1 用 $0.25 抢 agentic 负载。G同是 1M 上下文,你的工作负载越是「重读型」(RAG、长会话、代码库级 agent),缓存价权重就越高。


四、所以,作为开发者你该怎么选?

给三类典型场景直接结论:

你的场景推荐理由
成本极度敏感、大批量、检索型DeepSeek V4 Pro输入 $0.435/缓存几乎免费,长上下文 RAG 首选
agentic / 长会话,要旗舰级能力Claude Fable 5.1缓存 $0.25 让长会话成本大降
高性能 + 高性价比均衡Gemini 3.8 FlashTB2.1 90.8%,$0.75/$3.75 年终价,1M ctx
日常生产、要快要稳的 WorkhorseSonnet 5($2/$10 永久)中端价腰斩,适合默认负载
要最强推理 / coding SOTA、预算宽裕GPT-6 Astra1.05M ctx + 旗舰,但 $10/$50 最贵

五、用 NixAPI 做「价格路由层」,而不是锁死单一厂商

价格崩盘的另一面是选型风险:今天 Gemini 3.8 Flash 便宜,明天 DeepSeek 峰谷价变化、后天 Fable 5.1 缓存价调整——绑死一家,等于把成本曲线交给别人。

NixAPI 的价值不是”帮你选模型”,而是让你用一套 OpenAI 兼容接口同时接入全部厂商,把 model 字段当作路由开关

curl https://nixapi.com/v1/chat/completions \
  -H "Authorization: Bearer $NIXAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-6-astra",
    "messages": [{"role": "user", "content": "重构这个 Python 模块并解释你的思路。"}]
  }'

想对比跑哪个,改 model 字段即可,业务代码零改动:

  • 贵在 anthropic/claude-fable-5-1 / openai/gpt-6-astra
  • 便宜在 google/gemini-3.8-flash / deepseek/deepseek-v4-pro

加上统一的缓存命中计费、批量折扣对齐,NixAPI 让你在五家之间做运行时路由,把「价格崩盘」真正变成你的成本优势,而不是选择焦虑。


结语

2026 年 9 月的第一周,五大厂商用五天重写了 LLM API 价格地图:

  • 旗舰新贵:GPT-6 Astra 与 Claude Fable 5.1 并肩登顶 $10/$50;
  • 性价比之王:Gemini 3.8 Flash 用 $0.75/$3.75 把前沿能力拉到 1/13 价格;
  • 绝对低价:DeepSeek V4 Pro $0.435/$0.87,缓存几乎免费;
  • 中端腰斩:Sonnet 5 永久化 $2/$10;
  • 隐藏变量:思考 token 按输出计费、缓存价成为 agentic 胜负手。

真正聪明的接法不是盯着一张价格表选”最好”,而是用 NixAPI 这类聚合层把它们都作为运行时选项。1M 上下文 + agentic coding + 缓存竞争的时代,谁能在厂商间自由路由,谁就掌握了价格曲线的主动权。


相关阅读 / 来源引用

  • OpenAI GPT-6 Astra API Pricing — developers.openai.com/api/docs/pricing
  • Anthropic Fable 5.1 Pricing — platform.claude.com/docs/en/about-claude/pricing
  • Google Gemini 3.8 Flash Pricing & Benchmarks — ai.google.dev/gemini-api/docs/pricing
  • DeepSeek V4 Pro 0813 Pricing — api-docs.deepseek.com/quick_start/pricing
  • Artificial Analysis Terminal-Bench v2.1 Leaderboard — artificialanalysis.ai/evaluations/terminalbench-v2-1
  • NixAPI 支持模型与价格 · NixAPI API 文档 · NixAPI 控制台

立即体验 NixAPI

稳定可靠的大语言模型 API 中转,支持 OpenAI、Claude、Gemini、DeepSeek、Qwen、Grok,充值 ¥0.8 = $1

免费注册