Claude Opus 5 价格减半逼近旗舰
Kimi K3 却陷「自称 Claude」蒸馏门 × 本周 AI 周报(2026)

若你正评估 Claude Opus 5 是否值得从 Fable 5 降级切换,或好奇 Kimi K3 蒸馏门 到底有没有实锤——本周 AI 圈两件大事都指向同一主题:性价比模型能力的真实来源。2026 年 7 月 24 日 Anthropic 发布 Opus 5 并设为 Claude Max 默认模型;月之暗面 K3 则遭白宫公开指控「工业级蒸馏」,独立研究者更发现 K3 会自称是 Claude 并吐出内部部署 ID。本文严格覆盖源文档全部要点:Opus 5 定价与 Benchmark 对比、K3 白宫指控与专家时间线反驳、Ryan Greenblatt 技术证据、选型决策矩阵、六步落地指南与 FAQ最后更新:2026-07-25

01

本周 AI 圈两大事件:开发者选型必须面对的六大痛点

Opus 5 与 K3 蒸馏门表面无关,实则都在回答同一个问题:前沿智能到底值多少钱,以及「便宜」是否意味着「有问题」。以下六点是目前技术社区讨论最集中的摩擦:

  1. 01

    旗舰 vs 日常主力难取舍:Fable 5 能力最强但价格翻倍;Opus 5 号称 CursorBench 仅差 0.5% 却半价——团队需要重新评估默认路由。

  2. 02

    数据留存合规门槛:Fable 5 / Mythos 5 要求接受 30 天数据留存;Opus 5 延续历代 Opus「默认不强制留存」——企业场景可能因此倒向 Opus。

  3. 03

    K3 能力无法独立验证:完整权重承诺 7 月 27 日才放出,争议爆发时外部研究者无法复现 2.8T 架构与跑分(参见 K3 开源权重倒计时)。

  4. 04

    蒸馏指控缺乏公开证据:白宫 OSTP 主任 Kratsios 7 月 22–23 日发文指控,但未公布支撑材料;月之暗面亦未回应训练过程质询。

  5. 05

    时间线逻辑存疑:Fable 5 7 月 1 日才公开可用,K3 7 月 16 日发布——仅两周,独立专家质疑「深度蒸馏」在算力与 API 成本上不可行。

  6. 06

    供应链与政策风险:指控还涉及未获出口许可的 Nvidia GB300 芯片;若政策收紧,国产开放权重模型的合规成本可能上升。

「两件事连起来看:Opus 5 用半价逼近旗舰回应性价比诉求;K3 争议则是行业第一次公开摊牌——你的低价到底是技术优化,还是白嫖别人的模型?」

02

Claude Opus 5 发布:价格没变,性能「跳级」——与 Fable 5 怎么选?

2026 年 7 月 24 日(美国太平洋时间),Anthropic 正式发布 Claude Opus 5(模型 ID:claude-opus-5),并同步将其设为 Claude Max 默认模型,Claude Pro 用户也可使用目前最强版本。定价与 Opus 4.8 完全相同:输入 $5 / 百万 tokens,输出 $25 / 百万 tokens;上下文窗口 100 万 tokens(默认且唯一档位),最大输出 128K;Thinking 默认开启。

维度Claude Opus 5Claude Fable 5
输入 / 输出定价$5 / $25 每百万 tokens约 $10 / $50 每百万 tokens(约为 Opus 5 两倍)
CursorBench 3.2(max effort)与 Fable 5 峰值相差 0.5%峰值基准
Frontier-Bench v0.1超越所有模型,为 Opus 4.8 的 2 倍以上
ARC-AGI 3得分为次优模型的 3 倍
OSWorld 2.0用不到 Fable 5 三分之一成本超过其最佳成绩计算机操作能力标杆
数据留存默认不强制数据留存需接受 30 天数据留存政策
产品定位日常主力 / Claude Max 默认旗舰 / 极限 Agent 任务

关键 Benchmark 与客户反馈

  • Cursor 团队:「Opus 5 以 Opus 速度与成本交付接近 Fable 5 的智能,CursorBench 仅略低于 Fable 5。」
  • Zapier AutomationBench:Opus 5 登顶排行榜,端到端账户健康工作流 100% 通过率——此前模型均未通过。
  • Box 实测:数据分析工作流提升 11%,尽职调查场景提升 17%,整体准确率提升 8%。
  • 生命科学:从光谱推断分子结构内部评测比 Opus 4.8 高 10.2 个百分点;蛋白质序列变异功能预测高 7.7 个百分点

安全性:最对齐的一代,但故意未刷网络安全前沿

Anthropic 自动化行为审计显示 Opus 5 是迄今为止最对齐的模型——欺骗行为发生率最低,最不容易被诱导滥用。但在网络安全攻击、生物安全等高风险双用途能力上,Anthropic 故意未让 Opus 5 冲到最前——该位置仍由受限发行的 Mythos 5 占据。Opus 5 网络安全分类器比 Fable 5 宽松约 85%,可用于源码级漏洞发现,但仍屏蔽二进制漏洞扫描、渗透测试与 exploit 生成。

info

信源:Anthropic 官方发布(anthropic.com/news/claude-opus-5)、CNBC、The Verge、The New Stack。

03

Kimi K3「蒸馏门」:白宫下场、专家吐槽时间线、却挖出新证据

如果说 Opus 5 是「正常发新品」,Kimi K3 的剧情则复杂得多。月之暗面 7 月 16 日发布 Kimi K3——总参数 2.8 万亿,全球首个进入「3T 级」的开源模型;稀疏 MoE 架构(896 专家 / 每 token 激活 16 个,约等效 500 亿激活参数);100 万 token 上下文 + 原生视觉理解。GPQA-Diamond 93.5%、BrowseComp 91.2% 均为发布时开源模型最高分(详见 Kimi K3 深度评测)。

争议时间线速览

日期事件
2026-02Anthropic 首次公开指控月之暗面 / DeepSeek / MiniMax「产业级蒸馏攻击」,称检测到 340 万+ 异常 API 交互
2026-07-01Claude Fable 5 面向公众正式可用
2026-07-16Kimi K3 API / 产品正式发布
2026-07-22/23白宫 OSTP 主任 Michael Kratsios 指控「大规模、隐蔽的产业级蒸馏」+ 涉嫌违规使用 Nvidia GB300 芯片
2026-07-23TechCrunch 刊发多位独立研究者质疑「两周内蒸馏不现实」的报道
2026-07-24Redwood Research 的 Ryan Greenblatt 发布「K3 自称 Claude」统计分析(GitHub: rgreenblatt/which_claude_is_k3)
2026-07-27(计划)Kimi K3 完整权重开源,外部可独立验证

白宫指控 vs 专家反驳

Kratsios 原话:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology… is unacceptable.」财政部长 Scott Bessent 随后称「在很多中国模型上发现了美国大模型的水印」——但财政部未说明「水印」具体指什么。

「Fable 从 7 月 1 日才开始公开可用,你不可能在两周内蒸馏出这么多数据、训练完模型还发布出来。」—— Braden Hancock,Snorkel AI 联合创始人

Allen Institute for AI 研究员 Nathan Lambert 补充:随着中国模型逼近前沿,简单监督微调式蒸馏的边际收益正在变小,真正拉开差距的是更耗时的强化学习训练——「如果蒸馏真这么好用,所有追赶者早就靠蒸馏追平了。」

warning

行业背景:Elon Musk 曾在庭审中承认 xAI 训练 Grok 时蒸馏过 OpenAI 模型,并称这在行业内很常见——「蒸馏」本身并不违法,核心在于「正常技术借鉴」与「隐蔽工业级窃取」的边界如何界定。

04

Kimi K3 为什么会「自称是 Claude」?——迄今最具技术含量的间接证据

这是整个事件里最值得细品的角度,也是英文 SEO 文档建议主攻的差异化关键词:Kimi K3 自称是 Claude / Why does Kimi K3 say it's Claude。

Ryan Greenblatt 在 7 月 24 日前后公开统计分析,对比多个模型被问及「你是谁」时的身份自认行为。结果:

  • Kimi K3 异常高频地自称是 Claude,甚至会吐出 Claude 官方内部部署 ID 字符串,如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 真正的 Claude 模型自己都不会这样报——Sonnet 4.5 只会说「我是 Claude Sonnet 4.5」,Opus 4.5 甚至可能报错或不报版本号
  • K3 自称的版本锁定在「Claude 4.5 时代」(2025 年末),而非当前 Fable/Mythos 系列;上一代 K2 信号指向更早的 Claude Sonnet 4——呈现「逐代追新」规律
example
# K3 可能输出的内部部署 ID(真 Claude 模型通常不会主动报出)
claude-opus-4-5-20250929
claude-sonnet-4-5-20250929

# Greenblatt 解读:模型说出「教师模型」部署元数据,
# 比教师模型自己说得还准 → 更可能指向训练数据混入了
# 带部署元数据标注的 Claude 数据(API 日志或打标合成数据)

Greenblatt 本人强调:这不能直接证明「蒸馏发生了」——身份混淆也可能来自训练数据污染、系统提示词泄露或公开数据集合成样本。但结合 Anthropic 2 月指控与本次统计规律,「蒸馏说」第一次有了比「白宫喊话」更扎实的技术支撑。

Opus 5 vs Kimi K3:本周选型决策矩阵

维度Claude Opus 5Kimi K3
定价层级闭源 API,约为 Fable 5 一半开源 + 低价,官方称远低于 Fable 5 / GPT-5.6 Sol
合规 / 数据留存默认不强制留存,Anthropic 官方渠道开放权重,但蒸馏指控带来供应链风险
可独立验证API 即日可用,Benchmark 可复现完整权重 7 月 27 日前无法验证架构
审查 / 拒答对齐策略严格,网络安全分类器仍拦截高风险操作社区认为卖点之一是更少内容审查限制
本地部署❌ 闭源2.8T 参数,几乎无人能在本地跑满
适用场景合规敏感企业、日常 Agent / 编码主力极限成本、可接受溯源争议、等待权重验证后实测
05

六步模型选型落地指南:先看场景,再看立场

  1. 01

    明确合规边界:若场景涉及数据留存、出口管制或供应链审计,优先评估 Opus 5「默认不强制留存」与 Anthropic 官方 SLA,而非仅看 Benchmark 分数。

  2. 02

    算清真实 Token 成本:Opus 5 与 Opus 4.8 同价但能力跳级——若你此前因 Fable 5 价格犹豫,用 CursorBench / AutomationBench 对照任务跑一轮 A/B 再定默认路由。

  3. 03

    K3 等到 7 月 27 日再下结论:完整权重放出前,架构细节与跑分均无法被外部独立验证;可参考 开源权重发布倒计时 制定验证清单。

  4. 04

    关注「身份混淆」类间接信号:对开源模型做简单的「你是谁」探针测试,异常部署 ID 输出可能提示训练数据污染风险——尤其用于生产 Agent 路由时。

  5. 05

    英文内容分发带差异化角度:若运营双语博客,英文版标题/H2 应命中 Why does Kimi K3 say it's Claude 等母语者真实搜索词,而非直译「蒸馏门」。

  6. 06

    执行层与模型层分离:无论 API 选 Opus 5 还是 K3,iOS CI/CD、CLI Agent 长会话、Keychain 隔离等 macOS 重负载仍需稳定执行节点——勿把模型降价等同于基础设施免费。

可引用硬核数据(EEAT)

  • Opus 5 性价比:CursorBench 3.2 max effort 与 Fable 5 峰值相差 0.5%,成本约为 Fable 5 的 50%
  • K3 参数规模:总参数 2.8T,896 专家 MoE,每 token 激活 16 专家(约 50B 激活参数)
  • 蒸馏时间窗口:Fable 5 公开可用(7/1)至 K3 发布(7/16)仅 14 天——多位独立研究者认为不足以完成 RL 式深度蒸馏
  • Anthropic 历史指控:2026 年 2 月称检测到月之暗面相关 340 万+ 异常 API 交互,归因于「刻意能力提取」

Opus 5 让云端 API 的「日常主力」档位大幅升级,K3 则把开源与闭源的能力差距压缩到「天数级」——但廉价 Linux VPS 无法运行 xcodebuild、notarytool 或 Claude Code 所需的 macOS 工具链;本地 Mac 又常面临内存与磁盘瓶颈。若团队同时维护多模型 API 路由iOS CI/CD / CLI Agent 长会话,把 macOS 重负载放在可独占、SSH 稳定的远程节点,通常比押注单台本地硬件更可靠——模型 API 再便宜也解决不了 Keychain 隔离与会话稳定性。对需要稳定 SSH 长会话、可预期带宽的生产环境,NodeMini 的 Mac Mini 云端租赁通常是更优解。规格见 租赁价格说明,接入见 帮助中心

最后更新:2026-07-25。K3 完整权重预计 7 月 27 日放出,建议届时追更独立验证结果。

FAQ

常见问题

Opus 5 维持 $5/$25 每百万输入/输出 token,约为 Fable 5($10/$50 量级)的一半;CursorBench 3.2 上与 Fable 5 峰值成绩相差不到 1%。若需要稳定 macOS 执行层配合 Agent 工作流,可参考 租赁价格说明

是的,2026 年 7 月 24 日发布当天起 Opus 5 成为 Claude Max 默认模型,也是 Claude Pro 用户可用的最强版本。可通过 Claude API、AWS Bedrock、Google Vertex AI、Microsoft Foundry 接入,模型 ID 为 claude-opus-5

截至本文发布仍是有争议、未被最终证实的指控。白宫缺乏公开证据;专家从时间线质疑两周内完成深度蒸馏不现实;Ryan Greenblatt 发现的「K3 自称 Claude 并吐出内部版本号」是目前最具技术含量的间接证据。更多 K3 技术细节见 Kimi K3 深度评测

官方承诺 2026 年 7 月 27 日放出完整权重。本文发布时尚未放出,外部研究者尚无法完全独立验证架构与跑分。发布日核对清单见 开源权重倒计时

Redwood Research 统计分析显示 K3 在被问身份时异常高频自称 Claude,甚至输出 claude-opus-4-5-20250929 等内部部署 ID——比真 Claude 模型报得还准。可能指向训练数据混入了带部署元数据标注的 Claude 数据,但不能直接证明蒸馏。远程开发环境问题见 帮助中心