Anthropic
Fable 5.1 的“便宜 25%”其实是缓存读取降价,不是 Token 降价
Anthropic 的标价没有变化:输入仍为每百万 token 10 美元,输出仍为每百万 token 50 美元。全部节省都来自缓存读取价格下调 75%,降至每百万 0.25 美元,而这只会在复用前缀的工作负载中体现出来。
2天前

专业报道人工智能
Anthropic 的标价没有变化:输入仍为每百万 token 10 美元,输出仍为每百万 token 50 美元。全部节省都来自缓存读取价格下调 75%,降至每百万 0.25 美元,而这只会在复用前缀的工作负载中体现出来。
2天前

Qwen3.8-Max 于周一上午上线,基准表显示其在 GPT-5.6 Sol 和 Claude Fable 5 上取得胜利。但完整查看同一张表会发现,它在所有高难度 agentic engineering 项目上全部失利。
2026年8月3日

AI Technology Evaluation 以从未公开的盲测数据对模型打分,这也是判断基准结果是否被记忆的唯一方式。它完全不具备监管效力。
2026年7月28日

RadLE 2.0 在 200 个 X 光病例上测试了 16 个前沿模型,并采用会惩罚自信错误的评分体系;人类放射科医生得分为 988.7 分,满分 2,000 分,优于最佳 AI 的 758 分。
2026年7月19日

随着标准排行榜趋于饱和且受到污染,中国AI领袖主张,应以真实世界任务表现——以及“每日活跃智能体”等指标——取代静态基准测试。
2026年7月19日
