Gemini Flash 周二得分 59;新版指数最高仅 57
Artificial Analysis 于 9 月 4 日发布 Intelligence Index 4.2 版,删除了一项评测、增加了两项,将私有权重加倍,并重新锚定 Elo 量表——此后发布的所有排名都在跨版本对比。
19小时前

专业报道人工智能
聚焦所有重要模型发布:前沿模型上线、开源权重版本发布、能力跃升、基准测试结果以及 OpenAI、Google、Anthropic、Meta、Mistral 和开源社区的定价变化。
Artificial Analysis 于 9 月 4 日发布 Intelligence Index 4.2 版,删除了一项评测、增加了两项,将私有权重加倍,并重新锚定 Elo 量表——此后发布的所有排名都在跨版本对比。
19小时前

两项预注册研究甚至没能走到正式实验阶段。先在可靠性门槛上出局的是测量工具本身,审计了近 53,000 次请求、覆盖四家提供方后仍然如此。
1天前

ARC Prize 在模型发布数小时后,使用其自身的、与供应商无关的基准重新运行了该模型。OpenAI 重点强调的数字来自一个 OpenAI 专用适配器——而被拿来比较的竞品则是按另一种方式测得的。
1天前

Muse Spark 1.3 于 9 月 2 日发布,但其最高推理模式仍为进一步安全测试而暂未开放——而广为引用的前沿得分正来自这一模式。
2天前

Google 的发布博文称其有显著改进;获准发布的 model card 说法相反,而起售价将于 1 月 1 日翻倍。
2天前

LM-SPT 的代码采用 Apache-2.0 许可,权重采用 CC BY-NC 4.0 许可。Kakao 并未主动选择这种分割——限制是从 Emilia 训练语料中继承而来,而该语料在 Hugging Face 上的标签比其条款更宽松。
3天前

Agentic 视频理解让 Gemini 自行选择抓取哪些时刻,而不是按固定频率采样画面。这是选择性注意,不是压缩——而且当证据分散得很薄时,这种节省就会迅速消失。
3天前

Anthropic 的标价没有变化:输入仍为每百万 token 10 美元,输出仍为每百万 token 50 美元。全部节省都来自缓存读取价格下调 75%,降至每百万 0.25 美元,而这只会在复用前缀的工作负载中体现出来。
3天前

公告称该模型已可在 GitHub 和 Hugging Face 上获取。但其中没有说明,这是该系列首次出现权重不可用于商业用途的情况。
4天前

该模型于 8 月 21 日以仅 API 形式发布。31 日出现了采用 MIT 许可证的权重文件——48 个分片,约 167.8 GB。
5天前

瑞金医院与 Huawei Cloud 在上海推出一款 7B 病理模型,宣称达到 SOTA、96.48% 准确率,并覆盖病理医生日常工作 90%——这三项说法逐一拆开都没有看上去那么强。
2026年8月30日

Z.ai 以一份许可证发布了完整模型权重,要求大型 model-as-a-service 运营商通过一项审查,而审查范围由 Z.ai 自行决定。
2026年8月29日

Gemini Omni 1.1 Flash 于 8 月 27 日上线,支持场景扩展、首尾帧控制和低成本草稿模式。40 秒只是累计上限,每次仅能按 10 秒向末尾追加。
2026年8月28日


GLM-5.3-Flash 以 MIT 许可发布,总参数 3200 亿、激活参数 180 亿。智能体基准分数由内部测试得出,设置了 6 小时时限。
2026年8月27日

2.6% 来自第三方评测机构对主要使用场景的测试。5.04% 来自 Google 在多语言基准上的自测。两者都出现在同一则公告中。
2026年8月27日

这家在香港上市的中国前沿实验室首次公布经审计的半年度业绩:营收 1.166 亿美元,研发支出 2.969 亿美元,毛利率仅 17.9%,说明推理几乎吞噬了每一美元收入的大部分。
2026年8月26日

ModelScope 条目承诺在 15:00 UTC 发布 open-weight 权重,并将其描述为一份架构预览。外界流传的规格来自一张已删除的草稿卡片。
2026年8月26日

这家行业老牌公司对一个未具名的开放权重模型进行了后训练,并在没有附带基准测试的情况下宣称其可与前沿模型比较。背后的经济账才是关键。
2026年8月25日

自 8 月 22 日 16:00 UTC 起,低峰费率覆盖整个周六和周日。低峰 V4-Pro 输出成本为每百万 token 1.98 美元;8 月 16 日前的统一费率为 0.87 美元。
2026年8月23日


这笔软件授权交易、109 名研究人员的个人聘用邀请,以及一笔按投前 120 亿美元估值进行的独立 10 亿美元股权投资,构成了三笔交易。公司所有权没有变更。
2026年8月21日



DeepSeek 曾两次警告将出现“显著”涨价,却没有给出具体数字或日期。如今,这两项都已落地——而且最大幅度的上涨并不是人们常说的那一项。
2026年8月17日

Qwen3.8-27B 是稠密模型而非混合专家模型,原生上下文长度达 262,144 token,且附带全部自报基准成绩。
2026年8月16日

GLM-5.3 与 GLM-5.2 共享同一 753B 基础模型。所有被宣称的提升都来自后训练——且权重要再过两周才会公布。
2026年8月14日

企业自动化得分几乎翻倍,长周期软件工程从 49.0% 升至 65.3%。入门定价为每百万输入 token 0.75 美元,持续至新年。
2026年8月14日

V4-Pro-0813 增加了 Responses API 和工具调用。更关键的是,定价页上的一则说明称价格即将上调。
2026年8月13日

人工智能指数为 61,支持 50 万 token 上下文;是在对 Grok 4.5 进行后训练后打造,而非重新预训练任何新模型。在编码方面,它仍落后于 GPT-5.6。
2026年8月13日
