Gemini Flash 周二得分 59;新版指数最高仅 57
Artificial Analysis 于 9 月 4 日发布 Intelligence Index 4.2 版,删除了一项评测、增加了两项,将私有权重加倍,并重新锚定 Elo 量表——此后发布的所有排名都在跨版本对比。
1天前

专业报道人工智能
栏目
Artificial Analysis 于 9 月 4 日发布 Intelligence Index 4.2 版,删除了一项评测、增加了两项,将私有权重加倍,并重新锚定 Elo 量表——此后发布的所有排名都在跨版本对比。
1天前

一款母婴健康 agent 于 9 月 4 日 17:15 UTC 发布。文中所有预测数字都来自 LLM 调用的监督模型,而不是 LLM 本身。
1天前

一则于 9 月 4 日 21:37 UTC 发布的公告,披露了 vLLM 结构化输出路径中的一次拒绝服务漏洞。这与项目此前已经修复过的一处同类漏洞是同一个问题,只是修复没有覆盖到的那条代码路径仍然存在。
1天前

该发布仓库创建于 9 月 4 日 UTC 14:21。其自身的归属文件记录了 106 个文件含有来自 Kevin Buzzard 的帝国理工项目和 flt-regular 的文本,其中 41 个文件逐字节相同。
1天前

两项预注册研究甚至没能走到正式实验阶段。先在可靠性门槛上出局的是测量工具本身,审计了近 53,000 次请求、覆盖四家提供方后仍然如此。
1天前

一种几乎通行的检查 AI agent 是否修复漏洞的方法——重新运行崩溃的 PoC,看它是否还会崩溃——在包括 AIxCC 三强在内的 11 个 agent 上,高估了修复成功率。
1天前

工信部三年支持计划瞄准新增 1 万家 AI 中小企业和 2000 家“专精特新”小巨人。其工具是国家配给算力、受控开放的工业数据集和国家级开源注册库。
2天前

Google DeepMind 的新天气模型发布了三组降水数据,分别对照三套参考数据集。报道引用的是最大的一项,而它是相对于卫星产品测得的,并非相对于地面真实值。
2天前

ARC Prize 在模型发布数小时后,使用其自身的、与供应商无关的基准重新运行了该模型。OpenAI 重点强调的数字来自一个 OpenAI 专用适配器——而被拿来比较的竞品则是按另一种方式测得的。
2天前

Nature Medicine 在同一上午发布了对 6 月结果的同行评议质疑和原作者回复——后者将三项基准中的两项重新归为补充材料。
2天前

一篇新论文描述了第三方技能:它们能完美完成宣称的任务,同时却会偏向性地影响 agent 的选择,而论文测试过的扫描器并未将其标记出来。
2天前

NLTK 为修补先前 pickle 执行漏洞而加入的 pathsec 层默认处于禁用状态——它会发出警告然后继续执行——而另一个路径漏洞则完全没有补丁。
2天前

Omnigent 是一个拥有 9,600 颗星的沙箱封装工具,用于隔离编码代理,却一次性收到四个 CVE——其中最值得细读的是一个解析器失败开放的策略引擎。
2天前

CJ Logistics 在 Olive Young 的真实履约线上部署了两台双臂机器人,它们负责往箱子里填充缓冲材料,由人工完成每一件包裹的收尾。
2天前


Muse Spark 1.3 于 9 月 2 日发布,但其最高推理模式仍为进一步安全测试而暂未开放——而广为引用的前沿得分正来自这一模式。
3天前

Google 的发布博文称其有显著改进;获准发布的 model card 说法相反,而起售价将于 1 月 1 日翻倍。
3天前

LM-SPT 的代码采用 Apache-2.0 许可,权重采用 CC BY-NC 4.0 许可。Kakao 并未主动选择这种分割——限制是从 Emilia 训练语料中继承而来,而该语料在 Hugging Face 上的标签比其条款更宽松。
4天前

Facet-0 预测的是下一步动作将产生的力和扭矩,而不是它将看到的像素。在五项亚毫米装配任务中,最强的视觉主导基线仅达到 15%。
4天前

CVE-2026-72649 将训练好的模型制品变成了 CVSS 8.8 的远程代码执行漏洞。与本周发布的几乎所有其他 AI 安全通告不同,Elastic 指明了修复该漏洞的版本。
4天前
