《Nature Medicine》的 0.91 AUROC 属于 Transformer,而不是 LLM
一款母婴健康 agent 于 9 月 4 日 17:15 UTC 发布。文中所有预测数字都来自 LLM 调用的监督模型,而不是 LLM 本身。
20小时前

专业报道人工智能
本栏目梳理AI研究的海量资讯:重要论文、实验室公告、基准测试结果,以及真正推动领域前进的方法——面向实践者,而不仅仅是研究人员。
一款母婴健康 agent 于 9 月 4 日 17:15 UTC 发布。文中所有预测数字都来自 LLM 调用的监督模型,而不是 LLM 本身。
20小时前

该发布仓库创建于 9 月 4 日 UTC 14:21。其自身的归属文件记录了 106 个文件含有来自 Kevin Buzzard 的帝国理工项目和 flt-regular 的文本,其中 41 个文件逐字节相同。
1天前

两项预注册研究甚至没能走到正式实验阶段。先在可靠性门槛上出局的是测量工具本身,审计了近 53,000 次请求、覆盖四家提供方后仍然如此。
1天前

一种几乎通行的检查 AI agent 是否修复漏洞的方法——重新运行崩溃的 PoC,看它是否还会崩溃——在包括 AIxCC 三强在内的 11 个 agent 上,高估了修复成功率。
1天前

Google DeepMind 的新天气模型发布了三组降水数据,分别对照三套参考数据集。报道引用的是最大的一项,而它是相对于卫星产品测得的,并非相对于地面真实值。
1天前

Nature Medicine 在同一上午发布了对 6 月结果的同行评议质疑和原作者回复——后者将三项基准中的两项重新归为补充材料。
2天前

一篇新论文描述了第三方技能:它们能完美完成宣称的任务,同时却会偏向性地影响 agent 的选择,而论文测试过的扫描器并未将其标记出来。
2天前

CJ Logistics 在 Olive Young 的真实履约线上部署了两台双臂机器人,它们负责往箱子里填充缓冲材料,由人工完成每一件包裹的收尾。
2天前

Facet-0 预测的是下一步动作将产生的力和扭矩,而不是它将看到的像素。在五项亚毫米装配任务中,最强的视觉主导基线仅达到 15%。
3天前

一篇来自帝国理工、斯坦福、耶鲁和哈佛法学院的《Frontiers in Science》主导综述提出一种去泡沫化判断:真正获准用于临床的 AI 主要仍是老派的深度学习诊断工具,而生成式 AI 尚未进入常规实践。
3天前

一篇被 EMNLP 2026 Findings 接收的论文认为,在默认配置下测得的单一攻击成功率数字,几乎无法说明已部署系统的真实情况。
4天前




“When Context Gets Root”攻击的是 harness,而不是模型:不受信任的文件内容被重新序列化进代理最高权限的指令槽。头条写的是 13 中 13;下方表格讲的是更具体的情况。
2026年8月28日

Crossref 在这一批窗口内记录了 101 则撤稿通知,其中约 90 则来自同一家出版商的会议系列。逐条阅读时,这一规模并不明显。
2026年8月27日




在 Bezos 21 年前称其为“人工的人工智能”之后,这个为现代 AI 提供标注数据的市场终于迎来一个日期。显而易见的解释其实并不成立。
2026年8月26日


四年隐身、融资 2300 万美元,以及模型与捐赠人体组织之间的闭环——瞄准的是一个终点根本没有审批关卡的市场。
2026年8月22日





四名研究者将三轮 LoRA 自训练与冻结对照进行审计,发现了七项测量失误——在缺少对照时,每一项都会颠覆一项已发表的结论。
2026年8月21日


这家从 Colossal 分拆出来的公司累计融资 6000 万美元,并报告其估值为这一数字的 63 倍。两者之间夹着一份候选基因清单。
2026年8月21日

没有节点工艺、没有容量、没有发布日期,也没有合作伙伴芯片。被当作规格引用的这些数字,其实是行业尚未实现的目标。
2026年8月20日
