Новости исследований ИИ

Этот раздел отбирает главное из потока исследований ИИ: значимые статьи, анонсы лабораторий, результаты бенчмарков и методы, которые реально двигают область вперёд — с объяснениями для практиков, а не только для исследователей.

ИИ в здравоохранении

Авторы статьи «LLMs Beat Clinical AI» признают проблемы с двумя бенчмарками

Nature Medicine утром в один и тот же день опубликовал прошедшую рецензирование критику июньского результата и ответ его авторов — при этом в ответе два из трёх бенчмарков были переведены в разряд дополнительных.

18 ч назад

Скриншот из опубликованной критики, где языковая модель восстанавливает оставшуюся часть клинического вопроса бенчмарка, показанную ей лишь частично.
ИИ для производства

Модель робота, ориентированная на усилие, обошла лучший визуальный базис: 82% против 15%

Facet-0 предсказывает усилие и крутящий момент, которые вызовет его следующий шаг, а не пиксели, которые он увидит. На пяти задачах сборки с точностью до долей миллиметра сильнейший визуально-ориентированный базис показал 15%.

1 дн назад

Первая страница препринта arXiv с заголовком Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation, с аннотацией и списком авторов.
ИИ в здравоохранении

Обзор насчитал 1 500 ИИ-медицинских устройств, а в повседневной практике их почти нет

Обзор в Frontiers in Science от исследователей Imperial, Stanford, Yale и Harvard Law выдвигает отрезвляющий тезис: ИИ, допущенный к клиническому применению, — это в основном классическая диагностическая deep learning, а генеративный ИИ до рутинной практики не дошёл.

1 дн назад

Пациент в больничной рубашке лежит на приподнятой больничной койке, рядом медработник в медицинской форме работает за экраном компьютера.
ИИ в юриспруденции

Каждый пятый застрахованный работник в Южной Корее подвержен AI, первыми — юристы

Государственный институт оценил 415 профессий и отнес 2,92 млн работников к группе высокого воздействия — при этом отмечает, что найм снижался и в низкоэкспонированных профессиях.

3 дн назад

Человек, снятый со спины, читает корейское табло объявлений о работе с заголовком JOB INFORMATION, покрытое плакатами ярмарок вакансий и AI-обучения
ИИ в финансах

Дело о том, что ИИ не ударил по колл-центрам, заканчивается в 2025 году

Главный экономист Apollo утверждает, что парадокс Джевонса расширяет офшорный клиентский сервис, а не сокращает его, — опираясь на ряд по занятости, который заканчивается до внедрений агентов, о которых идет речь.

4 дн назад

Сотрудники колл-центра в наушниках за компьютерными рабочими местами в открытом офисе, мужчина на переднем плане говорит по телефону.
ИИ-агенты

Шесть coding-агентов провалились 13 из 13 — реальная ставка Claude Code составляет 31,7%

«When Context Gets Root» атакует не модель, а harness: ненадёжное содержимое файлов повторно сериализуется в слот инструкций с наивысшим приоритетом у агента. В заголовке — 13 из 13. Таблицы ниже говорят о гораздо более конкретной вещи.

6 дн назад

карточка alphaXiv для статьи «When Context Gets Root: Privilege Escalation in LLM Harnesses» со списком авторов и миниатюрой первой страницы, пометка arXiv:2608.27299v1 27 Aug 2026
Безопасность ИИ

Самоэволюционирующие кодовые агенты воспроизводят вредоносный код из общих навыков

На шести моделях и 153 задачах уровень самозаражения составляет от 20,3% до 41,8%. В публикации будут цитировать показатель, измеренный, когда полезная нагрузка подогнана под семейство задач.

27 авг. 2026 г.

Карточка статьи alphaXiv на розовом фоне с заголовком 'EVOMAL: Self-Poisoning in Self-Evolving Coding Agents' и списком авторов ниже.
Исследования ИИ

Amazon закрывает Mechanical Turk 30 September, без объяснений

Спустя 21 год после того, как Безос назвал его «искусственным искусственным интеллектом», маркетплейс, поставлявший разметку для современного ИИ, получил дату закрытия. Очевидное объяснение — неверное.

26 авг. 2026 г.

Иллюстрация: мужчина в костюме и гуманоидный робот рядом на жёлтом фоне, соединённые линией, проведённой от головы мужчины
ИИ в здравоохранении

Четыре AI-инструмента для рентгена груди повысили уверенность, но не точность

Показатели, которые можно продать заказчику — более быстрые расшифровки, более высокая уверенность, меньше эскалаций, — пошли в правильную сторону. Но первичный исход — нет, а по двум находкам он даже ухудшился.

22 авг. 2026 г.

Рентгенограмма грудной клетки в прямой заднепередней проекции, тип исследования, оцененный в работе. Изображение из Wikimedia Commons, не из статьи.
Исследования ИИ

Необученная модель набрала 0.280 по метрике, используемой для доказательства самоулучшения

Проверяя три раунда самообучения LoRA на фоне замороженного контрольного прогона, четыре исследователя выявили семь сбоев измерения — каждый из которых обращает опубликованный вывод вспять, если контроль отсутствует.

21 авг. 2026 г.

Логотип arXiv серыми буквами с красным X на белом фоне.
Авторское право и ИИ

Один внедрённый фрагмент затронул 32 модели, а к концу обучения исчез

Контролируемый контрфактуальный эксперимент показывает большой геометрический след почти без функционального эффекта — и служит предупреждением для тех, кто оценивает модели по сдвигам весов.

20 авг. 2026 г.

Карта модели Hugging Face для openai-community/gpt2 — GPT-2, использованной в исследовании, — показана как цветной градиентный блок с названием репозитория.
Anthropic

Собственный метод Anthropic, применённый к пожертвованным логам чатов, отбрасывает половину разговоров

Независимый проект повторно прогнал рабочую классификацию лаборатории и обнаружил, что в отфильтрованной половине сосредоточены темы здоровья, домогательств и сексуального содержания.

19 авг. 2026 г.

Иллюстрация в сине-розовых тонах: двое людей стоят рядом у увеличенной панели чата.