동일한 요청에 대한 같은 LLM 심사 모델의 재순위화가 Spearman 0.400으로 나타났습니다
사전등록된 두 연구는 실제 실험 단계에 도달하지 못했습니다. 장비는 자체 신뢰성 관문을 먼저 통과하지 못했으며, 약 53,000건의 감사된 요청과 4개 제공사 전반에서 그 사실이 드러났습니다.
14시간 전

이 허브는 AI 연구의 방대한 흐름을 압축해 보여드립니다. 의미 있는 논문, 연구소 발표, 벤치마크 결과, 그리고 실제로 분야를 움직이는 방법론을 실무자 중심으로 풀어드립니다.
사전등록된 두 연구는 실제 실험 단계에 도달하지 못했습니다. 장비는 자체 신뢰성 관문을 먼저 통과하지 못했으며, 약 53,000건의 감사된 요청과 4개 제공사 전반에서 그 사실이 드러났습니다.
14시간 전

AI 에이전트가 취약점을 고쳤는지 확인하는 거의 보편적 방식인 ‘충돌을 다시 실행해 여전히 충돌하는지 본다’는 절차가, AIxCC 상위 3개를 포함한 11개 에이전트의 해결률을 과대평가하는 것으로 나타났다.
14시간 전

Google DeepMind의 새 기상 모델은 세 가지 기준 데이터셋에 대해 강수 관련 수치를 세 가지로 제시했다. 보도는 그중 가장 큰 수치를 인용했지만, 이는 지상 관측값이 아닌 위성 산출물과의 비교다.
20시간 전

Nature Medicine이 6월 결과에 대한 동료심사 비판문과 원저자들의 답변을 같은 날 아침 게재했으며, 답변은 세 개 벤치마크 중 두 개를 부수적 자료로 재분류했다.
1일 전

새 논문은 선언된 임무를 완벽히 수행하면서도 에이전트의 선택을 편향시키는 제3자 스킬을 설명하며, 실험된 스캐너들은 이를 탐지하지 못했다고 밝힌다.
1일 전

CJ Logistics는 Olive Young 풀필먼트 라인에 양팔 로봇 2대를 투입해 박스 안에 완충재를 넣는 작업을 맡겼으며, 모든 포장은 사람이 마무리합니다.
1일 전

Facet-0는 다음 동작에서 보게 될 픽셀이 아니라 그 동작이 만들어낼 힘과 토크를 예측합니다. 5개의 서브밀리미터 조립 과제에서 가장 강한 비전 중심 기준선은 15%에 그쳤습니다.
2일 전

Imperial, Stanford, Yale, Harvard Law 출신 저자들이 쓴 Frontiers in Science의 선행 리뷰는, 임상 사용 승인을 실제로 받은 AI는 오래된 딥러닝 진단 기술이며 생성형 AI는 통상 진료에 들어오지 않았다는 디플레이션적 결론을 내립니다.
2일 전

EMNLP 2026 Findings에 채택된 한 논문은 기본 설정에서 측정한 단일 공격 성공률 수치가 배포된 시스템에 대해서는 거의 아무 의미가 없다고 주장합니다.
3일 전

국책 연구기관이 415개 직종을 평가해 292만 명을 고노출군으로 분류했으며, 저노출 직종에서도 채용이 줄었다고 밝혔다.
4일 전

Apollo의 수석 이코노미스트는 Jevons 역설이 해외 고객서비스를 축소하기는커녕 오히려 확대하고 있다고 주장한다. 다만 해당 고용 시계열은 문제의 에이전트 배치 이전에서 멈춘다.
5일 전

Hot Chips에서 제시된 8배 대역폭 수치는 패키지 내부에서 측정된 것이다. 이를 활용하려면 호스트 프로세서의 캐시, 프리페치, 아웃오브오더 실행을 포기해야 한다.
6일 전

"When Context Gets Root"는 모델이 아니라 하네스를 공격합니다. 신뢰할 수 없는 파일 내용이 에이전트의 최고 권한 지시 슬롯으로 다시 직렬화되기 때문입니다. 헤드라인은 13개 중 13개지만, 아래 표는 훨씬 더 구체적인 사실을 말합니다.
2026년 8월 28일

Crossref는 배치 기간 동안 101건의 철회 고지를 기록했으며, 이 가운데 약 90건은 한 출판사의 학회 논문 시리즈에서 나왔다. 하나씩 읽으면 그 규모는 보이지 않는다.
2026년 8월 27일

6개 모델과 153개 과제에서 자기 오염률은 20.3%에서 41.8%였다. 보도될 숫자는 페이로드를 과제군에 맞춰 넣었을 때 측정된 값이다.
2026년 8월 27일

Iterated Distillation and Amplification은 사용 중에 더 좋아지는 모델이 아니라 학습 단계의 기법입니다. Zscaler는 이번 발표의 양쪽에 모두 등장합니다.
2026년 8월 27일

각 새 질의마다 새로운 개인정보 검토가 필요했기 때문에, 파트너들은 대신 다른 공개 데이터셋을 상대로 질문을 시험했다.
2026년 8월 27일

베조스가 이를 'artificial artificial intelligence'라고 부른 지 21년 만에, 현대 AI를 떠받친 라벨링 시장이 종료 시점을 맞습니다. 너무도 그럴듯한 설명은 정답이 아닙니다.
2026년 8월 26일

이 논문의 핵심 주장은 행동 테스트만으로는 에이전트가 원래 구현을 복사해 통과할 수 있다는 점입니다. 논문은 이 실패 모드를 명명한 뒤, 실제로 얼마나 자주 발생하는지 측정합니다.
2026년 8월 25일

4년간의 은밀한 개발, 2,300만 달러 조달, 그리고 모델과 기증 인체 조직 사이의 폐쇄 루프 — 끝에 승인 관문이 없는 시장을 겨냥하고 있습니다.
2026년 8월 22일

이들 예측기는 임상 유전학에서 임상적 의미가 불확실한 변이를 선별하는 데 쓰입니다. 이들이 이긴 벤치마크는 참조 서열을 바탕으로 만들어졌으며, 환자 서열은 아닙니다.
2026년 8월 22일

무작위 실험이 도구와 그 사용 지시를 분리했더니, 거의 모든 피해가 지시 측에 집중됐다.
2026년 8월 22일

벤더가 내세울 수 있는 수치들 — 판독 속도 향상, 신뢰도 상승, 에스컬레이션 감소 — 은 모두 좋은 방향으로 움직였다. 그러나 주요 결과는 그렇지 않았고, 두 가지 소견에서는 오히려 후퇴했다.
2026년 8월 22일

이 실험은 최전선 규모에서는 아예 실행조차 할 수 없었는데, 비학습 기준선이 이미 상한에 도달해 있었기 때문이다.
2026년 8월 22일

냉동 대조군과의 3차례 LoRA 자기학습을 감사한 4명의 연구진은 7가지 측정 실패를 찾아냈으며, 각각은 대조군이 없을 때 발표된 결과를 뒤집습니다.
2026년 8월 21일

실패 양상이 핵심적 발견입니다. 완벽하게 결합하던 설계도 CAR 수용체로 만들면 망가졌고, AI가 최적화하지 않은 인터페이스 밖의 특성 때문에 무너졌습니다.
2026년 8월 21일

Colossal에서 분사한 이 회사는 지금까지 총 6,000만달러를 조달했으며, 그 63배에 해당하는 기업가치를 보고하고 있다. 그 사이에는 후보 유전자 목록이 있다.
2026년 8월 21일

노드도, 용량도, 출시일도, 파트너 실리콘도 없다. 사양처럼 인용되는 수치는 업계가 아직 달성하지 못한 목표다.
2026년 8월 20일

시드 통제 반사실 실험은 기능적 영향은 거의 없지만 큰 기하학적 흔적을 남기며, 가중치 변화만으로 모델을 감사하는 이들에게 경고를 준다.
2026년 8월 20일

MIT와 SRI 연구진이 맹점을 수치로 제시했습니다. 일치하는 에이전트 간 AUROC는 0.993, 벤더가 다르면 0.854였으며, 제어는 화이트박스에서만 작동했습니다.
2026년 8월 20일
