동일한 요청에 대한 같은 LLM 심사 모델의 재순위화가 Spearman 0.400으로 나타났습니다
사전등록된 두 연구는 실제 실험 단계에 도달하지 못했습니다. 장비는 자체 신뢰성 관문을 먼저 통과하지 못했으며, 약 53,000건의 감사된 요청과 4개 제공사 전반에서 그 사실이 드러났습니다.
14시간 전

섹션
사전등록된 두 연구는 실제 실험 단계에 도달하지 못했습니다. 장비는 자체 신뢰성 관문을 먼저 통과하지 못했으며, 약 53,000건의 감사된 요청과 4개 제공사 전반에서 그 사실이 드러났습니다.
14시간 전

AI 에이전트가 취약점을 고쳤는지 확인하는 거의 보편적 방식인 ‘충돌을 다시 실행해 여전히 충돌하는지 본다’는 절차가, AIxCC 상위 3개를 포함한 11개 에이전트의 해결률을 과대평가하는 것으로 나타났다.
14시간 전

MIIT의 3개년 지원 계획은 신규 AI 중소기업 1만 개와 ‘작은 거인’ 2,000개를 목표로 합니다. 수단은 국가 배분형 컴퓨트, 선별 개방되는 산업 데이터, 국가 차원의 오픈소스 등록체계입니다.
17시간 전

Google DeepMind의 새 기상 모델은 세 가지 기준 데이터셋에 대해 강수 관련 수치를 세 가지로 제시했다. 보도는 그중 가장 큰 수치를 인용했지만, 이는 지상 관측값이 아닌 위성 산출물과의 비교다.
19시간 전

ARC Prize는 출시 몇 시간 뒤 자체 provider-neutral 하니스로 모델을 다시 돌렸다. OpenAI가 헤드라인에 내세운 수치는 OpenAI 전용 어댑터에서 나온 것이었고, 비교 대상으로 삼은 경쟁 모델은 다른 방식으로 측정됐다.
20시간 전

Nature Medicine이 6월 결과에 대한 동료심사 비판문과 원저자들의 답변을 같은 날 아침 게재했으며, 답변은 세 개 벤치마크 중 두 개를 부수적 자료로 재분류했다.
1일 전

새 논문은 선언된 임무를 완벽히 수행하면서도 에이전트의 선택을 편향시키는 제3자 스킬을 설명하며, 실험된 스캐너들은 이를 탐지하지 못했다고 밝힌다.
1일 전

이전 pickle 실행 결함을 완화하기 위해 NLTK가 추가한 pathsec 계층은 기본값이 비활성화이며, 경고를 띄운 뒤 계속 진행합니다. 별도의 경로 결함에는 아예 패치가 없습니다.
1일 전

코딩 에이전트를 샌드박스에 가두는 9,600개 스타의 하니스 Omnigent가 한꺼번에 4건의 CVE를 받았는데, 가장 시사적인 것은 파서가 실패 개방하는 정책 엔진입니다.
1일 전

CJ Logistics는 Olive Young 풀필먼트 라인에 양팔 로봇 2대를 투입해 박스 안에 완충재를 넣는 작업을 맡겼으며, 모든 포장은 사람이 마무리합니다.
1일 전

Google이 내부에서 사용하는 버그 탐지 하네스를 오픈소스로 공개했습니다. 인용되고 있는 수치는 정확도가 아니라, 해당 게시물이 반박하는 업계 기준선입니다.
1일 전

Muse Spark 1.3은 9월 2일 공개됐지만, 가장 높은 추론 모드는 추가 안전성 테스트를 위해 보류됐습니다. 널리 인용된 최전선 점수는 바로 그 모드에서 나왔습니다.
1일 전

Google의 출시 게시물은 이를 중대한 개선이라고 설명하지만, 공개 승인을 내린 모델 카드는 정반대를 말한다. 도입 가격은 1월 1일 두 배로 오른다.
1일 전

LM-SPT의 코드는 Apache-2.0이고 가중치는 CC BY-NC 4.0입니다. Kakao가 이 구분을 택한 것은 아니며, 해당 제한은 Emilia 학습 코퍼스에서 이어진 것입니다. 다만 그 자체의 Hugging Face 태그는 약관보다 더 허용적입니다.
2일 전

Facet-0는 다음 동작에서 보게 될 픽셀이 아니라 그 동작이 만들어낼 힘과 토크를 예측합니다. 5개의 서브밀리미터 조립 과제에서 가장 강한 비전 중심 기준선은 15%에 그쳤습니다.
2일 전

CVE-2026-72649는 훈련된 모델 아티팩트를 CVSS 8.8의 원격 코드 실행으로 전환합니다. 이번 주 공개된 거의 모든 다른 AI 관련 권고와 달리, Elastic은 이를 수정하는 버전까지 명시했습니다.
2일 전

CERT/CC는 Hugging Face에 통지한 지 4주 뒤인 9월 1일 VU#456290을 공개했습니다. 현재 배포판에는 공급업체의 성명도, 패치도 없으며, 순서도 그대로입니다. 해당 상한을 8개 버전이나 지난 상태입니다.
2일 전

Imperial, Stanford, Yale, Harvard Law 출신 저자들이 쓴 Frontiers in Science의 선행 리뷰는, 임상 사용 승인을 실제로 받은 AI는 오래된 딥러닝 진단 기술이며 생성형 AI는 통상 진료에 들어오지 않았다는 디플레이션적 결론을 내립니다.
2일 전

에이전트형 비디오 이해는 Gemini가 고정된 속도로 프레임을 샘플링하는 대신 어떤 순간을 가져올지 고르게 한다. 이는 압축이 아니라 선택적 주의이며, 근거가 얇게 흩어져 있으면 절감 효과는 사라진다.
2일 전

Anthropic의 기준 요금은 변하지 않았습니다. 입력은 100만 토큰당 10달러, 출력은 50달러입니다. 절감분은 전부 캐시 읽기 비용이 75% 내려 100만당 0.25달러가 된 데서 나오며, 이는 접두사를 재사용하는 작업량에서만 실현됩니다.
2일 전
