동일한 요청에 대한 같은 LLM 심사 모델의 재순위화가 Spearman 0.400으로 나타났습니다
사전등록된 두 연구는 실제 실험 단계에 도달하지 못했습니다. 장비는 자체 신뢰성 관문을 먼저 통과하지 못했으며, 약 53,000건의 감사된 요청과 4개 제공사 전반에서 그 사실이 드러났습니다.
13시간 전

중요한 모든 모델 출시 소식을 한곳에 모았습니다. OpenAI, Google, Anthropic, Meta, Mistral 및 오픈소스 커뮤니티의 프런티어 출시, 오픈 웨이트 공개, 성능 도약, 벤치마크 결과, 가격 변경을 다룹니다.
사전등록된 두 연구는 실제 실험 단계에 도달하지 못했습니다. 장비는 자체 신뢰성 관문을 먼저 통과하지 못했으며, 약 53,000건의 감사된 요청과 4개 제공사 전반에서 그 사실이 드러났습니다.
13시간 전

ARC Prize는 출시 몇 시간 뒤 자체 provider-neutral 하니스로 모델을 다시 돌렸다. OpenAI가 헤드라인에 내세운 수치는 OpenAI 전용 어댑터에서 나온 것이었고, 비교 대상으로 삼은 경쟁 모델은 다른 방식으로 측정됐다.
19시간 전

Muse Spark 1.3은 9월 2일 공개됐지만, 가장 높은 추론 모드는 추가 안전성 테스트를 위해 보류됐습니다. 널리 인용된 최전선 점수는 바로 그 모드에서 나왔습니다.
1일 전

Google의 출시 게시물은 이를 중대한 개선이라고 설명하지만, 공개 승인을 내린 모델 카드는 정반대를 말한다. 도입 가격은 1월 1일 두 배로 오른다.
1일 전

LM-SPT의 코드는 Apache-2.0이고 가중치는 CC BY-NC 4.0입니다. Kakao가 이 구분을 택한 것은 아니며, 해당 제한은 Emilia 학습 코퍼스에서 이어진 것입니다. 다만 그 자체의 Hugging Face 태그는 약관보다 더 허용적입니다.
2일 전

에이전트형 비디오 이해는 Gemini가 고정된 속도로 프레임을 샘플링하는 대신 어떤 순간을 가져올지 고르게 한다. 이는 압축이 아니라 선택적 주의이며, 근거가 얇게 흩어져 있으면 절감 효과는 사라진다.
2일 전

Anthropic의 기준 요금은 변하지 않았습니다. 입력은 100만 토큰당 10달러, 출력은 50달러입니다. 절감분은 전부 캐시 읽기 비용이 75% 내려 100만당 0.25달러가 된 데서 나오며, 이는 접두사를 재사용하는 작업량에서만 실현됩니다.
2일 전

이 발표는 모델이 GitHub와 Hugging Face에서 제공된다고 밝힌다. 그러나 이번 시리즈에서 처음으로 가중치가 상업적으로 사용할 수 없다는 점은 언급하지 않는다.
3일 전

이 모델은 8월 21일 API 전용으로 발표됐다. MIT 라이선스가 적용된 가중치 48개 샤드, 약 167.8GB는 8월 31일 나타났다.
4일 전

Ruijin Hospital과 Huawei Cloud는 상하이에서 7B 병리 모델을 공개하며, 최고 성능과 96.48% 정확도, 병리의사의 하루 업무의 90%를 포괄한다고 주장했는데, 이 세 주장 모두 읽히는 것보다 의미가 적습니다.
5일 전

Z.ai는 대형 model-as-a-service 운영사가 Z.ai가 범위를 스스로 정하는 심사를 통과하도록 요구하는 라이선스에 따라 full model의 가중치를 공개했다.
6일 전

Gemini Omni 1.1 Flash는 장면 확장, 첫·마지막 프레임 제어, 저가 드래프트 모드를 탑재해 8월 27일 출시됐다. 40초 수치는 한 번에 10초씩 누적해 도달하는 총 상한선이며, 뒤에만 이어 붙일 수 있다.
2026년 8월 28일

Iterated Distillation and Amplification은 사용 중에 더 좋아지는 모델이 아니라 학습 단계의 기법입니다. Zscaler는 이번 발표의 양쪽에 모두 등장합니다.
2026년 8월 27일

GLM-5.3-Flash는 MIT 라이선스 아래 제공되며 총 3200억 개, 활성 180억 개 파라미터를 갖습니다. 에이전트형 벤치마크 점수는 사내에서 6시간 타임아웃으로 측정됐습니다.
2026년 8월 27일

2.6%는 주요 사용 사례를 기준으로 한 외부 평가자의 수치입니다. 5.04%는 Google의 다국어 벤치마크 자체 측정치입니다. 두 수치 모두 같은 발표에 담겼습니다.
2026년 8월 27일

홍콩 상장 중국 프런티어 랩의 첫 감사 반기 실적: 매출 1억1,660만달러, R&D 2억9,690만달러, 총이익률 17.9%는 추론이 매출의 대부분을 삼킨다는 뜻이다.
2026년 8월 26일

ModelScope 항목은 15:00 UTC 시각의 오픈 웨이트 공개를 예고하며 아키텍처 미리보기를 설명합니다. 시중에 도는 사양은 삭제된 초안 카드에서 나온 것입니다.
2026년 8월 26일

도메인 강자가 이름 없는 오픈 가중치 모델을 후학습해, 벤치마크도 없는 프런티어 비교를 내놓았다. 그 이면의 경제성이 진짜 핵심이다.
2026년 8월 25일

8월 22일 16:00 UTC부터 비혼잡 요금은 토요일과 일요일 전체에 적용됩니다. 비혼잡 V4-Pro 출력은 백만 토큰당 1.98달러이며, 8월 16일 이전 정액 요금은 0.87달러였습니다.
2026년 8월 23일

V4-Flash-Vision-Exp는 실험용이며 API에서만 제공되고, 점수는 모두 에이전트 및 코딩 평가에서 나온 것입니다.
2026년 8월 21일

소프트웨어는 라이선스로, 연구원 109명은 개별 채용 제안으로 이동하며, 별도의 10억 달러는 120억 달러의 투자 전 가치 기준으로 지분에 투자된다. 회사는 넘어가지 않는다.
2026년 8월 21일

MiniMax Design은 브라우저 도구가 아닌 다운로드형 앱이며, 이번 소식은 H3가 아니라 생산용 작업 환경에 관한 것입니다. H3는 이미 공개돼 있습니다.
2026년 8월 20일

Zhipu는 새벽에 API를 공개하며 최전선 벤치마크 성과와 변동 없는 가격을 내세웠습니다. 오픈 가중치 공개는 8월 28일로 예정돼 있습니다.
2026년 8월 19일

DeepSeek은 수치나 날짜를 밝히지 않은 채 "상당한" 인상을 두 차례 경고했습니다. 이제 둘 다 현실이 됐으며, 가장 큰 인상은 사람들이 인용하는 항목이 아닙니다.
2026년 8월 17일

Qwen3.8-27B는 dense 모델로 mixture-of-experts가 아니며, 262,144토큰의 기본 컨텍스트를 갖고, 모든 벤치마크를 자체 보고했다.
2026년 8월 16일

GLM-5.3은 GLM-5.2와 같은 753B 기반 위에 올라 있습니다. 회사가 내세우는 성능 향상은 모두 후훈련에서 나왔다고 하며, 가중치는 앞으로 2주 더 지나야 공개됩니다.
2026년 8월 14일

엔터프라이즈 자동화 점수는 거의 두 배로 뛰었고, 장기 소프트웨어 엔지니어링은 49.0%에서 65.3%로 올랐습니다. 초기 가격은 새해 전까지 입력 토큰 100만 개당 0.75달러입니다.
2026년 8월 14일

V4-Pro-0813에 Responses API와 도구 호출이 추가됐다. 더 중요한 대목은 가격 페이지에 임박한 인상 가능성을 적어둔 문구다.
2026년 8월 13일

Intelligence Index 61점과 50만 토큰 컨텍스트를 갖췄으며, 새로운 사전학습이 아니라 Grok 4.5의 후훈련으로 구축됐다. 코딩에서는 여전히 GPT-5.6에 못 미친다.
2026년 8월 13일

Muse Glimmer는 소비자용 GPU 1개로 구동되며, 진정한 의미의 관대한 라이선스를 적용받는다. 이번 공개는 Hugging Face와 Zuckerberg의 에세이를 통해 이뤄졌다.
2026년 8월 12일
