Модели ИИ
Идентичные запросы к одному и тому же LLM-судье переоценились при Spearman 0,400
Два пререгистрированных исследования так и не дошли до своих фактических экспериментов. Инструмент первым не прошел собственный порог надежности — на основе почти 53 000 аудированных запросов и четырех провайдеров.
2 ч назад
