AnthropicAnthropic 将说谎检测器训练到 0.95,随后又看着它们跌到 0.70。问更大的模型反而拿到 0.98。这项实验甚至无法在前沿规模上运行,因为未训练基线本身就已经触顶。1小时前