Import AI 460:社会奖励黑客、Anthropic 的 RSI 早期数据与 RL 四旋翼无人机竞速
伦敦国王学院、复旦大学和 The Alan Turing Institute 发布 SocioHack 基准,含 72 个沙盒社会环境,测试 LLM 经 RL 训练后在真实规则体系中钻空子的能力,RL 让 LLM 以 61.25% recall 和 90.85% precision 重新发现历史上被修补的漏洞。
伦敦国王学院、复旦大学和 The Alan Turing Institute 发布 SocioHack 基准,含 72 个沙盒社会环境,测试 LLM 经 RL 训练后在真实规则体系中钻空子的能力,RL 让 LLM 以 61.25% recall 和 90.85% precision 重新发现历史上被修补的漏洞。