Graphite 研究找出各前沿模型的 AI 写作特征,Claude Opus 5.5 爱说 this matters
TechCrunch 报道 Graphite 的新研究:对比 ChatGPT 发布前的 10,000 篇人类文章和各模型重写版本,找出 13,000 个在 AI 文本中出现频率至少高 2 倍的短语。
TechCrunch 报道 Graphite 的新研究:对比 ChatGPT 发布前的 10,000 篇人类文章和各模型重写版本,找出 13,000 个在 AI 文本中出现频率至少高 2 倍的短语。
Anthropic Frontier Red Team 在 100 道内部 Binary Exploitation 基准随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。早期模型如 Claude Opus 4.6 和 GLM-5.2 则无一成功,作者认为一个有意义的门槛已被跨过。
慕尼黑 CESifo 经济学研究者 Robert Fairlie 和 Jane Wu 的新工作论文指出,无论绝对还是相对水平,都没有证据表明应届大学毕业生出现显著、大范围的岗位替代或招聘缩减。
OpenAI 经济研究新报告分析了劳动者如何超越传统职业角色使用 AI,以及哪些新的活动成为其工作中的常规部分。报告揭示了 AI 在实际工作中的使用模式。
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件的能力,25 个目标程序中 17 个有至少一次满分运行,Claude Opus 4.7 用 14 小时、251 美元推理成本完成了人类估需 2-17 周的任务。
Jack Clark 在 Import AI 第 464 期汇总:Fable 在 KernelBench-Mega 上以 CUDA 写出 18.71X 加速的 megakernel。
Import AI 第 462 期汇总多项内容:牛津大学、英国 AISI、斯坦福等机构的研究通过 4 项实验、6923 人的 18978 段对话,发现 AI(最强的为 Opus 4.1 和 Opus 4.6)在文本说服上稳定超越专家人类,募集真实捐款时比职业募捐者高 10.8 个百分点;当限制 AI 以人类速度和篇幅输出时,优势降至不显著。
Import AI 第 459 期报道:弗吉尼亚大学、Anthropic 与加拿大银行研究者估计美国 AI 经济 2025 年名义规模约 $250 billion,质量调整后实际产出年增速约 2,600%,但因单价下降和推理占比高而难以在 GDP 中体现。英国 AI Security Institute 撰文指出用 AI 监督训练过程来自动化对齐研究并非万能方案,实际比预想更难。