跳到正文

全部动态

今日 6 条
今天10月7日周三
  1. Google Research47

    Google 发布智能体隐私与安全研讨会报告:以情境完整性视角探讨开放性难题

    Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。

10月5日周一
  1. Simon Willison33

    Qwen3.8 27B 用单词做加法基准测试

    一项基准测试了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型能否只用英文单词表达正整数加法的精确结果,共 5,070 个关闭推理的用例及 169 个开启推理的对照用例。关闭推理时数值准确率仅 23.57%,其中 1-3 位数运算达 97.04%,10-13 位数降至 6.44%,格式合规率 96.17%;开启推理后在 169 次尝试中答对 167 次。

10月4日周日
  1. Hugging Face Blog69

    Microsoft ThinkingBox 登陆 Hugging Face,以后端状态评测智能体真实可靠性

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。

    推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。

10月2日周五
  1. Ars Technica · AI67

    AI 击败史上最强 Stratego 棋手 Pim Niemeijer,训练仅用 16 块 GPU

    卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出名为 Ataraxos 的 AI,以 15 胜 1 负 4 平击败被认为是史上最强 Stratego 棋手的 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。Stratego 是大量信息隐藏且博弈时间尺度很长的不完全信息游戏,此前连 DeepMind 也未能造出稳定击败人类顶尖玩家的机器。

10月1日周四
  1. The Decoder77

    AI 击败 Stratego 史上最强人类棋手,Ataraxos 以不到 8000 美元算力突破不完美信息博弈

    研究团队开发的 Ataraxos 在三周的对局中以 85% 有效胜率击败了四届世界冠军、公认史上最强的 Stratego 棋手 Niemeijer,并在 2025 世界锦标赛表演赛中赢下 40 局中的 38 局。

    推荐理由:原文对比了 Ataraxos 与 DeepNash 的训练成本和方法细节,读者可以了解不完美信息博弈研究的最新进展。

9月30日周三
  1. Google Research38

    Google Research 提出 Diffusion Controller 框架,统一并简化 AI 图像生成控制

    Google Research 推出 Diffusion Controller 框架,将去噪过程重构为连续控制问题,用轻量“转向阻尼”网络在不动主模型权重的情况下引导图像生成。基于 Stable Diffusion v1.4 的实验中,其完全解锁版本在 Human Preference Score(HPS-v2)评测下对基线达到 90% 胜率,并支持对闭源模型做黑盒/灰盒控制。

9月29日周二
9月26日周六
9月25日周五
9月24日周四
9月23日周三
9月22日周二
9月16日周三
9月11日周五
9月8日周二
  1. OpenAI News81

    OpenAI 分享 Navier–Stokes 千禧年难题的 AI 生成解法

    OpenAI 分享了一个针对 Navier–Stokes 千禧年大奖难题的 AI 生成解法,内容包括一份解题文章和一个 Lean 形式化证明。材料来自 OpenAI 官方公告,feed 未提供完整正文,具体证明内容和方法细节以原文链接为准。

    推荐理由:官方公开了 AI 生成的 Navier–Stokes 千禧年难题解法,并附带 Lean 形式化证明,读者可以据此关注 AI 在数学证明方向的实际产出。

9月4日周五
  1. Google Research62

    Google Research 与 HHMI Janelia 发布雄性果蝇完整脑连接组图谱

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室、剑桥大学等合作在 Cell 发表雄性果蝇脑及中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:原文给出连接组规模、AI 重建方法和开源查看入口,读者可以据此了解当前连接组学的能力边界和可用资源。

9月2日周三
8月28日周五
8月26日周三
8月25日周二
8月22日周六
  1. Google Research50

    Google Research 推出 Biomarker Discovery Framework:从可穿戴设备数据中优先排序候选生物标志物

    Google Research 推出 Biomarker Discovery Framework,一个多智能体系统,将候选生物标志物优先排序结构化为人类监督下的迭代研究流程,结合假设生成、统计分析、模型训练与对抗性验证。在三个队列共 9,279 人次观测中,该系统自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢类候选标志物,并构建了睡眠时长变异性等新型复合特征。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究量化语音识别模型的基准优化行为,高分模型会复现错误基准文本

    Hugging Face 发布研究,用一致性分歧探针、数字静默检索和拼写切换三类测试,评估 11 个开源 ASR 模型的基准优化(benchmaxxing)行为。

    推荐理由:原文用三类探针量化语音识别中的基准优化现象,并给出模型名单、比例数据与可复用的检测脚本,读来能帮助避开仅看 WER 的选型误区。

8月20日周四
8月19日周三
8月17日周一