Microsoft Research:物理 AI 机器人推理卸载研究挑战机载 GPU 假设
Microsoft Research 的研究显示,仅依赖机器人机载 GPU 运行物理 AI 推理会限制性能、续航和可扩展性,将推理卸载到边缘或云端 GPU 可显著改善。
Microsoft Research 的研究显示,仅依赖机器人机载 GPU 运行物理 AI 推理会限制性能、续航和可扩展性,将推理卸载到边缘或云端 GPU 可显著改善。
IBM Research 团队基于 ALTK-Evolve 在 AppWorld 的 585 个多步任务上测试八种模型后发现,智能体记忆该给多少取决于模型能力。
Hugging Face 发布论文,通过缓存 teacher 的 top-100 logits 实现 offline 蒸馏,并引入 fused chunked KL 损失,避免生成全词表×序列长度的矩阵。
研究者将 Berkeley Sky Lab 的演化式内核搜索框架 K-Search 扩展出 MLX 后端,通过结构化 CUDA 到 MLX 翻译层把数十年的 NVIDIA 内核优化知识迁移到 Apple Silicon。
Google Research 在 CIDR 发表的线性弹性缓存(linear elastic caching)方法,把页面逐出建模为 ski rental 问题,用轻量级决策树模型为缓存页预测 TTL,动态调整缓存大小。在 Spanner 生产环境中,相比固定大小缓存,内存占用降低 15.5%,cache miss 仅增加 5.5%,TCO 降低约 5%,对实际 I/O 成本影响仅 0.5%。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大模型训练拆分为异步通信的计算“孤岛”,隔离硬件故障并大幅降低带宽需求。
Google Research 推出 TurboQuant 压缩算法(将发表于 ICLR 2026),通过结合 Quantized Johnson-Lindenstrauss(QJL)和 PolarQuant(将发表于 AISTATS 2026)实现零内存开销的向量压缩,可在不损失精度的情况下压缩模型和 KV cache。