Google 发布智能体隐私与安全研讨会报告:以情境完整性视角探讨开放性难题
Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。
Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。
Google Research 将 Earth AI 的 Population Dynamics Foundation Model(PDFM)位置嵌入作为即插即用输入,与五家机构在五类公共卫生挑战上完成独立验证,覆盖 MMR 疫苗接种、心血管疾病、登革热、产后抑郁和霍乱。
TechCrunch 报道 Graphite 的新研究:对比 ChatGPT 发布前的 10,000 篇人类文章和各模型重写版本,找出 13,000 个在 AI 文本中出现频率至少高 2 倍的短语。
Google DeepMind 团队发表论文,提出蛋白质水印方案 SynthIDBio,可在不破坏蛋白功能的前提下为 AI 设计的蛋白序列加入水印。该系统基于 SynthID 技术,集成到流行的蛋白设计工具 ProteinMPNN 中,在逐个放置氨基酸时只在保持功能可行的位置引入与水印一致的氨基酸。
Google Research 推出 Diffusion Controller 框架,将去噪过程重构为连续控制问题,用轻量“转向阻尼”网络在不动主模型权重的情况下引导图像生成。基于 Stable Diffusion v1.4 的实验中,其完全解锁版本在 Human Preference Score(HPS-v2)评测下对基线达到 90% 胜率,并支持对闭源模型做黑盒/灰盒控制。
Google Research 发布 AI 视频联合导演研究,构建了基于 Gemini 和 Veo 的多智能体编排层,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个框架,将长视频生成转化为全局优化与世界状态跟踪问题。
Google Research 提出 Retrieve-for-Train 框架,用离线 RL 发现奖励对齐的 query fan-out 并蒸馏为监督信号,绕过 LLM 逐 token 的链式推理延迟。
Google Research 在 ACL 2026 提出 ToolGrad,一种“答案优先”的工具调用数据集生成方法:先构建真实工具调用链,再用文本“梯度”迭代提出、执行、选择和更新 API 工作流。
Google Research 研究了多基因风险评分(PRS)从 UK Biobank 欧洲人群向 Biobank Japan 约 20 万日本个体迁移的表现,覆盖 BMI、血压、HDL、LDL、血糖等 8 项临床 traits,比较了 elastic net、meta-analysis 和 PRS-CSx 三种方法。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室、剑桥大学等合作在 Cell 发表雄性果蝇脑及中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:原文给出连接组规模、AI 重建方法和开源查看入口,读者可以据此了解当前连接组学的能力边界和可用资源。
Google 与 NASA JPL 合作推出 MAPL-EMIT,一个基于 EMIT 高光谱数据的深度学习框架,用于自动检测、量化甲烷羽流并定位排放源。该框架采用 Swin-S vision transformer,在专家标注羽流上达到 84% 的召回率,训练使用了 360 万个合成甲烷羽流。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可从自然语言查询出发自主执行数据发现、清洗、特征工程、模型训练与评估的完整地理空间预测流程,将此前需数周人工数据工程的工作缩短到几分钟。
Google 在 CHI 2026 发表研究原型 AgentHands,让 AI 智能体在 Android XR 等沉浸式环境中生成与语音同步的手势,延续 Project Astra 与 Gemini 3.1 Flash Live 的方向。
Google Research 推出 Biomarker Discovery Framework,一个多智能体系统,将候选生物标志物优先排序结构化为人类监督下的迭代研究流程,结合假设生成、统计分析、模型训练与对抗性验证。在三个队列共 9,279 人次观测中,该系统自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢类候选标志物,并构建了睡眠时长变异性等新型复合特征。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合匿名化的到访流动模式融入语言模型的地点表示,捕捉 POI 的时间活动节奏。
DiG-bench(Discovery in Games)发布,这是一个包含 70 款游戏的基准,用于测试 AI 通过探索自主发现隐藏规则的能力,21 款游戏已公开。
Google Research 提出 PhotoScan,一种从标准 2D 手机照片估计体脂率、Android-to-Gynoid 脂肪比和内脏-皮下脂肪比的深度学习框架,用于预测胰岛素抵抗。
Google Research 发布 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务)和知识画像框架,评估 13 个 LLM 后发现前沿模型 95–98% 的事实已编码,但仍有 26–34% 无法直接召回,开启 thinking 后仍有 11–12% 失败。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生构建证据链的自主科研原型 Science One Framework 和自动化评估协议 CoE Audit。
Google Research 发布 SymptomAI 研究论文,用五个基于 Gemini Flash 2.0 的对话原型智能体对 13,917 名参与者做端到端症状问诊和鉴别诊断(DDx),用于研究基准测试。
推荐理由:基于 13,917 人的随机真实人群研究,给出了 SymptomAI 鉴别诊断相对临床医生基线的表现和可迁移的问诊策略比较。
Google Research 在 Nature 发表基于强化学习的量子纠错控制框架,让智能体利用错误检测事件持续调节数千个控制参数,在计算进行中对抗漂移。在 Willow 超导处理器上注入人为漂移的实验中,RL 控制使逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%。
Google Research 在 ICLR 2026 发表的论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》指出。
Google Research 发布 SensorFM,一种直接从无标注可穿戴数据预训练的 Large Sensor Foundation Model,训练数据来自 500 万名同意参与研究的用户、超一万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
Google Research 在 Nature Cities 发表大规模真实世界研究,通过修改 Google Maps 算法在 10 个美国城市引导少于 2% 的行程绕开拥堵路段,实验持续六个月并采用城市级 switchback 设计。
Google Research 在 CIDR 发表的线性弹性缓存(linear elastic caching)方法,把页面逐出建模为 ski rental 问题,用轻量级决策树模型为缓存页预测 TTL,动态调整缓存大小。在 Spanner 生产环境中,相比固定大小缓存,内存占用降低 15.5%,cache miss 仅增加 5.5%,TCO 降低约 5%,对实际 I/O 成本影响仅 0.5%。
Google Research 在 COLM 2026 发表的论文发现,开启链式推理能让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回关闭推理时几乎无法答对的简单单跳事实。
Import AI 第 462 期汇总多项内容:牛津大学、英国 AISI、斯坦福等机构的研究通过 4 项实验、6923 人的 18978 段对话,发现 AI(最强的为 Opus 4.1 和 Opus 4.6)在文本说服上稳定超越专家人类,募集真实捐款时比职业募捐者高 10.8 个百分点;当限制 AI 以人类速度和篇幅输出时,优势降至不显著。
Google 发布两项皮肤 AI 研究,其中发表于 JAMA Dermatology 的 2345 人调查显示,AI 辅助组识别病症的准确率达 23%,约为对照搜索组(8%)的近三倍,但判断就医等下一步行动的能力未显著提升。
Google Research 在 AISTATS 2026 上提出 Regularized f-Divergence Kernel Tests,用于更敏感、灵活地审计机器遗忘(machine unlearning)。
Google DeepMind 公布在塞拉利昂开展的一项预注册试验结果,学生使用 Guided Learning 八周后数学成绩较对照组提升 +0.258 个标准差,约相当于 1.2 到 1.7 年的典型学习进度;教师把 Gemini 融入约一半课程达到 12 小时目标的班级进步更高,约 1.8 到 2.5 年。
推荐理由:Google DeepMind 公布塞拉利昂预注册试验的教学细节与量化结果,并开放教师培训指南与 RCT playbook,读者可了解可复制的研究做法。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后前置摄像头拍摄的面部视频,通过深度学习在后台估计心率与每日静息心率(RHR)。
推荐理由:研究覆盖近700名不同肤色参与者并在真实生活场景验证,读者可以了解手机摄像头被动测心率的准确度数据与开放数据入口。
Stanford 医学院遗传学家 Gary Peltz 团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大模型训练拆分为异步通信的计算“孤岛”,隔离硬件故障并大幅降低带宽需求。
Google Research 发布 ICLR 论文 ReasoningBank,提出从智能体的成功与失败经验中蒸馏高层推理记忆的框架,区别于只记录轨迹或仅总结成功流程的 Synapse 和 AWM。
Google Research 在 TMLR 发表论文,推出推理优先的合成数据生成框架 Simula,以机制设计思路将数据生成拆解为全局多样性、局部多样性、复杂化和双评论员质量检查四个可控轴,无需种子数据。
Google Research 提出 MoGen 神经元形态生成模型,基于 PointInfinity 点云 flow matching,用 1,795 条经人工验证的小鼠轴突训练生成合成神经形状,扩充 PATHFINDER 重建模型训练数据。
Google Research 发布 ConvApparel 数据集,包含超过 4,000 段、近 15,000 轮的人类-AI 多轮对话,用于量化 LLM 用户模拟器的“真实感差距”。
Google Research 提出一个评估 25 个 LLM 行为倾向与人类对齐程度的框架,将标准化心理问卷改编为情境判断测试(SJT),并由 550 名参与者提供人类偏好分布。
Google Research 在论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究 AI 评测中每条数据标注数与标注条目数的权衡,并开源了基于真实数据集的模拟器。
Google Quantum AI 发布白皮书,更新了破解 256 位椭圆曲线离散对数问题(ECDLP-256)的量子资源估算,两条电路分别使用不到 1,200 个逻辑量子比特加 9,000 万个 Toffoli 门和不到 1,450 个逻辑量子比特加 7,000 万个 Toffoli 门,物理量子比特需求较此前降低约 20 倍。
推荐理由:Google 白皮书给出破解 ECDLP-256 更低的量子资源估算和零知识证明披露方式,加密社区可据此评估向 PQC 迁移的紧迫性。