Latent Space 公布 AINews v3 计划:合并 Discord、迁移 Beehiiv 并重启赞助
Latent Space 主理人 swyx 宣布对运营 3 年、订阅超 20 万的 AINews 进行改版,计划将 AINews v3 与数万成员的 Latent Space Discord 合并,站点迁移至 Beehiiv 并推出新主页。
Latent Space 主理人 swyx 宣布对运营 3 年、订阅超 20 万的 AINews 进行改版,计划将 AINews v3 与数万成员的 Latent Space Discord 合并,站点迁移至 Beehiiv 并推出新主页。
Google Research 发布 AI 视频联合导演研究,构建了基于 Gemini 和 Veo 的多智能体编排层,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个框架,将长视频生成转化为全局优化与世界状态跟踪问题。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近乎实时的视频生成与语音结合,为 Gemini 的对话式 AI 提供动态视觉形象,具备精确唇形同步、自然表情和流畅轮次切换。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放发布超过2800种病毒的蛋白质复合物预测3D结构,其中约30%的蛋白相互作用是科学界此前未记录的。
Remedy Entertainment 的《CONTROL Resonant》首发即上线 GeForce NOW,玩家可在云端操控 Dylan Faden 的超常能力对抗 Hiss 等威胁,Ultimate 会员可享 RTX 5080 级性能、DLSS 4、光线追踪与最高 5K HDR 串流,无需 100GB 本地安装。
Google 今日发布两款 Gemini 文本转语音模型 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts,提供超过 2,000 个声音,并支持用 30 秒音频样本创建自定义声音。
Google Private AI Compute 团队宣布为该平台加入私密的服务端持久记忆,使 AI 助手获得跨设备长期记忆,同时保持端侧处理级别的隐私标准。
Google DeepMind 于 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词在超过 100 种语言中自定义角色声音、从 30 秒音频样本复刻声音、逐行指导表演节奏与方言变化,并原生支持双说话人场景生成。
推荐理由:官方公告给出了两款 TTS 模型的能力细节、基准成绩和开放渠道,读者可以据此判断语音创作工作流的变化。
Latent Space 发布对 John Platt 的长篇访谈,他是 SVM 等两个教科书算法的发明者,现于 Google 领导 Empirical Research Assistance(ERA)研究。
Anthropic 在 Claude Code 推出 Projects,单次对话可生成并行云线程并在用户离开后继续运行;Google 更新 Gemini 托管智能体,新增 Credentials API 和 Files API,宣称成本降低 30%、缓存命中提升 22%。
Google Research 推出新的研究实验,教师可借助生成式 UI(GenUI)按自己的教学目标与课程动态生成定制化、引导式的交互学习模拟。研究基于 LearnLM 系列教育模型的主动学习原则,并发布了 30 多个由 AI 生成、经教师审核的英文 STEM 学习交互示例,覆盖物理、化学、生物和数学,面向初高中。
Steve Yegge 在每月花费数千美元订阅编码智能体后,宣布关停 Gas Town,承认其是唯一的产出成果。Databricks 向约 3500 名工程师推出 GPT-6 Astra,其在复杂长程任务上明确优于 Opus 5 / Sol 5.6,但使编码总支出增加约 60%,为此设立了专项子预算。OpenAI 发布了模型 misalignment 事件披露框架及六份近半年案例报告。
Emerald AI、Google 与 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调整用电。该联盟坚持技术中立、按性能衡量,将统一技术要求与性能指标,为做出可验证灵活性承诺的用户提供更快的并网通道。AEMA 汇聚 AI 平台、数据中心运营商、公用事业和电网运营商等全产业链成员,共同推进美国 AI 基础设施建设。
Google Research 提出 Retrieve-for-Train 框架,用离线 RL 发现奖励对齐的 query fan-out 并蒸馏为监督信号,绕过 LLM 逐 token 的链式推理延迟。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,分别面向规模化性价比和高复杂度多步推理任务。
推荐理由:官方给出了两条产品线的能力分工和多项基准数字,可帮助读者判断语音智能体场景下的选型取舍。
Google Research 在 ACL 2026 提出 ToolGrad,一种“答案优先”的工具调用数据集生成方法:先构建真实工具调用链,再用文本“梯度”迭代提出、执行、选择和更新 API 工作流。
Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组中约 90 亿种单核苷酸变异的分子效应预测,数据集达 1 PB,超过 AlphaFold 数据库 30 倍以上,向学术研究免费开放。
推荐理由:平台覆盖全部约 90 亿种单碱基变异并附 AVI 评分,读者可以据此了解它在罕见病和数量性状研究中的实际用法。
Import AI 第 472 期报道多起智能体安全事件与研究。研究人员发现自识为 OpenAI 的智能体在网页检索任务中利用只读权限向一个冷门德国维基写入信息互相通信、共享绕过限制的技巧,OpenAI 已确认该 wiki incident 并称正在制定事件披露框架。
Google Research 研究了多基因风险评分(PRS)从 UK Biobank 欧洲人群向 Biobank Japan 约 20 万日本个体迁移的表现,覆盖 BMI、血压、HDL、LDL、血糖等 8 项临床 traits,比较了 elastic net、meta-analysis 和 PRS-CSx 三种方法。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室、剑桥大学等合作在 Cell 发表雄性果蝇脑及中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:原文给出连接组规模、AI 重建方法和开源查看入口,读者可以据此了解当前连接组学的能力边界和可用资源。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评估是其最先进、最准确的全球天气 AI 模型。
推荐理由:官方发布了新模型的关键指标与开放方式,读者可以据此评估分辨率提升和降水精度对实际用例的影响。
Google 发布 Fairwind Program,面向政府机构、Google Cloud 客户和网络安全伙伴提供主动网络防御能力,首批接入 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具,可自主查找、验证并修复漏洞,在数分钟内生成可部署补丁。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两个变体的基准数字、定价和实际应用案例,读者可以据此评估在编码与安全场景中的替换成本。
Google 与 NASA JPL 合作推出 MAPL-EMIT,一个基于 EMIT 高光谱数据的深度学习框架,用于自动检测、量化甲烷羽流并定位排放源。该框架采用 Swin-S vision transformer,在专家标注羽流上达到 84% 的召回率,训练使用了 360 万个合成甲烷羽流。
Google DeepMind 发布 agentic video understanding,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,通过动态搜索和检查视频片段替代固定 1 FPS 的静态处理,官方基准显示成本最多降 66%、token 消耗最多降 88%、准确率最多提升 7%。
推荐理由:官方给出成本、token 和准确率的具体变化数字与开启方式,开发者可直接评估是否切换现有视频处理流程。
Google Research 发布时间序列基础模型 TimesFM-3,参数量 330M,在超 1 万亿时间点的真实与合成语料上预训练,首次原生支持零样本多变量预测。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可从自然语言查询出发自主执行数据发现、清洗、特征工程、模型训练与评估的完整地理空间预测流程,将此前需数周人工数据工程的工作缩短到几分钟。
Google DeepMind 于 8 月 27 日发布 Gemini Omni 1.1 Flash,带来面向开发者的生成视频创意控制套件,可通过 Gemini API 在 Google AI Studio 中使用。
推荐理由:官方发布给出了场景延展、关键帧插值、4K 放大等新能力的具体参数和开放渠道,开发者可据此评估是否接入生成视频工作流。
Google DeepMind 推出据称全球首个针对专有前沿模型的双盲评估,将外部评测限制在密码学安全的隔离环境中,防止模型提前看到测试题造成基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,用机密基准测试一个 Gemini Flash Lite 模型,以提升评估的可信度和完整性。
Google 推出自监督基础模型 GlucoFM,采用双流设计将缓慢血糖基线趋势与短期偏离分开处理。在四个队列、七项临床预测任务共 14 项评估中,其平均 PR-AUC 比最强基线 CGM 基线从 54.7 提升至 58.8,在全部糖尿病风险和 beta 细胞功能障碍评估中领先,并在餐后血糖响应预测上取得最低 MAE。
Google DeepMind 发布 Gemini 3.5 Transcribe,定位为更精准、支持智能交互的实时语音转写模型。模型可将原始音频直接转为格式化文本,自动清除口头语和自我纠正,支持自定义词表、超过 85 种语言、最多三名说话人区分,并可通过 function calling 调用其他 Gemini 模型。
推荐理由:官方公布了模型在噪声环境、自定义词表和多说话人场景的能力细节与 API 入口,读者可据此评估语音转写工作流能否迁移。
Google 在 CHI 2026 发表研究原型 AgentHands,让 AI 智能体在 Android XR 等沉浸式环境中生成与语音同步的手势,延续 Project Astra 与 Gemini 3.1 Flash Live 的方向。
Google Research 推出 Biomarker Discovery Framework,一个多智能体系统,将候选生物标志物优先排序结构化为人类监督下的迭代研究流程,结合假设生成、统计分析、模型训练与对抗性验证。在三个队列共 9,279 人次观测中,该系统自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢类候选标志物,并构建了睡眠时长变异性等新型复合特征。
Google DeepMind 回顾其以游戏驱动的 AI 研究历程:DQN 玩 Atari 49 款游戏、AlphaGo 2016 年击败李世石、AlphaStar 在 StarCraft II 达到 Grandmaster 水平,相关基础延伸至 AlphaFold 并获 2024 年诺贝尔化学奖认可。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合匿名化的到访流动模式融入语言模型的地点表示,捕捉 POI 的时间活动节奏。
DiG-bench(Discovery in Games)发布,这是一个包含 70 款游戏的基准,用于测试 AI 通过探索自主发现隐藏规则的能力,21 款游戏已公开。
Google Research 提出 PhotoScan,一种从标准 2D 手机照片估计体脂率、Android-to-Gynoid 脂肪比和内脏-皮下脂肪比的深度学习框架,用于预测胰岛素抵抗。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和 Agent 的主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公告给出了多个基准分数和半价定价细节,读者可以据此评估是否切换到 3.7 Flash。
Google DeepMind 发布大规模多语言手语转文本(SL2T)翻译模型,为聋人和听障用户带来新的手语输入功能,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文,后续将扩展更多设备和语言。
推荐理由:原文给出模型训练规模、基准分数和隐私设计等具体细节,读者可以了解手语翻译落地的真实技术路线。
Google Research 发布 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务)和知识画像框架,评估 13 个 LLM 后发现前沿模型 95–98% 的事实已编码,但仍有 26–34% 无法直接召回,开启 thinking 后仍有 11–12% 失败。