OpenAI 在 ChatGPT 推出新广告格式并扩展衡量工具
OpenAI 宣布在 ChatGPT 中推出新的视觉广告格式,面向广告主扩展衡量工具、归因合作与品牌适配度(brand suitability)能力,构建适配 AI 使用方式的广告体系。
OpenAI 宣布在 ChatGPT 中推出新的视觉广告格式,面向广告主扩展衡量工具、归因合作与品牌适配度(brand suitability)能力,构建适配 AI 使用方式的广告体系。
OpenAI 官方介绍其如何根据欧盟规则处理文本水印。内容涵盖水印适用范围、检测机制如何运作,以及为何访问权限首先向研究人员开放。
Atlassian 与 OpenAI 扩大合作,将前沿模型与企业知识连接,帮助团队规划、构建和交付工作。
OpenAI 与 Ironclad 正在复杂的合同工作流上训练和评测 AI 智能体,以推进面向专业工作的 computer use 能力。该合作聚焦真实合同场景中的智能体表现,帮助提升 AI 在专业软件操作中的可靠性。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上分享 Lean 证明形式化和研究细节。
推荐理由:OpenAI 公布内部前沿模型在数学未解问题上的结果,并开源 Lean 证明形式化,读者可查看研究细节。
GitHub 发布开源离线基准 ReviewBench,用于评测 AI 代码审查智能体。基准基于 1.039 亿 GitHub pull request 的分布建模。
Jump Trading 使用 OpenAI 的 ChatGPT 扩展量化研究工作。其更长时程的 AI 工作流将多个数据源与人工审核相结合。
Microsoft Research 播客中,partner research manager Jennifer Neville 与应用科学家 Chad Atalla 对谈,探讨评测如何推动 AI 系统突破性能边界以满足用户需求,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她分享了使用现有 AI 系统的实用建议,并强调当结果不符合预期时仔细检查数据的重要性。
Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。
Google Research 将 Earth AI 的 Population Dynamics Foundation Model(PDFM)位置嵌入作为即插即用输入,与五家机构在五类公共卫生挑战上完成独立验证,覆盖 MMR 疫苗接种、心血管疾病、登革热、产后抑郁和霍乱。
AWS 演示了基于 Strands Agents SDK 与 Amazon Bedrock AgentCore 的多智能体供应链决策系统评估方案,包含一个编排智能体和优化、配送、路径、分析四个专用子智能体。
Amazon Quick 的控制台和 update-user API 不支持直接从 Admin 或 Author 降级到 Reader,会报 “You cannot downgrade a user role” 错误。
AWS 在 Amazon Bedrock Managed Knowledge Bases 上用 LangChain 演示标准检索与 agentic 检索的对比:一个包含六个意图的多部分问题,单向量检索在 5 条结果时只覆盖 4 个子意图,agentic 检索则通过规划循环拆分子查询、评估证据并迭代。
Amazon Quick 资源(chat agent、action connector、知识库、flow、space)从开发账户晋升到生产账户此前只能手工重建。
Amazon SageMaker AI 优化生成式 AI 推理推出 aws-ai-ml 技能,通过 Agent Toolkit for AWS 提供,可为 Kiro、Claude Code、Codex 等编码智能体注入推理优化与基准测试专长。
Claude Opus 5.5 与 Claude Sonnet 5.5 现已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上可用,可配合 Anthropic 的智能体编程工具 Claude Code 支持含 ITAR 在内的合规开发工作负载。
Z.ai(智谱)的 GLM 5.3 现已登陆 Amazon Bedrock,这是一个 753B 参数的 MoE 模型,面向编码和长程智能体任务,Z.ai 报告其在 CyberGym 基准上取得 84.5 的领先分数,并在内部编码基准上较 GLM 5.2 提升 50%。
这是一篇 AWS 教程,介绍如何用 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases 为航空应用搭建语音旅行礼宾服务,支持改座位、改餐食偏好、回答政策问题并转接人工客服。
AWS 推出在 SageMaker Studio UI 中直接创建和管理 HyperPod EKS 集群上 SageMaker Spaces 的功能,数据科学家无需命令行工具即可通过几次点击启动 JupyterLab 或 Code Editor 环境。
AWS 介绍如何通过 SageMaker Unified Studio 管理 Amazon SageMaker HyperPod 集群,在让 ML 团队从项目工作区启动训练和微调任务的同时保持治理控制。
AWS 介绍国际标准 ISO/IEC 42005:2025 对 AI 系统影响评估的指导,包括如何将其融入企业现有风险、隐私、安全等影响评估流程。标准的 Annex D 提供简化流程、避免重复评估的过程,Annex E 提供独立可用的模板。
NVIDIA Inception 孵化的多家初创公司用 AI 支持乳腺癌诊疗各环节:iSono Health 的 FDA 认证 ATUSA 平台每侧乳房约 2 分钟完成自动 3D 超声扫描(传统手持超声最长 45 分钟)。
Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。
AWS Machine Learning Blog 发布教程,演示用 OpenClaw 智能体框架和 Amazon Bedrock AgentCore runtime、memory 构建带长期记忆的园艺助手 Sprout。
Mistral 发布 Mistral Large 4(ML4)公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放下载。
推荐理由:官方发布了参数规模、基准分数、训练基础设施和权重开放时间表,读者可据此评估它在开源阵营中的实际位置。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,采用 Apache 2.0 许可,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:官方给出了参数量、内存占用和基准得分等具体指标,可帮助读者评估它是否适合端侧检索场景。
电信运营商正基于开放模型构建 AI 战略,NVIDIA 最新《State of AI in Telecommunications》报告中 89% 的受访者认为开源模型和软件对其 AI 战略重要。
AMD 宣布将于 2026 年 11 月 3 日(周二)美股收盘后发布 2026 财年第三季度财报,管理层将在美东时间下午 5 点举行电话会议,投资者可通过 ir.amd.com 收听网络直播。
Intel 宣布将于 2026 年 10 月 29 日美股收盘后发布第三季度财报,并于当天下午 2 点 PDT 召开财报电话会议。电话会议将在 Intel 投资者关系网站 intc.com 进行公开直播,相关材料和回放也会在该网站提供。
AMD 发布 AMD Helios AI 基础设施相关视频资源,并提供包含 AMD 商标和标志的品牌资产下载。下载前须接受条款与条件,这些 AMD Marks 仅可用于包含 AMD CPU、GPU、APU 或 FPGA 产品的宣传推广,且 AMD 可随时终止该许可。
Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。
推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。
OpenAI 发布 GPT-6 系列模型指南,帮助初创企业选择合适的 GPT-6 模型、调节推理力度(reasoning effort)。内容涵盖改进提示词与技能、协调工具调用,以及为生产环境准备工作流。
AWS 机器学习博客介绍 Adjudicated Query 设计模式,让业务用户通过 Amazon Quick 聊天界面提问合规问题,而通过与否的判定仍由确定性规则引擎完成,模型只负责翻译问题和叙述结果。
借助 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 连接到完全托管的 Web Search——一项兼容 MCP、基于覆盖数百亿文档的 Amazon 网页索引的搜索能力,所有查询流量都留在 AWS 基础设施内,无需管理外部 API 密钥。
Amazon SageMaker AI 推出多轮强化学习(MTRL)微调能力,可将 Qwen3.6-27B 训练成自主调用 BM25 词法检索与向量搜索工具的搜索智能体。
Ai2 开源基于 Qwen3-8B 的 AstaBrief 8B 模型和训练数据,该模型将研究问题与检索到的文献片段一次性生成带引文的报告,已在 Asta 的 Generate a report 功能中作为 Fast 模式与 Claude 驱动的 Thinking 模式并行提供。
AI 正在改变开发者工作方式,GitHub 博客提出三项值得强化的技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一个答案(如让第二个模型批评第一个模型的输出,类似 Copilot 的 Rubber Duck agent)、把省下的实现时间用于理解客户需求和技术决策。随着 AI 承担更多实现工作,技术判断力和权衡取舍能力变得更重要。
Google 宣布推出基于可信执行环境(TEE)的下一代联邦学习系统,为数据匿名化提供可远程验证与审计的保障。访问策略发布到公开透明日志 Rekor,KMS 和数据处理二进制可由开源代码复现构建;加密训练数据仅在 TEE 内解密处理,工作负载操作者只能看到指标和差分隐私模型权重。
NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,10 月 23 日起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发售,起售价 $4,999。
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型在环境中的失败案例和更强 teacher 的成功轨迹,自动生成可执行、真实且具难度的训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和 verifier 组成,需满足可行性、真实性和难度三项要求。团队用 EnterpriseOps Gym 的公开数据集演示了该流程,并随模型改进动态调整课程。