Musubi 发布 PolicyLM-1.7B:用 AI 决策模型改变内容审核方式
Musubi 于周二发布面向实时内容审核的轻量级决策模型 PolicyLM-1.7B,以开放权重开源。该模型可将英文撰写的内容政策应用于消息,耗时低于 50 毫秒,成本和速度接近多数社交平台使用的 AI 分类器,且政策变更时无需重新训练。决策模型因 9 月 TypeSafe AI 发布 Jev 而成为热门方向,OpenAI 和 Amazon 也随后推出了竞品。
Musubi 于周二发布面向实时内容审核的轻量级决策模型 PolicyLM-1.7B,以开放权重开源。该模型可将英文撰写的内容政策应用于消息,耗时低于 50 毫秒,成本和速度接近多数社交平台使用的 AI 分类器,且政策变更时无需重新训练。决策模型因 9 月 TypeSafe AI 发布 Jev 而成为热门方向,OpenAI 和 Amazon 也随后推出了竞品。
AWS Machine Learning Blog 发布教程,演示用 OpenClaw 智能体框架和 Amazon Bedrock AgentCore runtime、memory 构建带长期记忆的园艺助手 Sprout。
Mistral 发布 Mistral Large 4(ML4)公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放下载。
推荐理由:官方发布了参数规模、基准分数、训练基础设施和权重开放时间表,读者可据此评估它在开源阵营中的实际位置。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,采用 Apache 2.0 许可,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:官方给出了参数量、内存占用和基准得分等具体指标,可帮助读者评估它是否适合端侧检索场景。
电信运营商正基于开放模型构建 AI 战略,NVIDIA 最新《State of AI in Telecommunications》报告中 89% 的受访者认为开源模型和软件对其 AI 战略重要。
OpenAI 发布722篇数学手稿,覆盖372个结果族,据 AGMAI 称包含对"数百"个开放问题的解答,成果由一个未发布的前沿模型产生。手稿发布在 GitHub 仓库并附论文修订与引用协议,还包括模型推理摘要、算力估算,OpenAI 称平均每个结果相当于 ChatGPT Pro 三小时的思考量。
推荐理由:报道给出722篇手稿的规模、问题数量和算力估算,读者可据此了解这批数学成果的实际内容与学界争议。
AI 广告创意平台 Melius 于周二宣布共融资 2500 万美元,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司由三位前 Ramp 工程师创办,在放弃原有的 AI 营销工具、重写整个代码库后,转向生成广告素材与活动的"创意工作智能体实验室",并称 7 月出隐身两个月内年化收入超 100 万美元。
AMD 宣布将于 2026 年 11 月 3 日(周二)美股收盘后发布 2026 财年第三季度财报,管理层将在美东时间下午 5 点举行电话会议,投资者可通过 ir.amd.com 收听网络直播。
Intel 宣布将于 2026 年 10 月 29 日美股收盘后发布第三季度财报,并于当天下午 2 点 PDT 召开财报电话会议。电话会议将在 Intel 投资者关系网站 intc.com 进行公开直播,相关材料和回放也会在该网站提供。
MIT Technology Review 的 EmTech Future 2026 大会全面内容现已开放点播,完整节目定价 $596,订阅用户可享 20% 折扣。
AMD 发布 AMD Helios AI 基础设施相关视频资源,并提供包含 AMD 商标和标志的品牌资产下载。下载前须接受条款与条件,这些 AMD Marks 仅可用于包含 AMD CPU、GPU、APU 或 FPGA 产品的宣传推广,且 AMD 可随时终止该许可。
一项基准测试了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型能否只用英文单词表达正整数加法的精确结果,共 5,070 个关闭推理的用例及 169 个开启推理的对照用例。关闭推理时数值准确率仅 23.57%,其中 1-3 位数运算达 97.04%,10-13 位数降至 6.44%,格式合规率 96.17%;开启推理后在 169 次尝试中答对 167 次。
Simon Willison 撰文主张按用量计费服务和 API 应默认提供硬性预算上限,超过限额即停用并报错,而非仅发警告邮件,因为编程 Agent 降低了启动可能产生账单的代码的门槛。
Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。
推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。
Simon Willison 发出九月赞助者专属月度通讯,仅赞助者可立即阅读,内容涵盖 Fable 级模型、价格战、LLM 进军数学、误操作网络攻击及 Datasette 漏洞风波等。免费版会延后公开,付费 $10/月可提前一个月看到。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,Agent Arena 排名第 5,比 GPT-6 Sol 便宜 39% 且得分高 1.52 分,比 Astra 便宜 81%。
Apple 宣布更改 macOS 隐私设置,阻止第三方开发者借此权限读取用户消息历史。此前专栏作家 Jason Aten 称 Meta 的 AI 智能体 Muse 在未经授权的情况下推送了其 Apple Messages 私聊内容。
Amazon 周五承诺未来五年向数据中心周边社区捐出超 10 亿美元,用于教育、职业培训、能源可负担性、水资源等领域,并承诺数据中心不推高电价、2030 年前实现“water positive”,声称 75% 的项目已达标。
美国司法部逮捕 Earthmade Computer CEO、38 岁的 Greg Lui,指控其自 2023 年 10 月至 2026 年 8 月用虚假文件向马来西亚、新加坡等地货代公司托运含出口管制 Nvidia A100 和 H100 GPU 的服务器,实际转运至中国杭州某公司,涉案价值超 3 亿美元。
OpenAI 发布 GPT-6 系列模型指南,帮助初创企业选择合适的 GPT-6 模型、调节推理力度(reasoning effort)。内容涵盖改进提示词与技能、协调工具调用,以及为生产环境准备工作流。
MIT Technology Review Insights 发布报告,提出企业正经历从 AI 工具到 AI 运营模式的"agentic shift"。2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业尚未通过 AI 实现收入增长。报告指出企业需重建面向可访问性的数据基础设施、采用可组合架构,并解决 AI 主权问题。
AWS 机器学习博客介绍 Adjudicated Query 设计模式,让业务用户通过 Amazon Quick 聊天界面提问合规问题,而通过与否的判定仍由确定性规则引擎完成,模型只负责翻译问题和叙述结果。
借助 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 连接到完全托管的 Web Search——一项兼容 MCP、基于覆盖数百亿文档的 Amazon 网页索引的搜索能力,所有查询流量都留在 AWS 基础设施内,无需管理外部 API 密钥。
Amazon SageMaker AI 推出多轮强化学习(MTRL)微调能力,可将 Qwen3.6-27B 训练成自主调用 BM25 词法检索与向量搜索工具的搜索智能体。
Ai2 开源基于 Qwen3-8B 的 AstaBrief 8B 模型和训练数据,该模型将研究问题与检索到的文献片段一次性生成带引文的报告,已在 Asta 的 Generate a report 功能中作为 Fast 模式与 Claude 驱动的 Thinking 模式并行提供。
AI 正在改变开发者工作方式,GitHub 博客提出三项值得强化的技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一个答案(如让第二个模型批评第一个模型的输出,类似 Copilot 的 Rubber Duck agent)、把省下的实现时间用于理解客户需求和技术决策。随着 AI 承担更多实现工作,技术判断力和权衡取舍能力变得更重要。
Google 宣布推出基于可信执行环境(TEE)的下一代联邦学习系统,为数据匿名化提供可远程验证与审计的保障。访问策略发布到公开透明日志 Rekor,KMS 和数据处理二进制可由开源代码复现构建;加密训练数据仅在 TEE 内解密处理,工作负载操作者只能看到指标和差分隐私模型权重。
Nvidia 宣布 2019 年发布的 Shield TV Pro 即日起涨价 $100,新价为 $299.99。Nvidia 发言人向 Ars Technica 确认,10 月 2 日起调价,原因是全行业内存等元件成本大幅上升;非 Pro 版此前已停售,Shield 仍在持续生产,新机与当前设备一样受供应链成本影响。
Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,阐述将 Airbnb 打造为 AI 原生公司的做法。Airbnb 目前 60% 的代码由 AI 编写,功能和改进发布量同比增长近 80%,工程师平均 pull-request 吞吐量提升约 1.6x;约一半客服工单由 AI 纯自动解决,与 Q2 财报的近 45% 一致。
NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,10 月 23 日起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发售,起售价 $4,999。
Mercor 的研究让 12 名平均经验 5 年半的持证会计师完成 APEX Accounting Benchmark 的简化任务,结果显示当今 AI 模型的速度、准确率和成本均优于会计师,而 18 个月前最佳模型得分还低于会计师约 37% 的平均水平。
Suno 推出 Speech 功能并在网页和移动端开放公共 beta,可基于脚本或提示词同时生成配音和背景音乐。功能分 Simple 和 Advanced 两种模式,Advanced 支持自定义脚本,并可调整 AI 声音的性别、语音风格和变化程度,时长上限约八分钟。背景音乐可通过开关关闭,官方承认功能仍不完善,将根据用户反馈持续改进。
Ramp 最新 AI Index 显示美国企业 AI 支出下降,自 7 月支出见顶后用量增长约 50%,9 月底创纪录。
Microsoft AI 发布实时语音转写模型 MAI-Transcribe-2-Streaming,称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首批部分结果延迟仅 100 多毫秒,年底前每小时音频定价 $0.54。
Black Forest Labs 发布 Flux 3 模型家族的图像侧模型 Flux 3 Image,宣称支持在不改动图片其他部分的前提下进行多步编辑,覆盖文生图、图生图、文字渲染与照片级写实。
DeepMind AlphaGo 团队前核心成员 Thore Graepel 撰文指出,大语言模型本质上仍是快速联想的 next-token 预测,其思维链并非独立推理机制,不具备科学意义上的推理。
Earendil 旗下智能体框架 Pi 发布 Pi 1.0 和 Pi Durable,均登上 HN 首页。
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型在环境中的失败案例和更强 teacher 的成功轨迹,自动生成可执行、真实且具难度的训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和 verifier 组成,需满足可行性、真实性和难度三项要求。团队用 EnterpriseOps Gym 的公开数据集演示了该流程,并随模型改进动态调整课程。
SK hynix Ventures 举办发布活动,其员工与全球合作伙伴探讨技术及合作机会。该部门致力于识别有前景的技术并创造新的商业机会,为未来发展寻找路径。
SK hynix Ventures 介绍了其发掘有前景技术并创造新商业机会的路径。9 月,该公司在硅谷举办了 SK hynix Ventures Day 活动。