跳到正文

全部动态

今日 89 条
今天10月7日周三
  1. TechCrunch · AI45

    Musubi 发布 PolicyLM-1.7B:用 AI 决策模型改变内容审核方式

    Musubi 于周二发布面向实时内容审核的轻量级决策模型 PolicyLM-1.7B,以开放权重开源。该模型可将英文撰写的内容政策应用于消息,耗时低于 50 毫秒,成本和速度接近多数社交平台使用的 AI 分类器,且政策变更时无需重新训练。决策模型因 9 月 TypeSafe AI 发布 Jev 而成为热门方向,OpenAI 和 Amazon 也随后推出了竞品。

  2. The Verge · AI76

    OpenAI 发布722篇数学手稿,涵盖数百个开放问题解答

    OpenAI 发布722篇数学手稿,覆盖372个结果族,据 AGMAI 称包含对"数百"个开放问题的解答,成果由一个未发布的前沿模型产生。手稿发布在 GitHub 仓库并附论文修订与引用协议,还包括模型推理摘要、算力估算,OpenAI 称平均每个结果相当于 ChatGPT Pro 三小时的思考量。

    推荐理由:报道给出722篇手稿的规模、问题数量和算力估算,读者可据此了解这批数学成果的实际内容与学界争议。

  3. TechCrunch · AI42

    前 Ramp 工程师创办的 Melius 在推翻首款产品后融资 2000 万美元

    AI 广告创意平台 Melius 于周二宣布共融资 2500 万美元,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司由三位前 Ramp 工程师创办,在放弃原有的 AI 营销工具、重写整个代码库后,转向生成广告素材与活动的"创意工作智能体实验室",并称 7 月出隐身两个月内年化收入超 100 万美元。

10月5日周一
  1. Simon Willison33

    Qwen3.8 27B 用单词做加法基准测试

    一项基准测试了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型能否只用英文单词表达正整数加法的精确结果,共 5,070 个关闭推理的用例及 169 个开启推理的对照用例。关闭推理时数值准确率仅 23.57%,其中 1-3 位数运算达 97.04%,10-13 位数降至 6.44%,格式合规率 96.17%;开启推理后在 169 次尝试中答对 167 次。

10月4日周日
  1. Hugging Face Blog69

    Microsoft ThinkingBox 登陆 Hugging Face,以后端状态评测智能体真实可靠性

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。

    推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。

  2. Simon Willison15

    Simon Willison 九月赞助者专属通讯发布

    Simon Willison 发出九月赞助者专属月度通讯,仅赞助者可立即阅读,内容涵盖 Fable 级模型、价格战、LLM 进军数学、误操作网络攻击及 Datasette 漏洞风波等。免费版会延后公开,付费 $10/月可提前一个月看到。

10月3日周六
  1. OpenAI News46

    GPT-6 系列模型使用指南

    OpenAI 发布 GPT-6 系列模型指南,帮助初创企业选择合适的 GPT-6 模型、调节推理力度(reasoning effort)。内容涵盖改进提示词与技能、协调工具调用,以及为生产环境准备工作流。

10月2日周五
  1. MIT Technology Review · AI25

    MIT Technology Review 报告:用自主智能体重塑企业智能

    MIT Technology Review Insights 发布报告,提出企业正经历从 AI 工具到 AI 运营模式的"agentic shift"。2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业尚未通过 AI 实现收入增长。报告指出企业需重建面向可访问性的数据基础设施、采用可组合架构,并解决 AI 主权问题。

  2. GitHub Blog · AI & ML41

    AI 正在改变开发者工作:GitHub 官方博客提出三项需要强化的技能

    AI 正在改变开发者工作方式,GitHub 博客提出三项值得强化的技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一个答案(如让第二个模型批评第一个模型的输出,类似 Copilot 的 Rubber Duck agent)、把省下的实现时间用于理解客户需求和技术决策。随着 AI 承担更多实现工作,技术判断力和权衡取舍能力变得更重要。

  3. Google Research51

    Google 发布基于 TEE 的下一代联邦学习系统,Gboard 已率先部署

    Google 宣布推出基于可信执行环境(TEE)的下一代联邦学习系统,为数据匿名化提供可远程验证与审计的保障。访问策略发布到公开透明日志 Rekor,KMS 和数据处理二进制可由开源代码复现构建;加密训练数据仅在 TEE 内解密处理,工作负载操作者只能看到指标和差分隐私模型权重。

  4. Ars Technica · AI62

    Nvidia Shield TV Pro 因内存成本上涨涨价 $100 至 $299.99

    Nvidia 宣布 2019 年发布的 Shield TV Pro 即日起涨价 $100,新价为 $299.99。Nvidia 发言人向 Ars Technica 确认,10 月 2 日起调价,原因是全行业内存等元件成本大幅上升;非 Pro 版此前已停售,Shield 仍在持续生产,新机与当前设备一样受供应链成本影响。

  5. Latent Space66

    Airbnb CTO Ahmad Al-Dahle 详解 AI 原生化转型:60% 代码由 AI 编写、约半数客服工单由 AI 解决

    Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,阐述将 Airbnb 打造为 AI 原生公司的做法。Airbnb 目前 60% 的代码由 AI 编写,功能和改进发布量同比增长近 80%,工程师平均 pull-request 吞吐量提升约 1.6x;约一半客服工单由 AI 纯自动解决,与 Q2 财报的近 45% 一致。

  6. The Verge · AI62

    Suno 推出 Speech 公共 beta,可同时生成语音与背景音乐

    Suno 推出 Speech 功能并在网页和移动端开放公共 beta,可基于脚本或提示词同时生成配音和背景音乐。功能分 Simple 和 Advanced 两种模式,Advanced 支持自定义脚本,并可调整 AI 声音的性别、语音风格和变化程度,时长上限约八分钟。背景音乐可通过开关关闭,官方承认功能仍不完善,将根据用户反馈持续改进。

  7. Hugging Face Blog39

    AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 推出 AutoSynthData,利用目标模型在环境中的失败案例和更强 teacher 的成功轨迹,自动生成可执行、真实且具难度的训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和 verifier 组成,需满足可行性、真实性和难度三项要求。团队用 EnterpriseOps Gym 的公开数据集演示了该流程,并随模型改进动态调整课程。