跳到正文

#Agent

今日 13 条
今天10月7日周三
  1. Google Research47

    Google 发布智能体隐私与安全研讨会报告:以情境完整性视角探讨开放性难题

    Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。

10月4日周日
  1. Hugging Face Blog69

    Microsoft ThinkingBox 登陆 Hugging Face,以后端状态评测智能体真实可靠性

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。

    推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。

10月3日周六
  1. OpenAI News46

    GPT-6 系列模型使用指南

    OpenAI 发布 GPT-6 系列模型指南,帮助初创企业选择合适的 GPT-6 模型、调节推理力度(reasoning effort)。内容涵盖改进提示词与技能、协调工具调用,以及为生产环境准备工作流。

10月2日周五
  1. GitHub Blog · AI & ML41

    AI 正在改变开发者工作:GitHub 官方博客提出三项需要强化的技能

    AI 正在改变开发者工作方式,GitHub 博客提出三项值得强化的技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一个答案(如让第二个模型批评第一个模型的输出,类似 Copilot 的 Rubber Duck agent)、把省下的实现时间用于理解客户需求和技术决策。随着 AI 承担更多实现工作,技术判断力和权衡取舍能力变得更重要。

  2. Hugging Face Blog39

    AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 推出 AutoSynthData,利用目标模型在环境中的失败案例和更强 teacher 的成功轨迹,自动生成可执行、真实且具难度的训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和 verifier 组成,需满足可行性、真实性和难度三项要求。团队用 EnterpriseOps Gym 的公开数据集演示了该流程,并随模型改进动态调整课程。

10月1日周四
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,定价为每百万输入 token $2、输出 token $10,缓存输入 95% 折扣。

    推荐理由:官方博客给出定价、1M 输出 token 上限、基准分数和内部迁移案例,读者可以据此判断它在编程与安全防御上的实际定位。

9月30日周三
  1. AWS Machine Learning Blog62

    AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上构建三智能体音乐制作流水线

    AWS Machine Learning Blog 发布实操教程,用 AgentCore Runtime Instances 构建由作曲、交付、合规三个智能体组成的音乐制作流水线,在 g6.xlarge 上以相同 runtimeSessionId 将三个智能体协同定位到同一 GPU 实例。

    推荐理由:AWS 官方教程给出三智能体共享 GPU 实例协作的完整代码和实测数据,方法可迁移到其他长时多智能体工作流。

  2. AMD 芯片与算力43

    AMD 发布 Ross™ 智能体 AI 助手,加速嵌入式设计开发全流程

    AMD 推出面向嵌入式开发全流程的智能体 AI 助手 AMD Ross™,覆盖架构设计、优化、调试、PCB 设计、原理图审查、软件与部署。它通过 MCP 服务器连接 AMD Embedded 工具,并内置 AMD Knowledge Base、专家编写的 agent skills 和可运行设计示例,支持自然语言查询文档、执行命令和自动化工作流。

  3. AWS Machine Learning Blog69

    OpenAI GPT-6.1 Sol 在 Amazon Bedrock 正式上线

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用,聚焦智能体编码、计算机操作和专业工作负载的更强推理能力。据 OpenAI 称,其 DeepSWE v1.1 成绩与 GPT-6 Astra 相当且每任务成本约为五分之一,超过 GPT-6 Sol 最佳成绩 6.4 个百分点;在透明度、用户意图和显式限制评估中也优于 GPT-6 Sol。

    推荐理由:官方公告给出了与 GPT-6 Sol 和 GPT-6 Astra 的具体对比数据,可帮助读者评估其智能体工作场景的性价比。

  4. AWS Machine Learning Blog37

    Amazon Quick 提示词工程基础指南(系列上篇)

    AWS 发布 Amazon Quick 提示词工程基础教程,讲解如何通过结构化提示词让平台的 AI 功能更准确地响应自然语言请求。文章介绍核心原则——明确性、提供业务上下文、用示例示范输出格式,并给出适用于各组件的 CRISPE 通用提示词框架(含 Context、Role、Intent、Steps 等要素)。

9月29日周二
  1. Microsoft Research62

    Microsoft Research 发布面向生物学的 AI 研究系统 Quine

    Microsoft Research 推出 Quine,一个包含生物学多模态世界模型和连接科学工具、文献与科研人员的交互框架的研究系统。它与 Broad Institute 合作将其用于胰腺导管腺癌(PDAC)研究,预测并排序可驱动肿瘤细胞状态转变的化合物,湿实验验证了排名靠前的候选化合物,从缩小化合物范围到确定待验证候选只需一个周末。

    推荐理由:微软官方介绍 Quine 的架构与 PDAC 癌症研究实测结果,读者可以了解 AI 世界模型如何压缩湿实验迭代周期。