跳到正文

全部动态

今日 29 条
今天10月7日周三
  1. Microsoft Research48

    Microsoft Research 播客:AI 会出什么错,失败教会我们什么

    Microsoft Research 播客中,partner research manager Jennifer Neville 与应用科学家 Chad Atalla 对谈,探讨评测如何推动 AI 系统突破性能边界以满足用户需求,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她分享了使用现有 AI 系统的实用建议,并强调当结果不符合预期时仔细检查数据的重要性。

  2. Google Research47

    Google 发布智能体隐私与安全研讨会报告:以情境完整性视角探讨开放性难题

    Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。

  3. Hugging Face Blog43

    Falcon-Emirati-7B:让 LLM 学会阿联酋方言、文化与细微语义

    Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。

10月5日周一
10月4日周日
  1. Hugging Face Blog69

    Microsoft ThinkingBox 登陆 Hugging Face,以后端状态评测智能体真实可靠性

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。

    推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。

10月3日周六
  1. OpenAI News46

    GPT-6 系列模型使用指南

    OpenAI 发布 GPT-6 系列模型指南,帮助初创企业选择合适的 GPT-6 模型、调节推理力度(reasoning effort)。内容涵盖改进提示词与技能、协调工具调用,以及为生产环境准备工作流。

10月2日周五
  1. GitHub Blog · AI & ML41

    AI 正在改变开发者工作:GitHub 官方博客提出三项需要强化的技能

    AI 正在改变开发者工作方式,GitHub 博客提出三项值得强化的技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一个答案(如让第二个模型批评第一个模型的输出,类似 Copilot 的 Rubber Duck agent)、把省下的实现时间用于理解客户需求和技术决策。随着 AI 承担更多实现工作,技术判断力和权衡取舍能力变得更重要。

  2. Google Research51

    Google 发布基于 TEE 的下一代联邦学习系统,Gboard 已率先部署

    Google 宣布推出基于可信执行环境(TEE)的下一代联邦学习系统,为数据匿名化提供可远程验证与审计的保障。访问策略发布到公开透明日志 Rekor,KMS 和数据处理二进制可由开源代码复现构建;加密训练数据仅在 TEE 内解密处理,工作负载操作者只能看到指标和差分隐私模型权重。

  3. Hugging Face Blog39

    AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 推出 AutoSynthData,利用目标模型在环境中的失败案例和更强 teacher 的成功轨迹,自动生成可执行、真实且具难度的训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和 verifier 组成,需满足可行性、真实性和难度三项要求。团队用 EnterpriseOps Gym 的公开数据集演示了该流程,并随模型改进动态调整课程。