跳到正文
Latent Space·· 5 小时前AI 评分52

Latent Space AINews:TypeSafe/Jev 发布 3 周达成超 $100M ARR 与 $7.5B 估值

[AINews] TypeSafe/Jev at >$100M ARR, $7.5B valuation 3 weeks after launch

AI 导读

Latent Space AINews 报道 TypeSafe 的 Jev 发布 3 周后 ARR 突破 $100M、估值达 $7.5B,决策模型成为产品品类。

正文 · AI 翻译

正如你在下方 AINews X 回顾板块所见,地球上所有人都在克隆 Jev API,但只有一家公司能开创这个品类。TypeSafe 宣布了他们的“Series AI”,而红杉资本“泄露”他们在第一周就突破了 1 亿美元 ARR。

X avatar for @CompleteSkeptic

Diogo Almeida@CompleteSkeptic

发布了一个模型 每天意外服务数万亿 token 财富 500 强中 29.4% 的公司找上门来 从 @a16z 融了一轮非常大的 A 轮 才过去 3 周 我们现在只想睡觉

2026年10月9日 下午4:26 · 81.1万次浏览

467 条回复 · 219 次转发 · 6.07K 个赞

尽管有怀疑者指责这是水军营销,但我们希望大家能看出,我们的 Jev 播客是 100% 真实的。

2026年10月8日-10月9日的 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter 账号,没有更多 Discord。AINews 网站可以搜索所有往期内容。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择加入/退出不同的邮件频率!

决策模型成为一个产品品类

  • 这个模式:多家厂商在同一天发布了“决策”模型。这些模型在单次前向传播中返回结构化的答案(概率、从列表中挑选、分数),而不是自由文本。Jev 是所有人进行基准测试的参照物,@scaling01评论了这一格式传播之快。

    • OpenAI Decisions API:三种请求类型:判断某个条件为真的概率、从列表中挑选,或对照等级打分。它接受文本和图像,运行在 GPT-6 Luna 上,成本为每百万输入 token 0.10 美元且不收取输出费用,按 OpenAI 自己的数据“最高快 10 倍”(@LearnOpenCV)。

    • Microsoft-Decision-1:定位于 LLM 评判器和科学假设筛选。一位早期评估者表示,决策模型在一致性和复杂决策上仍有困难(@omarsar0)。

    • Perplexity pplx-decider-v1.1-27b:宣称在 1,071 个案例中以 94.5% 的准确率登顶 Decision Bench,价格为每 1K 次决策 0.017 美元(@perplexitydevs)。

    • Cloudflare clef:新的 clef-omni 接受音频、视频、图像和文本。clef-flash 现在比 Jev 更便宜,且 clef 整体速度约快 2 倍(@michellechen)。权重已放在 Hugging Face 上。

    • Liquid d1:现已上线 Vercel AI Gateway,为分类、路由和打分任务提供视觉支持(@vercel_dev)。

  • 服务与路由:vLLM Semantic Router 的 Decision 2.0 可以在一次处理中回答关于同一输入的多个问题,并给出每个选项的概率(@vllm_project)。LangSmith 使用 Jev 作为评判器,在每条 trace 上为难度和正确性分别返回结构化的答案(@hwchase17)。

  • 训练你自己的:Unsloth 发布了一个免费 notebook,可在 8GB 显存上把 Qwen3.5-4B 变成一个决策模型(@UnslothAI)。一份关于 Qwen3.5-0.8B 的教程显示,60 步训练后准确率从 37% 提升到 65%,在 4GB 显存上大约只需 10 分钟(@akshay_pachaar)。

  • 为什么执行框架需要这个:许多智能体步骤是“是/否”判断,而非生成任务。LangChain 表示,把每个任务路由到最便宜的够用模型后,Open SWE 每个任务的成本中位数降低了 64%(@hwchase17)。

  • 相关研究:Apple/CMU 的 Selection-based Structured Reasoning(SSR)在智能体内部应用了同样的思路(@ZhihuFrontier)。

    • 方法:六种自然语言策略通过长度归一化的对数似然进行评分,在一次共享 KV 缓存的批量前向传播中完成。

    • 结果:每轮推理延迟下降超过 90%,但每个问题的端到端延迟仅下降 28–54%。在 Qwen3-VL-4B 上使用 GRPO,平均成功率为 61.37%,而 TAPO+GSPO 基线为 61.25%。

多智能体编排与编码工具

  • Claude Managed Agents 动态工作流(公开测试版):一个主导智能体编写分阶段计划,分发给每次运行最多 1,000 个智能体,然后合并结果。通过 multiagent_20261001 启用(@ClaudeDevs,config)。

    • 成本警告:Anthropic 建议先从范围受限的任务开始,因为 token 消耗可能很高(guidance)。

    • Claude Code Projects:所有在等候名单上的 Pro 和 Max 用户均已获得访问权限。每个项目将任务作为并行线程运行(@ClaudeDevs),且会话现在可以在本地运行(@gem_ray)。

    • Opus 5.5 快速模式:已经推出,但它按用量积分计费,不包含在订阅中(@theo)。

  • 智能体团队划算吗?:Vals AI 在 Vibe Code Bench 上单独和以团队形式测试了 GPT-6 Sol 和 Opus 5.5(@ValsAI)。

    • 结果:团队的成本高出 1.8–5.1 倍。只有 Sol 在中等投入下有显著提升,提高了 7.3 分。

    • 行为:Sol 沿架构边界进行并行委派。Opus 以串行波次运行,在最大投入下每个应用达到约 6.8 个子智能体和约 1,140 次子智能体工具调用,但没有显著收益(details)。

  • Prime Agent 用 Rust 重写自身:在两周内,一个超过 2,000 个智能体的集群使用了 10K+ 个沙箱和 200B+ 的 GLM-5.3 token。结果达到可用输入状态的速度快了约 13 倍,启动内存占用减少 83%(@PrimeIntellect)。一篇配套文章认为,上下文限制必然导致智能体集群的出现(essay)。

  • Codex 更新:

    • Windows 沙箱:基于 Microsoft Execution Containers(MXC)构建的新模式提供更快的设置、网络强制执行和细粒度的文件控制(@OpenAIDevs)。

    • Composer 预测:Codex 现在会建议你的下一条消息,目前处于测试阶段,仅限 Pro 用户(公告)。一些用户批评仅限 Pro 的门槛限制(@Angaisb_)。

    • 可靠性:有用户抱怨出现长达一整天的宕机(@dzhng)。

    • 舆情:DHH 表示 GPT-6.1 Sol 让 Codex 成为他超越 Claude 的主力工具(@dhh)。

  • Devin 和 Grok Bot:Devin 现在可以派生多棵受管 Devin 的树,因此总耗时取决于最慢的分支而非各分支之和(@devindevelopers)。Devin 还接受个人版 ChatGPT 套餐用于 GPT 用量(@cognition)。另外,Grok Bot 有了自己的电子邮箱地址,用于注册和日程安排(@bot)。

模型发布与独立评测

  • Qwen-Image-2.1-Turbo(开放权重):7B Qwen-Image-2.1 的加速版本检查点。它支持 8 步 2K 生成和自然语言编辑,可通过 Diffusers 加载QwenImage21Pipeline,与 Pro 和 Turbo API 同步发布(@Alibaba_Qwen)。

  • StepFun Step 5 预览版:一个总参数 600B、激活参数 27B 的稀疏 MoE,拥有 1M 上下文和视觉能力(@omarsar0)。

    • 结果:它在 Hermes Index 上得到 33.89 分,与 GPT-6 Luna 持平,并在 Nous Portal 上免费开放一周(@NousResearch)。

    • 可用性:它登上了 OpenRouter Trending 第一名,该榜单衡量的是使用量而非质量(@kimmonismus)。开放权重将于 10 月 15 日发布。最大输出已更正为 64K tokens(更正)。

  • Upstage Solar Mini 4:一个 35B MoE,激活参数 3B,524K 上下文,208 tok/s。其 24 分的 AAII 成绩是 3B 激活参数模型中最佳的,与 Nemotron 3 Ultra 相差不到 1 分。它在 Cline 中免费(@cline)。

  • Gemini 4 Argon:据报道在 DeepSWE v1.1 上达到 77.9%,而 Opus 5.5 为 74.2%。它将首先面向 650 多名 Fairwind Program 防御者提供,价格为每 M tokens 2/10 美元(@dl_weekly)。

    • 信号:Antigravity 中出现了推理力度选择器(@testingcatalog),Logan Kilpatrick 表示“Argon 快来了”(@OfficialLoganK)。

    • 未经证实:Business Insider 报道称,一个内部“Carbon”检查点在编程方面正逼近 Opus 5.5。

  • 语音模型:HeyGen Voice 以 1,201 的 Elo 登顶 Artificial Analysis Controlled Voice TTS 竞技场,价格为每 1M 字符 30 美元,速度 40 字符/秒(@ArtificialAnlys)。Whistle 是一个 16.9MB 的端侧 STT 模型,据称可与 Whisper base 匹敌(@victormustar)。

  • 多轮图像编辑:Artificial Analysis 连续执行了 30 次编辑(@ArtificialAnlys)。

    • 结果:Ideogram 4.5 和 FLUX 3 进行局部编辑,在小幅编辑时能保持图像 95% 以上的区域不变。GPT Image 2.5 Sunburst 每一轮都会重新渲染画面的大部分区域,仅保留约 20% 不变,因此会产生漂移。Nano Banana 2.1 则会逐渐变暗。

  • OCR 基准测试:Roboflow 的新基准测试覆盖 48 个模型,GPT-6 Astra 在文本定位方面领先(@skalskip92)。Datalab 的 OmniParseBench 包含 90 种语言的 16K 项测试,而其自家的模型并未排名第一(@VikParuchuri)。

  • Arena 动态:Claude Haiku 5.5 在 WebDev 上排名第 30,价格为 $0.10/$0.50,与 GPT-6 Luna 价格相同但得分高出 6 分。Mistral Large 4 在 Agent Arena 上排名第 43(@arena)。ARC-AGI-3 上出现了 59.17% 的新高分(@arcprize)。

研究、训练与推理系统

  • vLLM 与 SGLang 在 Vera Rubin 上:vLLM 报告称,在 AgentX 上交互性相当的情况下,MiniMax M3 的吞吐量达到 GB200 的 7.8 倍以上。这些还是早期结果(@vllm_project)。

    • 技术:局部性感知 MoE 利用 CUDA 13.4 的局部性域,使每个 SM 只读取本地 HBM,可将 MoE 解码速度提升至多 1.2 倍(详情)。

    • SGLang:FP8 MLA 在 128K 上下文时速度最高提升 20%,MoE 尾部融合带来 5.9% 的端到端提升,每步解码减少 276 次内核启动(@sgl_project)。

    • SemiAnalysis 的主张:一份 InferenceX 提交预览显示,相比 GB300,每吉瓦利润达 3.2 倍,每美元性能最高达 10 倍(@SemiAnalysis_)。

  • TRL v1.15:融合式 LM head 现已默认启用,避免了完整 logits 张量的物化(@LysandreJik)。

    • 结果:在 Gemma 3 1B 上,GRPO 序列长度从 28K 提升到 114K,DPO 从 10K 提升到 59K。8K 时的峰值内存下降 52–82%,训练速度最高提升约 11%。

  • 数据与后训练服务:

    • Datology Curation Studio:声称在 39 个开放数据集上为 30B MoE 提供 6 倍的算力乘数(@pratyushmaini)。它还引用了以 45 万美元训练的 Thomson-1,在正面对比中击败了 GPT-5.6 Sol(@arimorcos)。

    • Tinker:价格最高下调 70%,长上下文与短上下文定价相同,并新增了 GLM-5.3-Flash 和 DeepSeek-v4.1-Flash(@tinkerapi)。

  • DeepSeek 的周期性弱点:字节跳动 Seed 发现,检索效果取决于 token 相对压缩步幅的位置(@ZhihuFrontier)。

    • 证据:在没有 RoPE 或学习门控的情况下,该模式依然存在,并与步幅长度相关。

    • 解读:V4.1 的步幅为 2,减轻了但并未消除这一影响。

  • 智能体研究:

    • 智能体可塑性(Meta):衡量每单位学习成本带来的保留集增益。表现最佳者并非学习效率最高者(@omarsar0)。

    • MIMESIS:一个 9B 的用户模拟器,在行为保真度上超越 Opus 5 达 13.4 分(@dair_ai)。

    • 基座模型选择(NVIDIA):根据基座模型能否复现“决定性编辑”来对各个检查点进行排名,这一信号与后训练后的 SWE-bench Verified 分数相关(@dair_ai)。

来源:Latent Space · latent.space