Latent Space AINews:TypeSafe/Jev 发布 3 周达成超 $100M ARR 与 $7.5B 估值
[AINews] TypeSafe/Jev at >$100M ARR, $7.5B valuation 3 weeks after launch
Latent Space AINews 报道 TypeSafe 的 Jev 发布 3 周后 ARR 突破 $100M、估值达 $7.5B,决策模型成为产品品类。
正如你在下方 AINews X 回顾板块所见,地球上所有人都在克隆 Jev API,但只有一家公司能开创这个品类。TypeSafe 宣布了他们的“Series AI”,而红杉资本“泄露”他们在第一周就突破了 1 亿美元 ARR。
发布了一个模型 每天意外服务数万亿 token 财富 500 强中 29.4% 的公司找上门来 从 @a16z 融了一轮非常大的 A 轮 才过去 3 周 我们现在只想睡觉
尽管有怀疑者指责这是水军营销,但我们希望大家能看出,我们的 Jev 播客是 100% 真实的。
2026年10月8日-10月9日的 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter 账号,没有更多 Discord。AINews 网站可以搜索所有往期内容。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择加入/退出不同的邮件频率!
决策模型成为一个产品品类
这个模式:多家厂商在同一天发布了“决策”模型。这些模型在单次前向传播中返回结构化的答案(概率、从列表中挑选、分数),而不是自由文本。Jev 是所有人进行基准测试的参照物,@scaling01评论了这一格式传播之快。
OpenAI Decisions API:三种请求类型:判断某个条件为真的概率、从列表中挑选,或对照等级打分。它接受文本和图像,运行在 GPT-6 Luna 上,成本为每百万输入 token 0.10 美元且不收取输出费用,按 OpenAI 自己的数据“最高快 10 倍”(@LearnOpenCV)。
Microsoft-Decision-1:定位于 LLM 评判器和科学假设筛选。一位早期评估者表示,决策模型在一致性和复杂决策上仍有困难(@omarsar0)。
Perplexity pplx-decider-v1.1-27b:宣称在 1,071 个案例中以 94.5% 的准确率登顶 Decision Bench,价格为每 1K 次决策 0.017 美元(@perplexitydevs)。
Cloudflare clef:新的 clef-omni 接受音频、视频、图像和文本。clef-flash 现在比 Jev 更便宜,且 clef 整体速度约快 2 倍(@michellechen)。权重已放在 Hugging Face 上。
Liquid d1:现已上线 Vercel AI Gateway,为分类、路由和打分任务提供视觉支持(@vercel_dev)。
服务与路由:vLLM Semantic Router 的 Decision 2.0 可以在一次处理中回答关于同一输入的多个问题,并给出每个选项的概率(@vllm_project)。LangSmith 使用 Jev 作为评判器,在每条 trace 上为难度和正确性分别返回结构化的答案(@hwchase17)。
训练你自己的:Unsloth 发布了一个免费 notebook,可在 8GB 显存上把 Qwen3.5-4B 变成一个决策模型(@UnslothAI)。一份关于 Qwen3.5-0.8B 的教程显示,60 步训练后准确率从 37% 提升到 65%,在 4GB 显存上大约只需 10 分钟(@akshay_pachaar)。
为什么执行框架需要这个:许多智能体步骤是“是/否”判断,而非生成任务。LangChain 表示,把每个任务路由到最便宜的够用模型后,Open SWE 每个任务的成本中位数降低了 64%(@hwchase17)。
相关研究:Apple/CMU 的 Selection-based Structured Reasoning(SSR)在智能体内部应用了同样的思路(@ZhihuFrontier)。
方法:六种自然语言策略通过长度归一化的对数似然进行评分,在一次共享 KV 缓存的批量前向传播中完成。
结果:每轮推理延迟下降超过 90%,但每个问题的端到端延迟仅下降 28–54%。在 Qwen3-VL-4B 上使用 GRPO,平均成功率为 61.37%,而 TAPO+GSPO 基线为 61.25%。
多智能体编排与编码工具
Claude Managed Agents 动态工作流(公开测试版):一个主导智能体编写分阶段计划,分发给每次运行最多 1,000 个智能体,然后合并结果。通过
multiagent_20261001启用(@ClaudeDevs,config)。成本警告:Anthropic 建议先从范围受限的任务开始,因为 token 消耗可能很高(guidance)。
Claude Code Projects:所有在等候名单上的 Pro 和 Max 用户均已获得访问权限。每个项目将任务作为并行线程运行(@ClaudeDevs),且会话现在可以在本地运行(@gem_ray)。
Opus 5.5 快速模式:已经推出,但它按用量积分计费,不包含在订阅中(@theo)。
智能体团队划算吗?:Vals AI 在 Vibe Code Bench 上单独和以团队形式测试了 GPT-6 Sol 和 Opus 5.5(@ValsAI)。
结果:团队的成本高出 1.8–5.1 倍。只有 Sol 在中等投入下有显著提升,提高了 7.3 分。
行为:Sol 沿架构边界进行并行委派。Opus 以串行波次运行,在最大投入下每个应用达到约 6.8 个子智能体和约 1,140 次子智能体工具调用,但没有显著收益(details)。
Prime Agent 用 Rust 重写自身:在两周内,一个超过 2,000 个智能体的集群使用了 10K+ 个沙箱和 200B+ 的 GLM-5.3 token。结果达到可用输入状态的速度快了约 13 倍,启动内存占用减少 83%(@PrimeIntellect)。一篇配套文章认为,上下文限制必然导致智能体集群的出现(essay)。
Codex 更新:
Windows 沙箱:基于 Microsoft Execution Containers(MXC)构建的新模式提供更快的设置、网络强制执行和细粒度的文件控制(@OpenAIDevs)。
Composer 预测:Codex 现在会建议你的下一条消息,目前处于测试阶段,仅限 Pro 用户(公告)。一些用户批评仅限 Pro 的门槛限制(@Angaisb_)。
可靠性:有用户抱怨出现长达一整天的宕机(@dzhng)。
舆情:DHH 表示 GPT-6.1 Sol 让 Codex 成为他超越 Claude 的主力工具(@dhh)。
Devin 和 Grok Bot:Devin 现在可以派生多棵受管 Devin 的树,因此总耗时取决于最慢的分支而非各分支之和(@devindevelopers)。Devin 还接受个人版 ChatGPT 套餐用于 GPT 用量(@cognition)。另外,Grok Bot 有了自己的电子邮箱地址,用于注册和日程安排(@bot)。
模型发布与独立评测
Qwen-Image-2.1-Turbo(开放权重):7B Qwen-Image-2.1 的加速版本检查点。它支持 8 步 2K 生成和自然语言编辑,可通过 Diffusers 加载
QwenImage21Pipeline,与 Pro 和 Turbo API 同步发布(@Alibaba_Qwen)。StepFun Step 5 预览版:一个总参数 600B、激活参数 27B 的稀疏 MoE,拥有 1M 上下文和视觉能力(@omarsar0)。
结果:它在 Hermes Index 上得到 33.89 分,与 GPT-6 Luna 持平,并在 Nous Portal 上免费开放一周(@NousResearch)。
可用性:它登上了 OpenRouter Trending 第一名,该榜单衡量的是使用量而非质量(@kimmonismus)。开放权重将于 10 月 15 日发布。最大输出已更正为 64K tokens(更正)。
Upstage Solar Mini 4:一个 35B MoE,激活参数 3B,524K 上下文,208 tok/s。其 24 分的 AAII 成绩是 3B 激活参数模型中最佳的,与 Nemotron 3 Ultra 相差不到 1 分。它在 Cline 中免费(@cline)。
Gemini 4 Argon:据报道在 DeepSWE v1.1 上达到 77.9%,而 Opus 5.5 为 74.2%。它将首先面向 650 多名 Fairwind Program 防御者提供,价格为每 M tokens 2/10 美元(@dl_weekly)。
信号:Antigravity 中出现了推理力度选择器(@testingcatalog),Logan Kilpatrick 表示“Argon 快来了”(@OfficialLoganK)。
未经证实:Business Insider 报道称,一个内部“Carbon”检查点在编程方面正逼近 Opus 5.5。
语音模型:HeyGen Voice 以 1,201 的 Elo 登顶 Artificial Analysis Controlled Voice TTS 竞技场,价格为每 1M 字符 30 美元,速度 40 字符/秒(@ArtificialAnlys)。Whistle 是一个 16.9MB 的端侧 STT 模型,据称可与 Whisper base 匹敌(@victormustar)。
多轮图像编辑:Artificial Analysis 连续执行了 30 次编辑(@ArtificialAnlys)。
结果:Ideogram 4.5 和 FLUX 3 进行局部编辑,在小幅编辑时能保持图像 95% 以上的区域不变。GPT Image 2.5 Sunburst 每一轮都会重新渲染画面的大部分区域,仅保留约 20% 不变,因此会产生漂移。Nano Banana 2.1 则会逐渐变暗。
OCR 基准测试:Roboflow 的新基准测试覆盖 48 个模型,GPT-6 Astra 在文本定位方面领先(@skalskip92)。Datalab 的 OmniParseBench 包含 90 种语言的 16K 项测试,而其自家的模型并未排名第一(@VikParuchuri)。
Arena 动态:Claude Haiku 5.5 在 WebDev 上排名第 30,价格为 $0.10/$0.50,与 GPT-6 Luna 价格相同但得分高出 6 分。Mistral Large 4 在 Agent Arena 上排名第 43(@arena)。ARC-AGI-3 上出现了 59.17% 的新高分(@arcprize)。
研究、训练与推理系统
vLLM 与 SGLang 在 Vera Rubin 上:vLLM 报告称,在 AgentX 上交互性相当的情况下,MiniMax M3 的吞吐量达到 GB200 的 7.8 倍以上。这些还是早期结果(@vllm_project)。
技术:局部性感知 MoE 利用 CUDA 13.4 的局部性域,使每个 SM 只读取本地 HBM,可将 MoE 解码速度提升至多 1.2 倍(详情)。
SGLang:FP8 MLA 在 128K 上下文时速度最高提升 20%,MoE 尾部融合带来 5.9% 的端到端提升,每步解码减少 276 次内核启动(@sgl_project)。
SemiAnalysis 的主张:一份 InferenceX 提交预览显示,相比 GB300,每吉瓦利润达 3.2 倍,每美元性能最高达 10 倍(@SemiAnalysis_)。
TRL v1.15:融合式 LM head 现已默认启用,避免了完整 logits 张量的物化(@LysandreJik)。
结果:在 Gemma 3 1B 上,GRPO 序列长度从 28K 提升到 114K,DPO 从 10K 提升到 59K。8K 时的峰值内存下降 52–82%,训练速度最高提升约 11%。
数据与后训练服务:
Datology Curation Studio:声称在 39 个开放数据集上为 30B MoE 提供 6 倍的算力乘数(@pratyushmaini)。它还引用了以 45 万美元训练的 Thomson-1,在正面对比中击败了 GPT-5.6 Sol(@arimorcos)。
Tinker:价格最高下调 70%,长上下文与短上下文定价相同,并新增了 GLM-5.3-Flash 和 DeepSeek-v4.1-Flash(@tinkerapi)。
DeepSeek 的周期性弱点:字节跳动 Seed 发现,检索效果取决于 token 相对压缩步幅的位置(@ZhihuFrontier)。
证据:在没有 RoPE 或学习门控的情况下,该模式依然存在,并与步幅长度相关。
解读:V4.1 的步幅为 2,减轻了但并未消除这一影响。
智能体研究:
来源:Latent Space · latent.space

