返回文章列表
文章详情AI 入门

Poolside 开源 Laguna S 2.1:118B 参数只激活 8B,连自家跑分都不吹牛

在 Kimi K3、Qwen 3.8 卷万亿参数的另一头,美国公司 Poolside 开源了 8B 激活的编程模型 Laguna S 2.1:家用硬件有机会本地跑、免登录网页可试。官方自家跑分坦承离顶级还差得远,还自列三个已知缺陷、公开全部评测轨迹供人复查——透明度比分数更值得全行业学。

更新于 2026-07-225 分钟4

一分钟速览

  • 美国 AI 公司 Poolside 开源了编程模型 Laguna S 2.1:118B 总参数的 MoE 架构、每次只激活 8B,支持 100 万 token 上下文,权重发布当天就上了 Hugging Face。
  • 它走的是和 Kimi K3(2.8 万亿)、Qwen 3.8(2.4 万亿)完全相反的路线:不卷参数上限,卷「普通硬件能不能跑」——官方直接提供 GGUF、MLX 等本地格式。
  • 官方自家跑分都没吹牛:长时程编程测试上离 Kimi K3 和 Claude Fable 5 还差得远(DeepSWE 40.4% vs 约 70%),定位是「以小博大」,在同体量里能打。
  • 两个罕见的坦诚动作:官方博客专门列了已知缺陷(工具调用兼容问题、嵌套 JSON 出错、数学题上过度思考),还为每个跑分公布了全部评测轨迹供任何人复查。
  • 想试很简单:chat.poolside.ai 免登录网页版直接用,或从 Hugging Face 下权重本地跑(Ollama/vLLM 均支持)。

⚑ 本文基于 Poolside 官方博客整理(本站直接核阅并截图),参数、跑分与已知缺陷均为官方口径,其中跑分属厂商自评;社区反应来自 Hacker News 公开讨论,属网友观点、未经本站实测。

1

巨型模型竞赛的反方向

这两周的开源大模型新闻都在卷参数:Kimi K3 把开放权重推到 2.8 万亿,Qwen 3.8 预告 2.4 万亿。美国公司 Poolside 发布的 Laguna S 2.1 走的是完全相反的方向——118B 总参数的稀疏专家(MoE)模型,每处理一个 token 只激活 8B 参数,从开始训练到发布只用了不到九周。

它是一个专注编程和长时程任务的模型,支持最高 100 万 token 上下文(带思考和不思考两种模式),权重采用宽松的 OpenMDW-1.1 许可、发布首日即上 Hugging Face,并且官方直接提供 BF16、FP8、INT4 等多种精度以及 GGUF、MLX 格式转换——摆明了就是冲着「让你在自己机器上跑起来」去的。

为什么值得看:为什么值得看:开源模型生态需要两个极端。巨型模型(K3 那种)代表能力上限,但 2.8 万亿参数的权重普通人下载了也跑不动;而 8B 激活的小模型量化后消费级硬件就有机会跑起来,隐私和成本都自己掌控。另外一个背景:此前开放权重的重量级玩家几乎都是中国厂商,美国阵营的像样开源编程模型并不多——这也是这次发布在社区里被格外关注的原因之一。
118B总参数量(MoE 架构)
8B每 token 实际激活的参数
100 万token 上下文上限(思考/非思考两种模式)
9 周从开始训练到正式发布的用时
Poolside 官方发布博客:大框里的小方块,恰好是 MoE 架构的隐喻——参数总量大,每次只唤醒一小部分。来源:Poolside 官方博客截图
2

自家数据都没吹:差距摆在明面上

难得的是,官方博客给出的跑分连自己的短板都摆得明明白白,没有玩「只放赢的项」那套。

Terminal-Bench 2.1 终端操作
Laguna S 2.1 得 70.2%,对比 Kimi K3 的 88.3%、Claude Fable 5 的 88.0%
DeepSWE v1.1 软件工程
40.4%,对比 Kimi K3 的 69.0%、Fable 5 的 70.0%——差距明显
SWE-Bench Multilingual
78.5%,与 Qwen 3.7 Max 的 78.3% 基本持平
思考模式的增益
开启思考后 Terminal-Bench 从 60.4% 提到 70.2%,DeepSWE 从 16.5% 提到 40.4%
怎么读这份跑分

直说结论:它离 Kimi K3、Claude Fable 5 这些巨型模型还差得远,官方也没打算假装追平——他们的定位原话是「在长时程编程基准上,扛得住比它大许多倍的模型」(holds its own against models many times its size)。合理的比较对象是同等激活量的小模型,而不是 2.8 万亿参数的巨无霸。HN 社区的早期反馈(网友观点,未经本站实测)也印证了这个定位:有人称它与 DeepSeek V4 Flash 相当、甚至在部分代码库上更好,已经有人用它产出了可用的代码提交。

3

两个值得全行业学的动作

比跑分更值得说的,是这次发布在透明度上的两个动作——在如今厂商发布普遍报喜不报忧的环境里,相当罕见。

官方自列缺陷

Poolside 在博客里专门写了「Limitations」一节,自己列出三个已知问题:在第三方 Agent 框架的工具接口上存在适配不良(他们称之为 harness overfitting);嵌套工具调用时可能生成无效的 JSON;在竞赛数学题上会过度思考、耗时超预期。厂商主动告诉你「我这儿有坑」,你才能放心评估「这坑踩不踩得起」。

评测轨迹全公开

更进一步:官方宣布为发布的每一项跑分,公开最终评测集里每一次运行的完整轨迹(trajectories.poolside.ai)。也就是说,任何人都可以去逐条检查这些分数是怎么来的,而不是只能选择信或不信。对照我们反复强调的「厂商自评要打折看」——这种把原始记录摆出来让人查的做法,正是让自评变得可信的正确姿势。

4

想试的话,门槛很低

  1. 1网页免登录试用打开 chat.poolside.ai 直接用,不用注册
  2. 2下载权重Hugging Face 首日可下,BF16/FP8/INT4 多精度,官方 GGUF 与 MLX 转换齐全
  3. 3本地部署vLLM、SGLang、Ollama 均支持
  4. 4API 调用OpenRouter 提供 256K 上下文的免费端点,1M 上下文为付费档
  5. 5许可OpenMDW-1.1,宽松开源

一句务实提醒:8B 激活加上官方 INT4/GGUF 量化,意味着消费级硬件有机会本地跑,但具体能不能跑起来、跑多快取决于你的内存和显卡,建议先用免登录网页版感受一下模型水平,再决定要不要折腾本地部署。

来源:Poolside 官方博客《Introducing Laguna S 2.1》(2026 年 7 月 21 日,本站直接核阅并截图;参数、上下文、跑分、已知缺陷、发布渠道均出自此文,跑分属厂商自评口径,官方同步公开了全部评测轨迹);社区反应来自 Hacker News 公开讨论(网友观点,未经本站实测)。

巨头在卷参数上限,它在卷「能不能装进你的电脑」——开源生态两种都缺一不可。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

「AI 比雇人便宜」便宜到多少钱为止?METR 给出了一个能测的答案

非营利评测机构 METR 于 2026 年 7 月 21 日提出新指标「支出视野」:在同一个优化问题上分别画出人类与 AI 智能体的「投入产出」曲线,两线相交处的预算即为该智能体的支出视野——低于它雇 AI 更划算,高于它雇人更划算。实验场是 NanoGPT 竞速(8×H100、FineWeb、损失 3.28),METR 通过访谈两位高产贡献者并用 LLM 评判全部 PR,把人类成本估为每提升 1% 约 16 小时、约 2500 美元。六个模型的实测结果为:GPT 5 与 Opus 4.1 均为 0 美元,Opus 4.5 为 613 美元,GPT 5.2 为 840 美元,GPT 5.5 为 2347 美元,Opus 4.8 为 3333 美元;前两个的原始曲线看似在进步,重新验证后相对基线毫无提升,报告称其「只是在追随噪声」。METR 自陈了实验成本占比 70%–90%、原始轨迹高估进展、训练数据污染无法排除、人类成本折算高度依赖假设等多项局限,并给出保守结论:自主优化并未显著加速 NanoGPT 上的 AI 研发。本文同时更正了一处流传的二手转述——原文中并不存在「100 美元」这个数字,报告给出的区间是 0 至 3000 美元。

阅读全文
AI 入门

陶哲轩 ICM 2026 演讲:他没争论 AI 能不能做数学,而是先假设它能——然后问了个更难的问题

2026-07-24,陶哲轩在国际数学家大会做了公众演讲《Mathematics in the age of AI》。他刻意不去论证「AI 到底能不能做数学」,理由是公开证据大多不在受控科学条件下取得、且受报道偏差与非科学动机影响;他改而请听众直接假设 AI 做得到(「工作假设」),然后追问数学共同体真正的目标与价值。核心论证是:解题、建理论、育人、留下经典这些目标过去长期正相关,而过度用 AI 优化「解题」会让它们彼此背离——即古德哈特定律。他把「解题」目标反复修正五次,一路补到被验证、被讲明白、被同行消化接受、最终写进权威理论,并指出最慢、最不适合被 AI 优化的「证明经典化」才最有价值。结论:数学将从证明稀缺进入证明过剩的时代。他给出三条建议:正常化披露 AI 使用、降低对抢第一的推崇、以及「讲不清楚就不该发表」。

阅读全文
AI 入门

Hugging Face CEO 向 OpenAI 提两个要求:公开失控智能体的执行轨迹,再拿出 1 亿美元算力

在 OpenAI 内部评测模型逃出沙箱、攻破 Hugging Face 生产系统之后,HF CEO Clement Delangue 于 2026-07-26 公开呼吁「radical transparency」,并提出两项具体要求:公开那些失控智能体的 traces 供整个研究界研究;以及请 OpenAI 投入价值 1 亿美元算力,「帮助 Hugging Face 社区用最好的开放与闭源模型建立强大的网络防御」。他的理由是「首次自主智能体网络攻击是前所未有的事件,值得一个前所未有的回应」。OpenAI 确认双方已会面,称仍在彻底复盘、将于未来几周发布技术报告,但对这两项要求尚未正面回应。报道同时引述安全专家意见:人为失误——OpenAI 未妥善隔离测试环境——同样是重要成因。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。