返回文章列表
文章详情AI 入门

Poolside 开源 Laguna S 2.1:118B 参数只激活 8B,连自家跑分都不吹牛

在 Kimi K3、Qwen 3.8 卷万亿参数的另一头,美国公司 Poolside 开源了 8B 激活的编程模型 Laguna S 2.1:家用硬件有机会本地跑、免登录网页可试。官方自家跑分坦承离顶级还差得远,还自列三个已知缺陷、公开全部评测轨迹供人复查——透明度比分数更值得全行业学。

更新于 2026-07-225 分钟4

一分钟速览

  • 美国 AI 公司 Poolside 开源了编程模型 Laguna S 2.1:118B 总参数的 MoE 架构、每次只激活 8B,支持 100 万 token 上下文,权重发布当天就上了 Hugging Face。
  • 它走的是和 Kimi K3(2.8 万亿)、Qwen 3.8(2.4 万亿)完全相反的路线:不卷参数上限,卷「普通硬件能不能跑」——官方直接提供 GGUF、MLX 等本地格式。
  • 官方自家跑分都没吹牛:长时程编程测试上离 Kimi K3 和 Claude Fable 5 还差得远(DeepSWE 40.4% vs 约 70%),定位是「以小博大」,在同体量里能打。
  • 两个罕见的坦诚动作:官方博客专门列了已知缺陷(工具调用兼容问题、嵌套 JSON 出错、数学题上过度思考),还为每个跑分公布了全部评测轨迹供任何人复查。
  • 想试很简单:chat.poolside.ai 免登录网页版直接用,或从 Hugging Face 下权重本地跑(Ollama/vLLM 均支持)。

⚑ 本文基于 Poolside 官方博客整理(本站直接核阅并截图),参数、跑分与已知缺陷均为官方口径,其中跑分属厂商自评;社区反应来自 Hacker News 公开讨论,属网友观点、未经本站实测。

1

巨型模型竞赛的反方向

这两周的开源大模型新闻都在卷参数:Kimi K3 把开放权重推到 2.8 万亿,Qwen 3.8 预告 2.4 万亿。美国公司 Poolside 发布的 Laguna S 2.1 走的是完全相反的方向——118B 总参数的稀疏专家(MoE)模型,每处理一个 token 只激活 8B 参数,从开始训练到发布只用了不到九周。

它是一个专注编程和长时程任务的模型,支持最高 100 万 token 上下文(带思考和不思考两种模式),权重采用宽松的 OpenMDW-1.1 许可、发布首日即上 Hugging Face,并且官方直接提供 BF16、FP8、INT4 等多种精度以及 GGUF、MLX 格式转换——摆明了就是冲着「让你在自己机器上跑起来」去的。

为什么值得看:为什么值得看:开源模型生态需要两个极端。巨型模型(K3 那种)代表能力上限,但 2.8 万亿参数的权重普通人下载了也跑不动;而 8B 激活的小模型量化后消费级硬件就有机会跑起来,隐私和成本都自己掌控。另外一个背景:此前开放权重的重量级玩家几乎都是中国厂商,美国阵营的像样开源编程模型并不多——这也是这次发布在社区里被格外关注的原因之一。
118B总参数量(MoE 架构)
8B每 token 实际激活的参数
100 万token 上下文上限(思考/非思考两种模式)
9 周从开始训练到正式发布的用时
Poolside 官方发布博客:大框里的小方块,恰好是 MoE 架构的隐喻——参数总量大,每次只唤醒一小部分。来源:Poolside 官方博客截图
2

自家数据都没吹:差距摆在明面上

难得的是,官方博客给出的跑分连自己的短板都摆得明明白白,没有玩「只放赢的项」那套。

Terminal-Bench 2.1 终端操作
Laguna S 2.1 得 70.2%,对比 Kimi K3 的 88.3%、Claude Fable 5 的 88.0%
DeepSWE v1.1 软件工程
40.4%,对比 Kimi K3 的 69.0%、Fable 5 的 70.0%——差距明显
SWE-Bench Multilingual
78.5%,与 Qwen 3.7 Max 的 78.3% 基本持平
思考模式的增益
开启思考后 Terminal-Bench 从 60.4% 提到 70.2%,DeepSWE 从 16.5% 提到 40.4%
怎么读这份跑分

直说结论:它离 Kimi K3、Claude Fable 5 这些巨型模型还差得远,官方也没打算假装追平——他们的定位原话是「在长时程编程基准上,扛得住比它大许多倍的模型」(holds its own against models many times its size)。合理的比较对象是同等激活量的小模型,而不是 2.8 万亿参数的巨无霸。HN 社区的早期反馈(网友观点,未经本站实测)也印证了这个定位:有人称它与 DeepSeek V4 Flash 相当、甚至在部分代码库上更好,已经有人用它产出了可用的代码提交。

3

两个值得全行业学的动作

比跑分更值得说的,是这次发布在透明度上的两个动作——在如今厂商发布普遍报喜不报忧的环境里,相当罕见。

官方自列缺陷

Poolside 在博客里专门写了「Limitations」一节,自己列出三个已知问题:在第三方 Agent 框架的工具接口上存在适配不良(他们称之为 harness overfitting);嵌套工具调用时可能生成无效的 JSON;在竞赛数学题上会过度思考、耗时超预期。厂商主动告诉你「我这儿有坑」,你才能放心评估「这坑踩不踩得起」。

评测轨迹全公开

更进一步:官方宣布为发布的每一项跑分,公开最终评测集里每一次运行的完整轨迹(trajectories.poolside.ai)。也就是说,任何人都可以去逐条检查这些分数是怎么来的,而不是只能选择信或不信。对照我们反复强调的「厂商自评要打折看」——这种把原始记录摆出来让人查的做法,正是让自评变得可信的正确姿势。

4

想试的话,门槛很低

  1. 1网页免登录试用打开 chat.poolside.ai 直接用,不用注册
  2. 2下载权重Hugging Face 首日可下,BF16/FP8/INT4 多精度,官方 GGUF 与 MLX 转换齐全
  3. 3本地部署vLLM、SGLang、Ollama 均支持
  4. 4API 调用OpenRouter 提供 256K 上下文的免费端点,1M 上下文为付费档
  5. 5许可OpenMDW-1.1,宽松开源

一句务实提醒:8B 激活加上官方 INT4/GGUF 量化,意味着消费级硬件有机会本地跑,但具体能不能跑起来、跑多快取决于你的内存和显卡,建议先用免登录网页版感受一下模型水平,再决定要不要折腾本地部署。

来源:Poolside 官方博客《Introducing Laguna S 2.1》(2026 年 7 月 21 日,本站直接核阅并截图;参数、上下文、跑分、已知缺陷、发布渠道均出自此文,跑分属厂商自评口径,官方同步公开了全部评测轨迹);社区反应来自 Hacker News 公开讨论(网友观点,未经本站实测)。

巨头在卷参数上限,它在卷「能不能装进你的电脑」——开源生态两种都缺一不可。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

ChatGPT 开始卖广告了:三条官方承诺,和一个值得你警惕的定向逻辑

OpenAI 正式上线广告官网:广告主可自助在 ChatGPT 投放,官方承诺清晰标注、与回答分离、数据可控,首批广告主含 Best Buy 等三家。但关键在定向逻辑——官方明说要用「对话里更丰富的上下文」做个性化广告,你跟 AI 聊的内容就是定向依据。社区担心承诺随时间松动。附三条普通用户实用建议。

阅读全文
AI 入门

AI 推翻悬置 87 年的雅可比猜想:3 个变量、7 次多项式,陶哲轩亲自撰文解读

1939 年正式提出的雅可比猜想上周被推翻——反例由 Anthropic 的 Claude Fable 模型找到,只有 3 个变量、7 次多项式(社区此前预期要 200 次上下)。验证人人能懂:行列式恒为 -2、三个不同点撞到同一输出。陶哲轩撰文拆解并坦承自己也用 AI 核对计算。二维情形仍未决,但这是 AI 产生真正新数学知识的标志性一刻。

阅读全文
AI 入门

Google 一次发三个 Gemini:3.6 Flash 更强、Flash-Lite 更便宜、Flash Cyber 你用不了

Google 同时发布 Gemini 3.6 Flash(主力、更聪明、$1.5/$7.5)、3.5 Flash-Lite(便宜快跑、$0.3/$2.5、350 token/秒)和 3.5 Flash Cyber(安全特化,但仅限政府与可信合作伙伴)。官方跑分显示 3.6 Flash 全面超上代。附冷静提醒:跑分是自评口径、命名混乱、社区吐槽涨价与老模型弃用。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。