一分钟速览
- 美国 AI 公司 Poolside 开源了编程模型 Laguna S 2.1:118B 总参数的 MoE 架构、每次只激活 8B,支持 100 万 token 上下文,权重发布当天就上了 Hugging Face。
- 它走的是和 Kimi K3(2.8 万亿)、Qwen 3.8(2.4 万亿)完全相反的路线:不卷参数上限,卷「普通硬件能不能跑」——官方直接提供 GGUF、MLX 等本地格式。
- 官方自家跑分都没吹牛:长时程编程测试上离 Kimi K3 和 Claude Fable 5 还差得远(DeepSWE 40.4% vs 约 70%),定位是「以小博大」,在同体量里能打。
- 两个罕见的坦诚动作:官方博客专门列了已知缺陷(工具调用兼容问题、嵌套 JSON 出错、数学题上过度思考),还为每个跑分公布了全部评测轨迹供任何人复查。
- 想试很简单:chat.poolside.ai 免登录网页版直接用,或从 Hugging Face 下权重本地跑(Ollama/vLLM 均支持)。
⚑ 本文基于 Poolside 官方博客整理(本站直接核阅并截图),参数、跑分与已知缺陷均为官方口径,其中跑分属厂商自评;社区反应来自 Hacker News 公开讨论,属网友观点、未经本站实测。
巨型模型竞赛的反方向
这两周的开源大模型新闻都在卷参数:Kimi K3 把开放权重推到 2.8 万亿,Qwen 3.8 预告 2.4 万亿。美国公司 Poolside 发布的 Laguna S 2.1 走的是完全相反的方向——118B 总参数的稀疏专家(MoE)模型,每处理一个 token 只激活 8B 参数,从开始训练到发布只用了不到九周。
它是一个专注编程和长时程任务的模型,支持最高 100 万 token 上下文(带思考和不思考两种模式),权重采用宽松的 OpenMDW-1.1 许可、发布首日即上 Hugging Face,并且官方直接提供 BF16、FP8、INT4 等多种精度以及 GGUF、MLX 格式转换——摆明了就是冲着「让你在自己机器上跑起来」去的。

自家数据都没吹:差距摆在明面上
难得的是,官方博客给出的跑分连自己的短板都摆得明明白白,没有玩「只放赢的项」那套。
- Terminal-Bench 2.1 终端操作
- Laguna S 2.1 得 70.2%,对比 Kimi K3 的 88.3%、Claude Fable 5 的 88.0%
- DeepSWE v1.1 软件工程
- 40.4%,对比 Kimi K3 的 69.0%、Fable 5 的 70.0%——差距明显
- SWE-Bench Multilingual
- 78.5%,与 Qwen 3.7 Max 的 78.3% 基本持平
- 思考模式的增益
- 开启思考后 Terminal-Bench 从 60.4% 提到 70.2%,DeepSWE 从 16.5% 提到 40.4%
直说结论:它离 Kimi K3、Claude Fable 5 这些巨型模型还差得远,官方也没打算假装追平——他们的定位原话是「在长时程编程基准上,扛得住比它大许多倍的模型」(holds its own against models many times its size)。合理的比较对象是同等激活量的小模型,而不是 2.8 万亿参数的巨无霸。HN 社区的早期反馈(网友观点,未经本站实测)也印证了这个定位:有人称它与 DeepSeek V4 Flash 相当、甚至在部分代码库上更好,已经有人用它产出了可用的代码提交。
两个值得全行业学的动作
比跑分更值得说的,是这次发布在透明度上的两个动作——在如今厂商发布普遍报喜不报忧的环境里,相当罕见。
Poolside 在博客里专门写了「Limitations」一节,自己列出三个已知问题:在第三方 Agent 框架的工具接口上存在适配不良(他们称之为 harness overfitting);嵌套工具调用时可能生成无效的 JSON;在竞赛数学题上会过度思考、耗时超预期。厂商主动告诉你「我这儿有坑」,你才能放心评估「这坑踩不踩得起」。
更进一步:官方宣布为发布的每一项跑分,公开最终评测集里每一次运行的完整轨迹(trajectories.poolside.ai)。也就是说,任何人都可以去逐条检查这些分数是怎么来的,而不是只能选择信或不信。对照我们反复强调的「厂商自评要打折看」——这种把原始记录摆出来让人查的做法,正是让自评变得可信的正确姿势。
想试的话,门槛很低
- 1网页免登录试用打开 chat.poolside.ai 直接用,不用注册
- 2下载权重Hugging Face 首日可下,BF16/FP8/INT4 多精度,官方 GGUF 与 MLX 转换齐全
- 3本地部署vLLM、SGLang、Ollama 均支持
- 4API 调用OpenRouter 提供 256K 上下文的免费端点,1M 上下文为付费档
- 5许可OpenMDW-1.1,宽松开源
一句务实提醒:8B 激活加上官方 INT4/GGUF 量化,意味着消费级硬件有机会本地跑,但具体能不能跑起来、跑多快取决于你的内存和显卡,建议先用免登录网页版感受一下模型水平,再决定要不要折腾本地部署。
来源:Poolside 官方博客《Introducing Laguna S 2.1》(2026 年 7 月 21 日,本站直接核阅并截图;参数、上下文、跑分、已知缺陷、发布渠道均出自此文,跑分属厂商自评口径,官方同步公开了全部评测轨迹);社区反应来自 Hacker News 公开讨论(网友观点,未经本站实测)。
巨头在卷参数上限,它在卷「能不能装进你的电脑」——开源生态两种都缺一不可。


