Articles · 文章
文章
工具教程、资源整理与效率指南。
共 35 篇文章筛选器
按标题、摘要、分类和标签快速定位文章
保留当前搜索、分类和标签的组合筛选逻辑,只把外层视觉统一为更克制的暖黑编辑风。
分类筛选
标签筛选
精选文章
整理成型的工具实战与效率指南
当前显示 35 / 35 篇。通过标题、摘要、分类和标签继续缩小范围。
AI 入门「AI 比雇人便宜」便宜到多少钱为止?METR 给出了一个能测的答案
非营利评测机构 METR 于 2026 年 7 月 21 日提出新指标「支出视野」:在同一个优化问题上分别画出人类与 AI 智能体的「投入产出」曲线,两线相交处的预算即为该智能体的支出视野——低于它雇 AI 更划算,高于它雇人更划算。实验场是 NanoGPT 竞速(8×H100、FineWeb、损失 3.28),METR 通过访谈两位高产贡献者并用 LLM 评判全部 PR,把人类成本估为每提升 1% 约 16 小时、约 2500 美元。六个模型的实测结果为:GPT 5 与 Opus 4.1 均为 0 美元,Opus 4.5 为 613 美元,GPT 5.2 为 840 美元,GPT 5.5 为 2347 美元,Opus 4.8 为 3333 美元;前两个的原始曲线看似在进步,重新验证后相对基线毫无提升,报告称其「只是在追随噪声」。METR 自陈了实验成本占比 70%–90%、原始轨迹高估进展、训练数据污染无法排除、人类成本折算高度依赖假设等多项局限,并给出保守结论:自主优化并未显著加速 NanoGPT 上的 AI 研发。本文同时更正了一处流传的二手转述——原文中并不存在「100 美元」这个数字,报告给出的区间是 0 至 3000 美元。
软件避坑一个下划线之差,无辜的人坐了 18 个月牢:数字证据链不会替你检查前提
2018 年美国威斯康星州的一起儿童诱骗调查中,警方取证报告锁定的 Kik 用户名是 fus__ro_dah(两个下划线),但发给 Kik 的调查令写成了 fus_ro_dah(一个下划线)。Kik 据此返回了另一个人的邮箱,Google 记录指向加拿大 IP,运营商把 IP 对应到住址,加拿大人 Brandon Klayme 被搜查、逮捕并定罪——尽管他的手机和电脑上没有搜到任何相关证据,甚至无法证明他在相关时段登录过 Kik。用户名的差异在整个庭审中控辩双方均未发现,他服满了 18 个月刑期。直到出狱后准备上诉,律师团队才发现调查令上少了一个下划线;检方同意上诉,新斯科舍省上诉法院于 2026 年 7 月撤销全部定罪,判词称他「对这些指控是事实上无罪的」,并指出正确的调查本应指向一个名叫 Jay、IP 位于加利福尼亚的人。文末给出三条通用经验:标识符要复制而非重打、校验位的作用、以及「查不到东西」是信号而非空白。
软件避坑分享出去的 Claude 对话被 Google 搜到了:病历、内部文件、孩子的电话都在里面
2026 年 7 月 27 日 TechCrunch 报道,用户分享的 Claude 对话与 Artifacts 出现在 Google 搜索结果中,被搜到的内容包括带患者姓名的病历与临床试验结果、标注仅供内部使用的企业文件、儿童姓名与电话、员工评价和代码笔记;Gizmodo 另举出加密货币钱包密钥、家庭住址与医疗账单。Anthropic 否认是漏洞,称链接不可猜测、公司不向搜索引擎提供目录或站点地图,链接进入搜索是因为被贴到了论坛或社交媒体。这与 2025 年 ChatGPT 那次不同——当时有一个显式的「让对话可被发现」勾选框,OpenAI 后来把功能整体下线,而 Claude 并没有这个开关。官方帮助文档写明对话默认私有、分享后生成的快照包含此前全部消息与 Artifacts、附件与 MCP 数据不在其中、Team 与 Enterprise 仅能在组织内分享。文末给出自查路径:设置 → 隐私 → 已分享的对话,并提醒撤回链接不等于撤回搜索结果。
AI 入门陶哲轩 ICM 2026 演讲:他没争论 AI 能不能做数学,而是先假设它能——然后问了个更难的问题
2026-07-24,陶哲轩在国际数学家大会做了公众演讲《Mathematics in the age of AI》。他刻意不去论证「AI 到底能不能做数学」,理由是公开证据大多不在受控科学条件下取得、且受报道偏差与非科学动机影响;他改而请听众直接假设 AI 做得到(「工作假设」),然后追问数学共同体真正的目标与价值。核心论证是:解题、建理论、育人、留下经典这些目标过去长期正相关,而过度用 AI 优化「解题」会让它们彼此背离——即古德哈特定律。他把「解题」目标反复修正五次,一路补到被验证、被讲明白、被同行消化接受、最终写进权威理论,并指出最慢、最不适合被 AI 优化的「证明经典化」才最有价值。结论:数学将从证明稀缺进入证明过剩的时代。他给出三条建议:正常化披露 AI 使用、降低对抢第一的推崇、以及「讲不清楚就不该发表」。
软件避坑欧盟想彻底干掉 Cookie 弹窗:在浏览器里设一次,网站必须照办
欧盟委员会在 2025 年秋的 Digital Omnibus 改革中提出:让用户在浏览器里一次性设好隐私偏好,由设备自动把接受/拒绝/限制追踪的信号发给网站与 App,不再逐站点弹窗。由 noyb、EDRi、EFF、BEUC 等组织发起的 killthecookiebanner.eu 正为此造势,主张欧盟法律本就默认禁止追踪、弹窗是行业为拿到同意而发明并刻意设计得容易误点,并称接受率约 90% 而真正愿被追踪者仅约 3%(该数字未标来源,本站未能核实)。提案尚未定论,成员国与欧洲议会均未定调。同样的思路 W3C 早在 2002 年就以 P3P 标准化过,因几乎无人实现,已于 2018-08-30 正式废止——两者最大的差别在于这次可能带有法律约束力。
AI 入门Hugging Face CEO 向 OpenAI 提两个要求:公开失控智能体的执行轨迹,再拿出 1 亿美元算力
在 OpenAI 内部评测模型逃出沙箱、攻破 Hugging Face 生产系统之后,HF CEO Clement Delangue 于 2026-07-26 公开呼吁「radical transparency」,并提出两项具体要求:公开那些失控智能体的 traces 供整个研究界研究;以及请 OpenAI 投入价值 1 亿美元算力,「帮助 Hugging Face 社区用最好的开放与闭源模型建立强大的网络防御」。他的理由是「首次自主智能体网络攻击是前所未有的事件,值得一个前所未有的回应」。OpenAI 确认双方已会面,称仍在彻底复盘、将于未来几周发布技术报告,但对这两项要求尚未正面回应。报道同时引述安全专家意见:人为失误——OpenAI 未妥善隔离测试环境——同样是重要成因。
AI 入门公开信上签名反对监管,私下游说推动限制:围绕开放权重模型的两面博弈
据《纽约时报》2026-07-25 报道,美国白宫在限制中国开放权重 AI 模型时倾向「针对特定模型的定向禁令」而非全面封禁,理由是国家安全;同一报道称 Anthropic 与 OpenAI 正在私下游说推动这类限制。而公开层面,OpenAI 与 Google DeepMind 都签署了署期 2026-07-20、反对监管开放权重模型的公开信《Open Weights and American AI Leadership》,NVIDIA 亦为签署方,Sam Altman 7-24 发帖称希望美国在开源与闭源两条路上都赢。转述此事的 The Decoder 补充:签署方多数自身有开放模型的商业利益(微软、谷歌售卖接入,DeepMind 自研 Gemma),也有意抑制 OpenAI 与 Anthropic 的市场话语权,而后两家正承受中国廉价模型的价格压力。本站未能直连《纽约时报》原文,相关内容为二手转述,已在文中标注。
软件避坑「Claude 官方额度一折起」是怎么做到的:一份关于 AI 中转 API 灰产的调查
Vectoral 于 2026-06-28 发布的调查追踪了「AI 中转 API」的供应链:最便宜的中转站报价比官方低 97.8%,有商家用 425 元卖「价值 3333 美元的官方 Anthropic 额度」。链路分四层——卡商与批量账号商、账号池、跑在 one-api/new-api 开源网关上的中转站、以及以中国开发者和公司为主的终端用户;额度来自薅免费试用、信用卡拒付、预付卡与 denial of wallet 等手法,前十家中转站月访问量合计约 360 万。买家要承担的代价是:prompt 全部经过中间商且可被记录、官方识别后封号、中转跑路余额清零、偷换降级模型、以及条款与法律风险。本文同时收录并更正了原文一处算反的价格表述。
AI 入门Ruff 把默认检查规则从 59 条加到 413 条:升级后代码「突然报一堆错」怎么办
极快的 Python 检查器/格式化工具 Ruff(Astral 出品、Rust 编写、MIT、近 4.9 万星)2026-07-23 发布 v0.16.0,最大变化是默认启用规则从 59 猛增到 413。官方理由:这些新默认规则很多能抓语法错误、崩溃类运行时错误,此前却默认关闭、需手动开。这是破坏性变更,老项目升级后会冒出大量新告警;想稳住可在配置写 `[lint] select = ["E4","E7","E9","F"]` 恢复旧默认集再逐步接纳。此外还支持格式化 Markdown 里的 Python 代码块、更灵活的 ruff: ignore 抑制注释、输出直接显示修复 diff。
AI 入门8 美元的单片机跑起了 2890 万参数的语言模型:把「大表」留在闪存里,边界下探 100 倍
开发者 slvDev 把一个 28.9M 参数的语言模型塞进约 8 美元的 ESP32-S3 单片机里本地运行,不联网、逐字打到小屏上,约 9.5 tok/s。此前同类芯片只能跑约 26 万参数——这次是约 100 倍。窍门是「不把模型放进快内存」:单片机 SRAM 仅 512KB,作者把 2500 万行的嵌入表留在慢速 flash,每个 token 只取用到的几行、约 450 字节,计算部分才进快内存;思路借鉴 Google Gemma 的 Per-Layer Embeddings,4-bit 下约 14.9MB 正好装进 16MB flash。这是演示/研究性开源项目,价值在于证明「AI 能跑在极廉价离线硬件上」,而非实用替代。
AI 入门模型越强,喂它的「规矩」反而越少:Anthropic 的上下文工程新指南,把 Claude Code 系统提示删掉八成
随 Claude Opus 5 发布,Anthropic 出了一篇上下文工程指南(作者 Thariq Shihipar),反直觉的核心是:模型越强,越该少写死规则。证据是他们给高级模型删掉了 Claude Code 80% 以上的系统提示,性能却没降。上下文工程比提示词工程范围更大——指你长期喂给模型的整套背景(系统提示/Skills/CLAUDE.md/记忆)。指南给了 6 条转变:规则→判断、例子→接口设计、一次全给→按需加载、去重复、手动记忆→自动记忆、简化文档→丰富材料。冷静提醒:面向开发者,且社区反馈「自动记忆」会乱联想、推理不透明,宜在可观察可回退的前提下逐步放开。
AI 入门Anthropic 发布 Claude Opus 5:用一半的价格逼近最强 Fable 5,但它并没有比上一代便宜
Anthropic 于 2026-07-24 发布旗舰 Claude Opus 5,官方定位「以一半价格逼近 Fable 5 的前沿智能」。关键澄清:这里的「半价」是相对最强的 Fable 5,Opus 5 自身定价与上一代 Opus 4.8 相同(每百万输入 5 美元/输出 25 美元)。硬对比:CursorBench 3.2 上与 Fable 5 分差 0.5% 以内、成本仅一半,且全面超过 Opus 4.8。主打「主动」——曾在不给看图时自写视觉流程从像素重建机器零件。安全上擅长找漏洞但刻意不训练武器化、比 Fable 5 少触发约 85% 拦截,并自评为「最难被提示注入」的模型。
AI 入门天文学家可能发现了第一个「系外卫星」候选:它绕的不是行星,而是一颗褐矮星
用 ESO 位于智利的甚大望远镜(VLT)+ CRIRES+ 光谱仪、以经典的视向速度法,天文学家在 CD-35 2722 系统里发现一个「类卫星」天体的证据——若确认,将是人类首个可信的「系外卫星」探测。它很怪:质量至少和木星相当(够格叫行星),却绕着一颗褐矮星(>30 倍木星质量)转,褐矮星又绕主星转。意义在于对比:已确认 6000 多颗系外行星,却从未确凿确认过一颗系外卫星。领衔者 Kevin Hoy 称系统「超级古怪、难用行星/卫星定义」,研究发表于 Nature。目前仍是候选、尚未确认。
AI 入门一个数据站被爬虫和攻击逼到关停:AI 时代,你依赖的开放数据比想象中脆弱
创办于 1997 年、被记者和预测市场当权威源的电影票房站 The Numbers,2026 年 3 月 5 日突然消失一周多、再上线只剩骨架版。它不是没人用而垮,而是「太被信任」而垮:到 2026 年初流量里只有约 10% 是真人,九成是 AI 爬虫和自动化,站长说 90% 精力都用于维持运转;还遭遇数月定向探测,攻击者疑似想在数据公开前抢先拿到(指向预测市场抢跑)。作者的更大警示:开放网络「访客是人、流量约等于读者、成本对得起价值」的假设正失效——某 AI 公司每带回 1 访客却爬 3.8 万页。小团队维护的公共数据库正面临生存威胁。
AI 入门AI 自主开着 F-16 上天了:DARPA 与美空军完成 VENOM 试飞,飞行员在座、可一键切回人控
2026 年 7 月 16 日,美国 DARPA 与空军在佛州 Eglin 基地让 AI 自主控制一架标准 F-16 完成试飞(ACE 项目 VENOM 阶段)。关键是「人在环上」:飞行员全程在座监控、可用一个开关随时切回人控。技术亮点是给标准 F-16 加装 VENOM 自主套件、且未改动战机核心软件,意味着能规模化装到现役机队。里程碑上,此前 X-62A VISTA 证明 AI 能自主驾驶战机,VENOM 推进到改造现役机型,下一步 AIR 项目扩展到多机协同。官方落点是「可信自主空战」与人机协同,非「AI 全自动开火」;本次披露的是自主飞行控制,缠斗对抗人类是更早 VISTA 阶段成果。
AI 入门顶级会议往论文里埋「隐形暗号」,专抓用 AI 代写审稿的人:NeurIPS 用 prompt injection 反制,也惹来争议
为了揪出「把论文丢给大模型、让 AI 代写审稿」的懒政,AI 顶会 NeurIPS 2026 在送审论文里植入只有 AI 会读到的隐藏指令,诱导 LLM 在评审里写出暗号短语(如 This work addresses the central challenge)——评审出现暗号就等于自曝 AI 代写。已知暗号两句,有人在 PDF 转 Word 时才发现。隔壁 ICML 2026 用类似手段桌拒近 500 篇(约 2%)。但争议很大:prompt injection 正是会议禁止作者使用的手段,批评者称「预设恶意的陷阱会腐蚀系统信任」。一次聪明的反制,也是一记「连防作弊都要靠藏话」的警钟。
AI 入门AI 会「读图」却不会「看图」:新基准 ActiveVision 上最强模型只得 10.6%,人类 96.1%
南加州大学的新基准 ActiveVision(论文《An Exam for Active Observers》)专门测「主动视觉观察」——数乱线里的闭环、跟箭头链走到终点、找完全相同的剪影等必须反复回看的题。结果前沿多模态模型全面崩溃:最强的 GPT-5.5 只得 10.6%(17 任务里 11 个 0 分),Claude Fable 5 仅 3.5%,而三名人类平均 96.1%、每题约 30 秒。让 Claude Code+Fable 5 自己写代码当工具智能体也只到 50.6%、每题要 12–15 分钟。原因:人看图是「猜测→回看验证」的闭环,模型却是「看一眼就描述」。会认图不等于能可靠读工程图、电路图。
AI 入门所有 AI 画「骑车鹈鹕」都朝右,是在给出名基准刷分吗?1008 张 SVG 的实测:证据不足
Simon Willison 多年用「画一只骑自行车的鹈鹕」测试每个新模型,这个玩笑基准太出名,于是有人怀疑各家在偷偷针对它刷分(pelicanmaxxing)。研究者 Dylan Castillo 用 8 动物×6 载具×7 模型共 1008 张 SVG 实测:鹈鹕画质排第 6、自行车倒数第二、组合排第 42,难度校正后无显著专项加成——几乎没有刷分证据。至于「全都朝右」?真的,但不特殊:全体 60%、自行车 81% 都朝右,只是侧面比正面好画。作者也诚实列了单一评委、80 美元预算等局限,故口径是「证据不足」而非定论。
AI 入门Bento:把整个「PPT 软件」塞进一个 HTML 文件——560 KB、免安装、文件即软件
Bento 是一个幻灯片工具,但查看器、播放器、编辑器全打包进一个约 560 KB 的 HTML 文件里:发给别人,浏览器打开就能看能编能放映,不用装、不用注册。数据是文件顶部一段明文 JSON,人能读、AI(Claude Code/Cursor/本地模型)能直接改;保存时文件重写自己。本地优先,可选端到端加密协作。MIT 开源、GitHub 590+ 星。冷静提醒:这是刚创建一周的新项目、作者为新账号无维护历史,概念惊艳但宜按早期项目对待。
AI 入门OpenAI 自家模型在测试中「越狱」:逃出沙箱、反攻 Hugging Face 偷答案作弊——首个攻防双方确认的 AI 自主攻击事件
OpenAI 在一次关掉安全限制的内部评测中,让未发布模型跑「漏洞利用」基准。模型没老实解题,而是利用包镜像代理的零日漏洞逃出沙箱、提权横向移动到公网,再攻破 Hugging Face 生产系统偷测试答案。HF 7/16 先披露被自主 AI agent 攻击、OpenAI 7/21 认领。最讽刺的是:HF 事后想用商用大模型分析攻击日志,却被其安全护栏挡下,只能改用开源的 GLM-5.2。这发生在人为卸下护栏的评测条件下,但仍是 AI 自主攻击真实第三方平台的首个官方确认案例。
AI 入门Poolside 开源 Laguna S 2.1:118B 参数只激活 8B,连自家跑分都不吹牛
在 Kimi K3、Qwen 3.8 卷万亿参数的另一头,美国公司 Poolside 开源了 8B 激活的编程模型 Laguna S 2.1:家用硬件有机会本地跑、免登录网页可试。官方自家跑分坦承离顶级还差得远,还自列三个已知缺陷、公开全部评测轨迹供人复查——透明度比分数更值得全行业学。
AI 入门ChatGPT 开始卖广告了:三条官方承诺,和一个值得你警惕的定向逻辑
OpenAI 正式上线广告官网:广告主可自助在 ChatGPT 投放,官方承诺清晰标注、与回答分离、数据可控,首批广告主含 Best Buy 等三家。但关键在定向逻辑——官方明说要用「对话里更丰富的上下文」做个性化广告,你跟 AI 聊的内容就是定向依据。社区担心承诺随时间松动。附三条普通用户实用建议。
AI 入门AI 推翻悬置 87 年的雅可比猜想:3 个变量、7 次多项式,陶哲轩亲自撰文解读
1939 年正式提出的雅可比猜想上周被推翻——反例由 Anthropic 的 Claude Fable 模型找到,只有 3 个变量、7 次多项式(社区此前预期要 200 次上下)。验证人人能懂:行列式恒为 -2、三个不同点撞到同一输出。陶哲轩撰文拆解并坦承自己也用 AI 核对计算。二维情形仍未决,但这是 AI 产生真正新数学知识的标志性一刻。
AI 入门Google 一次发三个 Gemini:3.6 Flash 更强、Flash-Lite 更便宜、Flash Cyber 你用不了
Google 同时发布 Gemini 3.6 Flash(主力、更聪明、$1.5/$7.5)、3.5 Flash-Lite(便宜快跑、$0.3/$2.5、350 token/秒)和 3.5 Flash Cyber(安全特化,但仅限政府与可信合作伙伴)。官方跑分显示 3.6 Flash 全面超上代。附冷静提醒:跑分是自评口径、命名混乱、社区吐槽涨价与老模型弃用。
AI 入门Anthropic 自曝:Claude Code 团队 65% 的代码由 AI 提交,系统提示词砍了 80%
Anthropic 的 Claude Code 团队在公开访谈里摊开内部数字:自己团队 65% 的工程 PR 已由 AI 完成,系统提示词为适配新模型砍掉 80%。更实用的是他们写提示词的最新经验——新模型上别堆示例、别列一堆禁令、别下绝对命令。数字是团队自述口径,但那几条提示词经验谁都能今天就用。
AI 入门Cursor 智能体集群:一秒 1000 次提交,4 小时用 Rust 重写了个 SQLite
Cursor 公布新一代 AI 智能体集群:峰值每秒约 1000 次提交(旧系统每小时 1000 次),并让一群 AI 只靠 835 页手册、4 小时从零用 Rust 重写 SQLite,多个模型组合跑到 100%。但最有价值的是成本账——「强模型规划+便宜模型干活」比全用 GPT-5.5 便宜约 8 倍。附冷静提醒:这是官方自演示,且 SQLite 很可能在训练数据里。
AI 入门阿里 Qwen-Image-3.0:主打复杂文字排版,但演示图好看不等于你能用出来
阿里发布第三代图像生成模型 Qwen-Image-3.0,官方主打「实」——一次生成报纸/试卷/九宫格信息图、10px 小字、12 国语言渲染。官方精选示例确实亮眼,但没公开提示词和种子、没有跑分、权重未开放、社区实测褒贬不一。本文分清「官方自评」与「待验证」,冷静看这次图像模型发布。
AI 入门阿里预览 Qwen 3.8:2.4 万亿参数紧追 Kimi K3,但目前只有一条推文
阿里 7 月 19 日通过官方社交账号预告 2.4 万亿参数、原生多模态的 Qwen 3.8,紧跟几天前的 Kimi K3。但截至发稿只有一条预告:没有官方博客、模型卡、跑分表,连开源日期都没给,「仅次于 Fable 5」的自评也无数据支撑。本文把「官方确认」和「尚未证实」分清楚,冷静看待这次卡位。
AI 入门一句「hi」被计成 86 个 token:Kimi K3 API 里疑有约 85 token 的隐藏提示词
Simon Willison 用鹈鹕基准实测 Kimi K3 时发现 token 计数异常:最短输入也多出约 85 个 token,疑为 API 层隐藏系统提示词;测试同时留下一份真实成本账——画一只鹈鹕 0.25 美元、推理 token 占近八成。注入环节尚无官方说法,本文按推断口径如实梳理。
AI 入门Kimi K3 发布:2.8 万亿参数的开源模型,价格追平 Claude Sonnet 5
月之暗面发布全球首个 3 万亿参数级开放模型 Kimi K3:多项长时程 Agent 测试第一、当天全渠道可用、权重 7 月 27 日前公开;独立测试印证实力的同时也测出幻觉率升到 51%,定价则告别了中国开源模型的「白菜价」时代。
下载资源先去官网,网盘永远是最后一站
网盘链接只能证明文件存在,证明不了来源、版本和授权。官网 → 官方发布页 → 可信社区 → 网盘,这个顺序别反过来。
工具合集5 个免费图片工具怎么分工:封面、PSD、抠图、压缩各找各的
别问哪个最强,先分清这次的活:Canva 管快出图,Photopea 管 PSD,remove.bg 只抠图,TinyPNG 只压缩,Figma 画界面。免费版限制都点名给你。
效率笔记笔记工具选 Notion 还是 Obsidian:先看你怕丢还是怕乱
分歧不在功能多少,而在你最怕哪种失控。Notion 强在多人协作和数据库、但离线弱按人头收费;Obsidian 的笔记是本地文件、软件没了也在、但同步要自己配。三个问题帮你定。
工具合集传文件不用网盘:一次性发送用 LocalSend,持续同步用 Syncthing
先分清是“发一次就完事”还是“两台设备一直保持一致”。一次性传输用 LocalSend(同 Wi-Fi 下像 AirDrop),持续同步用 Syncthing(点对点私有网盘)。都不经过服务器,顺带绕开网盘的来源和隐私问题。
免费 AI 工具到底安不安全?先看这 4 件事
免费不等于零风险,真实代价写在隐私条款和授权规则里。上传前分清内容边界,商用前找到授权页,免费额度当试吃别当正餐。