AI 观点与方法
汇总 AI 使用技巧、实践方法、效率经验、行业观察与专业观点。
分类文章1278
当前页32 / 32
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
观点 / 方法精选
近期三次基础设施故障的事后分析
八月初至九月中旬,Anthropic的三次基础设施漏洞间歇性导致Claude响应质量下降。8月5日,上下文窗口路由错误致使部分Sonnet 4请求被误导向百万token服务器,8月31日高峰时影响16%请求。8月25日,TPU服务器错误配置引发输出损坏,可能在英文回复中生成泰文或中文字符,影响Opus和Sonnet模型。同日部署的代码还触发了编译器漏洞,主要影响Haiku 3.5。所有问题均非需求或负载所致,纯属基础设施漏洞。公司通过回滚部署和修复逻辑于9月18日前全部解决。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
为智能体编写高效工具--与智能体协作
文章探讨如何为基于大语言模型的智能体设计高效工具。核心方法是通过与智能体(如Claude Code)协作,采用快速原型构建和全面评估的迭代流程来优化工具性能。关键设计原则包括:选择适当的工具实现范围,使用命名空间明确功能边界,从工具向智能体返回有意义的上下文,优化响应以提高token效率,以及对工具描述进行提示词工程。工具本质上是确定性系统与非确定性智能体之间的新契约,设计应优先考虑智能体的使用体验,而非传统开发者导向的API思路,以扩大智能体解决实际任务的能力。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
破解LLM推理中的非确定性
LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的"并发+浮点非结合性"假设并不完整--GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LL…
信息来源:Thinking Machines Lab:官方博客(RSS) · ChatGPT
观点 / 方法精选
inclusionAI/UI-Venus
UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
观点 / 方法精选
我们的新 @OpenAI 开放模型
OpenAI 发布两款新的开放模型(open models),官方推文称"Both of them"已上线,详见 openai.com/open-models。
信息来源:X:Noam Brown (@polynoamial) · OpenAI
观点 / 方法精选
物理AI系统的评估是最难的问题:每次调试新的FSD版本都要撞车测试吗?
物理AI评估无法靠实车碰撞测试完成,传统游戏引擎(sim 1.0)也难以覆盖所有边缘情况。基于神经网络的sim 2.0由数据驱动,随车队规模扩展。Tesla已应用多年,用于生成近正面碰撞等罕见危险场景的训练数据,补充800万辆实车难以采集的极端案例。
信息来源:X:Jim Fan (@DrJimFan)
观点 / 方法精选
机器人领域的小型 Moravec's paradox:对人类困难的体操动作反而更容易
机器人领域存在"莫拉维克悖论":后空翻等杂技比做饭、清洁更容易实现。前者可在模拟中训练并零样本迁移,无需感知环境;后者需要真实的视觉、接触物理和物体动力学,难以模拟。这导致外界困惑--机器人能炫技却做不好家务,只因通用灵巧性仍是未解难题。
信息来源:X:Jim Fan (@DrJimFan)
观点 / 方法精选
直到 AI 征服你深爱的领域,才可能真正"感受到 AGI"--每个人都有属于自己的"李世石时刻"
OpenAI 在 IMO 数学竞赛的突破让专业数学家陷入身份危机。作者以"能与狗对话的人发现翻译器在沃尔玛只卖4.99美元"比喻这种独特技能被 AI 商品化的失落感。这种职业终结的悲伤未来数年将蔓延至所有数学家、程序员和知识工作者,甚至让人提前面对生命终结的恐惧。
信息来源:X:Noam Brown (@polynoamial) · OpenAI
观点 / 方法精选
OpenRouter 模型现可在 Cursor 中使用:试试月之暗面 Kimi K2
OpenRouter 宣布其灵活模型路由支持在 Cursor 中运行月之暗面的 Kimi K2。用户可直接在 Cursor 中调用 OpenRouter 路由的模型,无需额外配置。
信息来源:OpenRouter:Announcements(RSS) · Kimi / Cursor
观点 / 方法精选
反对"脑损伤"论
AI 对人类思维的影响具有两面性:既可能成为认知辅助工具,也可能导致思维退化,关键在于具体使用方式与程度。
信息来源:Ethan Mollick:One Useful Thing(RSS)
观点 / 方法精选
一个关于机制(非)忠实性的玩具模型
本文通过"绝对值"玩具模型,揭示了稀疏自动编码器(SAE)和转码器在解释神经网络时可能存在的"机制非忠实性"问题。核心在于,即使转码器能很好地近似模型的输入-输出映射,它也可能采用与原始模型完全不同的内部计算机制。作者特别指出,当训练数据中存在重复数据点时,转码器可能形成专门"记忆"该点的特征电路,而原模型并无此机制。这种机制背离可能导致模型在分布外数据上泛化行为出现差异,从而威胁机械可解释性研究的可信度。文章最后简要讨论了"雅可比匹配"等潜在缓解方法。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
稀疏混合线性变换(MOLT)
稀疏混合线性变换(MOLT)是一种正在开发的新方法,旨在替代Transformer模型中的MLP层,以解决此前"转码器"方法在计算效率和表示忠实性上的局限。与转码器学习稀疏激活的特征向量不同,MOLT学习稀疏激活的线性变换,这些变换直接对残差流进行线性操作以贡献输出,充当纯粹的计算单元。初步实验表明,MOLT比转码器计算效率更高、机制更忠实,其激活条件具有可解释性,有助于理解层间特征的转换过程。该方法与混合解码器架构相关,但采用了低秩矩阵等不同参数化策略。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
通过特征交互追踪注意力计算
研究团队提出"QK归因"方法,将Transformer注意力头的关注模式解释为查询侧与键侧特征激活的双线性函数,并将其整合至原有的归因图中,从而弥补了原有方法忽略注意力计算关键信息的缺陷。案例研究验证了此前在归纳提示、反义词任务等场景中假设的特征交互机制,并发现了如"一致性头"用于合理性检查等新计算模式。该方法实现了对模型前向传播过程更完整的可解释性因果图描述。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
Crosscoder模型差异分析见解
Anthropic可解释性团队在Crosscoder模型差异分析中发现,模型独占特征往往多义性高、激活密集,难以解释。实验表明,这是由于有限特征容量下的竞争:共享特征能同时解释两个模型的激活模式,而独占特征需编码更多信息以证明其存在。团队提出缓解策略,即引入少量指定共享特征并降低其稀疏性惩罚,使独占特征变得更可解释和单义。该方法应用于真实模型时,成功分离出能捕捉模型间行为差异的可解释特征。此外,观察到独占特征激活频率比共享特征高一个数量级,且两模型独占特征数量相近。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
干扰权重的玩具模型研究
本文探讨神经网络中"干扰权重"与"权重叠加"现象,认为这是从特定示例归因分析转向全局电路分析的核心障碍。研究通过在玩具模型中的初步探索得出三点发现:干扰权重可在修改解释的玩具模型中复现,其表现与真实模型相似,分析时通常需滤除;其定义多样,既有原则性定义也有实用启发式方法,可在玩具模型中比较,并有望将计算成本高的原则性定义应用于真实模型少量权重以校准启发式方法;仍需大量玩具模型研究以深入理解。文章还讨论了其对安全的影响:它们可能被对抗性环境利用从而损害模型鲁棒性,但对于对齐问…
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
以全新生成式媒体模型与工具激发创意
发布新一代生成式媒体模型 Veo 3 与 Imagen 4,以及专为电影制作打造的工具 Flow,支持更高质量的视频与图像生成及专业影视创作流程。
信息来源:Google DeepMind:Blog(RSS) · Gemini
观点 / 方法精选
物理图灵测试(Physical Turing Test):周日黑客松后家里一片狼藉,周一晚上回家却发现客厅整洁、烛光晚餐就绪,而你无法分辨这是人还是机器所为
提出"物理图灵测试"作为通用机器人的北极星目标:机器能否像人一样完成物理任务(整理房间、准备晚餐)而不被察觉。这是从自动化比特迈向原子的下一代计算平台。在 Sequoia AI Ascent 演讲,分享第一性原理、数据策略与扩展定律,时长17分钟。
信息来源:X:Jim Fan (@DrJimFan)
观点 / 方法精选
"思考"工具:让Claude在复杂工具使用场景中停下来思考
Anthropic为Claude引入了"思考"工具,允许其在生成最终响应前插入一个专门的思考步骤,以处理多步骤工具调用链、分析外部信息并遵循复杂策略。该工具与更早发布的"扩展思考"功能不同,更侧重于在响应生成过程中对新信息进行针对性推理。在τ-Bench基准测试中,该工具显著提升了Claude在客户服务场景的表现。文章建议在需要复杂工具调用、长链分析或高成本序列决策的场景中使用它,并提供了标准的工具实现格式。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
三点观察
OpenAI 阐述关于 AI 经济学的三点观察:模型智能与训练资源的对数成正比,可预测扩展;AI 使用成本每 12 个月下降约 10 倍,远超摩尔定律速度;智能线性增长将产生超指数级社会经济价值。据此,AI 代理将如虚拟同事般渗透各领域,科学进步将大幅加速,虽然短期内生活照旧,但长期将深刻重塑社会经济结构,个人意志力和适应能力将成为关键价值。
信息来源:Sam Altman:Blog(RSS) · OpenAI
观点 / 方法精选
2025年1月电路更新:稀疏自编码器训练方法改进
Anthropic可解释性团队分享了稀疏自编码器与交叉编码器训练方法的最新改进。主要更新包括采用JumpReLU激活函数、调整损失函数以增强稀疏性并减少"死特征",以及详细的参数初始化与优化设置。团队基于Rajamanoharan等人(2024)的技术,但修改了梯度流动方式和稀疏性惩罚项。关键超参数包括λ_S约10、λ_P为3×10−6,并采用线性预热策略。这些改进旨在为外部研究团队提供一个有效的训练起点,相关成果将在未来几个月内进一步发表。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
反思
Sam Altman在ChatGPT两周年之际回顾OpenAI九年历程:从坚信AGI可能实现,到2022年意外推出ChatGPT并引爆前所未有的增长曲线。他坦承过去两年从零构建公司的混乱压力,以及被董事会突然解雇的危机教训。如今周活用户已达3亿,在迈向AGI的道路上,他既感激这段经历,也承认未来仍充满未知。
信息来源:Sam Altman:Blog(RSS) · OpenAI / ChatGPT
观点 / 方法精选
Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中刷新纪录
升级版 Claude 3.5 Sonnet 在软件工程评估基准 SWE-bench Verified 上取得 49% 的解决率,超越此前最佳模型的 45%。该基准通过真实 GitHub 问题测试 AI 模型完成软件工程任务的能力,要求模型在给定环境中理解、修改并测试代码,最终通过原始单元测试验证。Claude 团队构建的智能体设计简洁,仅包含提示词、Bash 工具和编辑工具,赋予模型充分的自主判断空间,以灵活步骤解决问题。目前尚无模型在该基准上突破 50% 的解决率。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
🦃 At the end of Thanksgiving holidays, I finally finished the piece on reward hacking. Not an easy …
🦃 感恩节假期结束时,我终于完成了关于 reward hacking 的文章。不好写啊,呼。
信息来源:X:Lilian Weng (@lilianweng)
观点 / 方法精选
稀疏交叉编码器:用于跨层特征提取与模型差异比较的新工具
本文介绍了一种新型的稀疏交叉编码器,它能够同时读取和写入神经网络多个层的激活值,从而提取跨层的共享特征。其主要应用包括:解决跨层叠加问题,追踪残差流中的持久特征;通过消除"重复特征"和跨越无意义的连接来简化电路分析;以及为不同训练阶段或不同架构的模型生成共享特征集,以实现模型差异比较。初步实验验证了其在处理跨层叠加和模型比较方面的潜力。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
引入上下文检索:大幅提升RAG系统准确性的新方法
传统RAG系统在编码时易丢失上下文,导致检索失败。新方法"上下文检索"通过"上下文嵌入"和"上下文BM25"两项子技术,在检索前为文本块添加解释性上下文,能将检索失败次数减少49%,结合重排序后降幅可达67%,显著提升了下游任务性能。对于小于20万token的小型知识库,可直接将其完整内容放入提示词,结合Claude的提示词缓存功能,能降低超过2倍的延迟和高达90%的成本。对于大型知识库,上下文检索则提供了可扩展的解决方案。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
电路更新--2024年9月:Anthropic团队探索Transformer模型中的"后继头"机制
Anthropic可解释性团队在2024年9月分享了其初步研究进展,重点探讨了Transformer模型中普遍存在的"后继头"。这些特定的注意力头专门用于处理序数序列(如数字、星期、月份)中的后继关系。研究采用权重检查、独立成分分析等四种互补方法进行识别,其中评分最高的头能将约80%的序数标记最可能地映射到其后继项。分析还揭示了这些头中存在与类别相关的块状结构。团队强调这些发现属于初步成果,预计未来几个月将发表更详细的研究。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
我爱计算器
作者在书店偶遇计算器历史书籍,顿悟自己热爱这种零依赖的技术产品。计算器作为"大脑插件",仅需太阳能或电池即可工作,无需联网、账户或订阅,不收集数据,即买即用且完全私密。这与当下强制更新、订阅制、数据密集型的复杂科技形成鲜明对比。反思资本主义经济下公司追求股东价值最大化导致技术异化,呼吁开发者和消费者追求计算器式的技术理想--简单、独立、真正为用户服务。
信息来源:Andrej Karpathy:Blog(网页)
观点 / 方法精选
2024年7月电路更新:迈向神经网络机制理解的下五个挑战
Anthropic可解释性团队分享了2024年7月的多项研究进展与初步想法,并指出了未来面临的五大核心挑战。这些挑战包括:大量未被提取的"缺失特征"可能构成神经网络的"暗物质";跨层叠加现象使特征难以映射到特定层;注意力叠加可能掩盖了如归纳头等基本单元的真实结构;权重叠加产生的"干扰权重"给电路分析带来混淆;以及如何将微观的电路理解整合为宏观的模型认知。团队认为,尽管在特征叠加等问题上已取得显著进展,但这些新挑战是通往神经网络机制性理解道路上的关键障碍。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
定性研究在可解释性领域中的核心地位反思
本文认为,在可解释性这类尚处前范式阶段的早期科学领域中,定性研究应与定量研究同等重要。成熟学科依赖既定范式和可靠度量,但可解释性研究缺乏这些基础,过度依赖将高维数据简化为单一数字的摘要统计量存在风险,可能沦为"货船崇拜科学"。作者以自身在字典学习中使用tanh正则化的研究为例,说明定性检查如何揭示了摘要统计量的误导性。在假设空间广阔的早期领域,研究目标应是探索值得考虑的假设,这需要更多地依赖定性结果来引导方向,并对定量度量保持审慎。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
After almost a decade, I have made the decision to leave OpenAI. The company's trajectory has been …
经过近十年,我已决定离开 OpenAI。公司的发展轨迹堪称奇迹,我相信 OpenAI 将在 @sama、@gdb、@miramurati 以及现在在 @merettm 出色的研究领导下,打造出既安全又有益的 AGI。能与大家共事是我的荣幸和特权,我会非常想念大家。再见了,感谢一切。我对接下来的事情感到兴奋--一个对我个人非常有意义的项目,我将在适当的时候分享细节。
信息来源:X:Ilya Sutskever (@ilyasut) · OpenAI
观点 / 方法精选
2024年4月机制可解释性研究动态与团队招聘计划
Anthropic可解释性团队分享了2024年4月的研究进展与招聘规划。团队现有17人,预计2024至2025年将持续大规模扩张,重点招聘管理、研究科学家和工程师等职位。研究方面,团队探讨了字典学习的扩展规律,分析了计算资源分配与稀疏自编码器(SAE)训练效果的关系,并以一个具体案例展示了通过大规模超参数扫描寻找最优配置的过程。团队强调,这些成果属于初步分享,类似于实验室会议上的非正式交流。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
真希望有人早告诉我这些
Sam Altman 分享17条创业与管理建议:以乐观、信念和人际网络启动项目,用凝聚团队和长期主义推动落地;集中资源押注高信念项目,设计好激励机制,保持快速迭代;警惕官僚作风,重视人才招聘与复利效应,与优秀的人共事。
信息来源:Sam Altman:Blog(RSS)
观点 / 方法精选
Transformer残差流中的特权基向量
研究发现Transformer模型的残差流中存在"特权基向量"现象,即某些坐标方向持续出现异常大的激活值,这与"无特权基"的理论预期相悖。通过实验,研究者将根源指向Adam优化器中的逐维度归一化器,而非层归一化或浮点精度问题。在2亿参数模型中,典型层有20至60个维度的激活绝对值超过6。研究还提出使用峰度作为检测指标,发现激活分布峰度普遍大于3,进一步证实了基向量对称性被破坏。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
数据不足情况下的学习第二部分:主动学习
监督学习任务的性能依赖于高质量标注数据,但获取大量标注样本成本高昂。主动学习是一种在标注预算有限、但允许投入部分人工标注资源的条件下,应对标注数据不足的范式。其核心思路是智能地选择最具信息量的样本进行标注,以在有限预算内最大化模型性能的提升。该方法旨在解决当面临标注数据受限时,如何通过策略性采样来高效利用标注资源的问题。
信息来源:Lilian Weng:Lil'Log(RSS)
观点 / 方法精选
Transformer电路逆向工程练习题集
本练习集旨在通过动手编写注意力头的具体权重矩阵,从参数层面精确理解Transformer工作机制。内容涵盖:详解注意力头中W_Q、W_K、W_V、W_out矩阵的作用;分析读写子空间的控制矩阵及其乘积意义;探讨如何用两个矩阵等效表示注意力头及其秩的含义;研究跨层注意力头如何通过矩阵运算传递信息。并通过具体数值示例,演示多个"前词注意力头"如何协作实现"查看前两个词"的虚拟功能,以及手动构建实现"归纳头"的"指针算法"步骤。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
观点 / 方法精选
进化策略
进化策略是一种在目标函数解析形式未知或无法直接计算梯度时,用于优化模型参数的黑箱优化算法。它作为随机梯度下降的替代方案,适用于多种优化场景。文章介绍了模拟退火、爬山法、Nelder-Mead方法等经典进化策略,并探讨了该方法在深度强化学习中的应用。通过评估目标函数值而非依赖梯度信息,进化策略为复杂优化问题提供了有效路径。
信息来源:Lilian Weng:Lil'Log(RSS)
观点 / 方法精选
策略梯度算法
该文章系统梳理了策略梯度算法的发展脉络,深入解析其工作原理,并详细介绍了从基础到前沿的多种算法,包括PPO、SAC、TD3、IMPALA等主流方法。文章自2018年起持续更新,陆续新增了D4PG、SVPG、PPG等新算法,并补充了关于PPO的最新讨论。文中还提供了韩语及中文等多个语言版本的翻译,便于不同读者参考。
信息来源:Lilian Weng:Lil'Log(RSS)
观点 / 方法精选
融合
人类与机器的"融合"并非未来奇点,而是已悄然开始数年的渐进过程。智能手机、社交媒体算法和搜索引擎已在控制人类行为与思维,我们正与AI进入共同进化阶段:AI影响人类,人类改进AI。随着算力和AI人才呈双指数级增长,超级智能与脑机接口将比预期更快到来。与其对抗或被淘汰,深度融合或许是避免物种冲突的最佳路径,但全球需立即开始严肃协调应对。
信息来源:Sam Altman:Blog(RSS)