AI 观点与方法
汇总 AI 使用技巧、实践方法、效率经验、行业观察与专业观点。
分类文章1278
当前页30 / 32
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
观点 / 方法精选
为什么 SWE-bench Verified 不再衡量前沿编码能力
OpenAI宣布停止使用SWE-bench Verified基准评估前沿编码能力。该基准基于GitHub历史问题构建,其任务分布已无法准确反映当前AI编码助手需解决的实际问题类型。随着模型性能提升,基准测试集趋于饱和,区分度下降,现有模型表现已接近人类水平。因此,团队将转向更具挑战性和现实复杂度的新评估方法。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · OpenAI
观点 / 方法精选
无闲置GPU:Runway的研究计算管理
Runway通过采用Kueue作为Kubernetes准入控制器,将GPU利用率提升超过20%,同时保障团队容量。其核心机制是为关键工作预留配额,并设立共享队列借用闲置容量,当配额所有者需要时通过抢占回收资源。该系统运行于昂贵的多租户GPU集群,支持多节点训练的拓扑感知调度和弹性工作负载。具体实现中,团队拥有专用预留队列,而默认队列作为共享机会池,可借用闲置配额运行可中断工作负载。当预留队列需资源时,Kueue基于优先级和运行时间抢占默认队列中的任务,实现资源高效管理。
信息来源:Runway:News(网页)
观点 / 方法精选
OpenRouter Agent SDK 发布 `create-agent-tui` 与 `create-headless-agent` 技能,可快速搭建个性化编码智能体
OpenRouter Agent SDK 推出 `create-agent-tui` 和 `create-headless-agent` 两类技能(skills),用于快速搭建(scaffold)个性化编码智能体。前者提供终端 UI(terminal UI),后者为无头模式(headless),适用于脚本和流水线(scripts and pipelines)。
信息来源:OpenRouter:Announcements(RSS)
观点 / 方法精选
通过半官方Codex后门API为GPT-5.5生成"骑自行车的鹈鹕"
尽管GPT-5.5的官方API尚未发布,但作者利用OpenAI为OpenClaw等工具开放的订阅集成机制,通过反向工程开源Codex CLI,开发了一个LLM插件。该插件允许付费订阅用户通过Codex后端API调用GPT-5.5模型。文章以生成"骑自行车的鹈鹕"SVG图像为例,展示了其使用效果,并指出高推理强度设置能显著提升输出质量,但耗时更长。目前,OpenAI表示正与合作伙伴制定API大规模服务的安全要求。
信息来源:Simon Willison 博客 · OpenAI / GPT
观点 / 方法精选
关于近期 Claude Code 质量报告的更新说明
Anthropic 确认并解决了过去一个月影响 Claude Code、Claude Agent SDK 和 Claude Cowork 的三个问题,所有问题已于 4 月 20 日修复。具体包括:3月4日将 Claude Code 的默认推理强度从"高"改为"中",导致用户感知智能下降,已于4月7日回滚;3月26日一项缓存优化存在缺陷,导致会话恢复后模型"健忘"和重复,4月10日修复;4月16日一项旨在减少冗余的系统提示指令意外损害了代码质量,4月20日撤销。这些问题影响了…
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
请不要相信你的聊天机器人提供的医疗建议
四项独立研究一致表明,不应信任聊天机器人提供的医疗建议。这些研究均指向同一结论,显示AI对话系统在医疗咨询场景中存在显著的可靠性缺陷与安全隐患,可能给出不准确甚至危险的健康指导。专家强烈警告用户避免依赖ChatGPT等工具进行疾病诊断或用药决策,强调寻求专业医疗人员帮助的必要性。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS) · ChatGPT
观点 / 方法精选
保持 Cursor 应用稳定
Cursor 团队针对用户全天依赖应用、崩溃影响严重的问题,聚焦内存不足导致的崩溃。通过为多进程架构设计细粒度监控系统,实时追踪版本发布后的崩溃指标。采用双重调试策略:自上而下关联功能与崩溃数据,监控大消息负载;自下而上通过崩溃观察服务、堆快照等定位根本原因。自2月底以来,全版本会话OOM率下降80%,自3月1日起请求OOM率下降73%。具体措施包括处理大文件加载和修复资源泄漏,以应对突发与渐进性内存耗尽。
信息来源:Cursor Blog · Cursor
观点 / 方法精选
解读当前开放与封闭模型的性能差距
文章剖析了决定开源与闭源AI模型单一评估数字的复杂因素,探讨了当前两者之间的性能鸿沟及其成因,同时预测了未来这一差距的演变趋势。分析指出,评估指标背后涉及数据质量、训练规模、架构优化等多重变量,而随着开源社区技术迭代和评估体系完善,开放模型与封闭模型的能力边界将持续动态变化。
信息来源:Nathan Lambert:Interconnects(RSS)
观点 / 方法精选
设计不是产出:AI 工具无法替代对问题的理解
设计行业常将"设计"误解为产出界面或代码的行为,但真正的核心在于理解问题本身,找到形式与上下文的良好匹配。AI 工具能快速生成看似精美的输出,却往往绕开对底层问题的深入探索,导致产品表面光鲜但实际使用中脆弱、缺乏整合。设计仍需判断、对话、张力与时间,其价值在于通过动手工作逐步获得理解,而非仅仅依赖生成结果。
信息来源:Linear:Now(RSS)
观点 / 方法精选
使用 Sentence Transformers 训练与微调多模态嵌入及重排序模型
Sentence Transformers 发布了用于训练和微调多模态嵌入与重排序模型的功能。新版本支持将文本、图像等不同模态的数据映射到统一的向量空间,并优化了跨模态检索的精度。关键改进包括对嵌入模型和重排序器进行联合或分阶段训练,显著提升了如图文检索等任务的性能指标。此次更新旨在通过开源工具推动多模态人工智能技术的普及与发展。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
The PR you would have opened yourself
随着2026年AI代码代理的成熟,开源项目如transformers面临PR数量激增但质量下降的挑战。这些代理生成的代码常忽视项目的隐式设计契约,导致代码冗长、引入错误并增加维护者负担。为此,团队为mlx-lm开发了一个Skill工具,用于将模型从transformers高质量地移植到mlx-lm框架。该工具不仅生成接近人工提交的PR,还提供生成示例、数值对比和独立的测试工具链,以辅助贡献者和审查者。其目标是让模型在加入transformers后能快速在MLX上可用,同时维…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
使用 Claude Code:会话管理与百万级上下文窗口的策略
Claude Code 的百万级上下文窗口在支持长任务的同时,也带来了"上下文腐化"的风险,即模型性能可能在处理约30-40万token后开始下降。因此,有效的会话管理至关重要。关键策略包括:开启新任务时建议新建会话;对于关联任务可酌情保留上下文以提升效率;善用 `/rewind` 回退功能而非直接纠正错误,是维护上下文清洁的核心习惯。用户在每个对话轮次后,应根据情况选择继续、回退、新建会话、压缩或使用子代理。
信息来源:X:Thariq (@trq212) · Claude
观点 / 方法精选
黄仁勋谈 TPU 竞争、对华芯片销售与 Nvidia 的供应链护城河
黄仁勋表示,Nvidia 已具备支撑未来数年万亿美元级业务规模的供应链体系。这一表态印证了公司在 AI 芯片领域的供应链护城河优势,回应了市场对其产能扩张能力的关切。访谈同时涉及应对 Google TPU 竞争及向中国出售芯片的策略考量,凸显 Nvidia 在复杂市场环境下的长期布局信心。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS) · NVIDIA
观点 / 方法精选
多智能体系统将GPU内核性能提升38%
我们与NVIDIA合作,利用自主运行的多智能体系统,在为期三周内对235个真实CUDA内核进行了优化。该系统从零开始构建并优化Blackwell GPU内核直至汇编级别,实现了38%的几何平均速度提升,其中63%的问题超越基线,19%实现超2倍优化。这些内核直接影响AI训练与推理效率,传统上需资深工程师耗时数月乃至数年的优化工作,该系统在数周内即自主完成,并能探索更广阔解决方案空间,突破了人工逐项优化的限制。
信息来源:Cursor Blog · NVIDIA / Cursor
观点 / 方法精选
Stanford 2026 年 AI 指数报告显示技术快速进步、安全担忧加剧且公众信任下降
Stanford HAI 发布的 2026 年 AI 指数报告显示,AI 模型性能实现重大飞跃,中美技术差距显著缩小,但安全问题和公众信任危机同步加剧。报告指出,尽管 AI 能力快速提升,行业面临的安全隐忧日益严峻,公众对技术的信任度持续下滑。
信息来源:The Decoder:AI News(RSS)
观点 / 方法精选
AI Index Report 2026 发布
第九版 AI 指数报告新增多项追踪维度:AI 在推理、安全及真实任务执行上的测试范围扩大,但测量手段的可靠性正在下降;首次提供生成式 AI 的经济价值估计及其劳动力市场影响的初步证据;提出 AI 主权分析框架;与 Schmidt Sciences 合作新增科学章节,并首次设立 AI 在科学与医学中的独立章节,反映 AI 在这两个领域日益增长的影响力。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
AI稀缺时代的开端
AI算力稀缺时代正式开启。Nvidia Blackwell芯片GPU租赁价格涨至每小时4.08美元,两月内涨幅达48%;云服务商CoreWeave涨价20%并将最低合同期从一年延长至三年。Anthropic已将最新模型限制给约40个组织使用,OpenAI因算力不足被迫放弃部分项目。这标志着AI充足时代结束,"价高者得"、关系型销售、被迫多元化成为行业新常态,初创公司面临更严峻挑战。
信息来源:Tomer Tunguz 博客(VC 分析) · OpenAI / Claude / NVIDIA
观点 / 方法精选
Claude 神话与对开放权重的误导性恐慌
针对开放权重模型的恐慌情绪缺乏事实依据,围绕 Claude 等模型的安全争议存在明显的神话化倾向。作者批评这种对开源 AI 的恐惧散布是误导性的,认为所谓开放权重威胁论如同"又一场围绕开源的舞蹈",呼吁业界理性看待开源模型的安全性与价值,避免被无根据的安全恐慌所左右。
信息来源:Nathan Lambert:Interconnects(RSS) · Claude
观点 / 方法精选
针对AI加速攻击的安全准备建议
Anthropic发布Project Glasswing项目,利用Claude Mythos Preview模型进行网络防御。文章指出,未来24个月内AI将发现大量长期潜伏的漏洞并快速转化为攻击,公开可用的次级模型已能发现传统审查遗漏的严重漏洞。建议立即修补CISA KEV目录漏洞,使用EPSS评分系统优先处理风险,互联网暴露系统需在24小时内完成补丁更新。预计未来两年漏洞报告量将增加一个数量级,安全团队需建立自动化修补流程以应对AI加速的攻击态势。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
AI赋能民众提升政府透明度与问责制
AI正赋能民众反向提升政府透明度与问责制。历史上政府使社会"可读",而AI让民众具备解析政府海量数据的能力。政府问责的瓶颈并非数据公开,而是处理原始信息的智能--如冗长法案虽法律透明却难以实用理解。AI不仅赋能专业记者,更让普通民众能解析预算、立法差异、游说关系等复杂信息,地方政府场景同样适用。尽管技术存在双刃剑风险,但作者对民主社会因参与度和透明度提升而改善持乐观态度。
信息来源:X:Andrej Karpathy (@karpathy)
观点 / 方法精选
研究揭示:AI让初创企业收入倍增降本增效
一项针对515家初创企业的实地实验显示,AI使用正成为提升商业表现的关键技能。研究向一半企业展示AI成功应用案例,结果显示这些企业的AI使用率提升44%,收入增长1.9倍,所需资本减少39%。研究表明AI能显著加速业务发展并降低创业门槛,但企业面临的核心挑战在于如何理解和有效应用这项技术。
信息来源:X:Greg Brockman (@gdb)
观点 / 方法精选
Gemma4有8个模型, 选哪个? 一文看懂!
Google发布的Gemma4系列开放权重模型包含多个版本,选型需结合场景。带"-it"后缀为指令微调版,开箱即用;不带后缀为基座模型,供自行微调。其中,A4B指激活参数量为4B,E4B则采用逐层嵌入技术,以内存换取计算量,优化移动端性能。选型建议:综合性能与速度选26B-A4B;追求最佳代码或任务效果选31B;开发本地全模态应用选E4B;资源受限设备体验可选E2B,但输出质量有限。
信息来源:X:karminski (@karminski3)
观点 / 方法精选
我们调整了定价,现在无需预付即可在工作中试用 Codex
OpenAI 调整 Codex 定价策略,推出 $0 起步的纯 Codex 席位,完全按使用量付费。年付团队席位从 $25/月降至 $20/月,每新增一个席位赠送 $100 积分(最高 $500),方便团队零成本试用。
信息来源:X:Greg Brockman (@gdb) · OpenAI
观点 / 方法精选
ChatGPT 语音模式现已支持 CarPlay
ChatGPT 语音模式正式接入 CarPlay,运行 iOS 26.4 及以上版本的 iPhone 用户可在车载系统中使用语音交互功能,目前正在逐步推送中。
信息来源:X:OpenAI (@OpenAI) · OpenAI / ChatGPT
观点 / 方法精选
MAI 模型家族全面登陆 Foundry,面向所有开发者开放
MAI 模型家族正式登陆 Foundry 平台,推出三款新模型:MAI-Transcribe-1(支持25种语言的最准确转录模型)、MAI-Voice-1(自然语音生成)和 MAI-Image-2(最强图像生成模型)。开发者现可通过该平台直接调用。
信息来源:X:Satya Nadella (@satyanadella)
观点 / 方法精选
关于就业,先别恐慌--至少现在还不必
就业市场即将面临剧烈变革,但短期内无需过度恐慌。尽管未来形势将趋于复杂动荡,大规模冲击不会立即显现,当前仍处于变化酝酿阶段。这种渐进式演变意味着就业者尚有调整与准备的时间窗口,不必对即时性失业风险过度反应。然而,长期结构性转变不可避免,需保持警惕并提前规划。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS)
观点 / 方法精选
This is a very good post:
这是一篇很好的文章: 【引用 @boazbaraktcs】:新博客文章:AI 安全现状,四张假图。https://t.co/Qv1BlwyfY5
信息来源:X:Sam Altman (@sama)
观点 / 方法精选
人类24小时可从规则构建3000 Elo国际象棋引擎
作者以"Glurg"游戏(实为 chess)假设情境论证:借助现有外部认知基础设施(计算机、互联网等),人类顶尖团队能在24小时内从规则解析开发出3000 Elo引擎,三周内可达3500 Elo且计算效率提升10倍。这表明人类智能已具备即时掌握复杂策略系统的能力,而非从零缓慢进化。该论述回应了关于现实世界更接近 chess 而非 Go 的争论,强调人类利用工具扩展认知边界的即时优势。
信息来源:X:Francois Chollet (@fchollet)
观点 / 方法精选
Codex use cases:面向人类的 Skills
OpenAI 推出 Codex use cases 示例库,涵盖编程与非编程任务的实用场景。用户可在 Codex 应用中直接打开各用例的 starter prompt 开始使用。
信息来源:X:Greg Brockman (@gdb) · OpenAI
观点 / 方法精选
直接开搞就行
Codex 已重置所有套餐的使用限制,方便用户体验新推出的插件。现在可以无限制地使用 Codex 构建项目,尽情尝试。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI
观点 / 方法精选
Codex 正式上线 Plugins 功能
Codex 正式上线 Plugins 功能,开箱即用支持 Slack、Figma、Notion、Gmail 等主流开发工具,开发者可直接在 Codex 中调用这些服务。
信息来源:X:Greg Brockman (@gdb)
观点 / 方法精选
Codex 推出插件功能
Codex 正式上线插件系统,开箱即用地支持 Slack、Figma、Notion、Gmail 等开发者常用工具。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI
观点 / 方法精选
通过实时强化学习改进Composer编码模型
Cursor团队将实时强化学习技术应用于Composer编码模型,利用真实用户交互产生的推理令牌作为训练信号,以解决模拟环境与真实使用间的匹配问题。该技术使团队能够以每五小时一次的频率部署改进后的模型检查点。通过A/B测试,新版本实现了关键指标提升:代理编辑在代码库中的持久性增加2.28%,用户不满意后续减少3.13%,延迟降低10.3%。实时RL也带来了奖励黑客等新挑战,但真实用户反馈有助于识别和修正此类问题。
信息来源:Cursor Blog · Cursor
观点 / 方法精选
深入解析我们构建 Model Spec 的方法
OpenAI 公开 Model Spec 行为框架,阐述如何在安全、用户自由与问责制之间取得平衡,为 AI 系统发展提供可公开查阅的行为指导原则。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
观点 / 方法精选
OpenAI基金会投入10亿美元推动AI科研与风险治理
OpenAI基金会宣布未来一年将投入至少10亿美元,用于推动AI驱动的生命科学突破(如疾病治疗),同时防范新型生物威胁、经济快速转型及模型涌现效应等风险。联合创始人Wojciech Zaremba转任AI韧性负责人,主导韧性式安全体系建设;Jacob Tref、Anna Adeola分别负责生命科学及公民社会业务,Robert Kaiden与Jeff Arnold出任CFO及运营总监。
信息来源:X:Sam Altman (@sama) · OpenAI
观点 / 方法精选
利用长时运行智能体工作流革新科学计算
Anthropic 研究员展示了如何将多日智能体编码工作流应用于科学计算任务。以使用 Claude Opus 实现宇宙学玻尔兹曼求解器的可微分版本为例,该任务通常需耗费研究人员数月甚至数年时间。通过制定清晰的项目指令、利用日志文件作为智能体的持久记忆并设置测试预言,即使是非领域专家也能引导智能体在数小时内完成这类复杂项目。该方法的核心在于设定高层目标后,让智能体团队自主工作,仅需偶尔人工监督,从而显著提升了科学代码开发与移植的效率。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
观点 / 方法精选
Google 本周多项更新🧵
Google AI Studio 上线全栈 vibe coding 功能,集成 Antigravity 编程助手与 Firebase,支持将提示词直接转为生产级应用。
信息来源:X:Sundar Pichai (@sundarpichai)
观点 / 方法精选
(1/N) We're launching Dreamverse. Most AI video models take minutes to generate a 5 s 1080p clip. In…
(1/N) 我们正在推出 Dreamverse。大多数 AI 视频模型需要数分钟才能生成一段 5 秒 1080p 的片段。而在 4.5 秒内,我们就能在单张 GPU 上生成 30 秒 1080p 的片段。
信息来源:X:Sky Computing Lab (@haoailab)
观点 / 方法精选
直接动手做就行
Sam Altman 称赞 Codex 团队是硬核构建者,产品实力过硬,圈内硬核开发者已纷纷转向使用,使用量正快速增长。
信息来源:X:Greg Brockman (@gdb)
观点 / 方法精选
事物的形态
盘点当前阶段的核心现状与关键特征,基于现有趋势分析接下来可能发生的重要变化与未来走向。
信息来源:Ethan Mollick:One Useful Thing(RSS)