AI 情报文章归档
浏览 AI圈报 已保存的 5963 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5963
正式分类6
精选内容3375
全部文章
第 66 / 150 页 · 每页 40 条
观点 / 方法精选
AI 基础设施的牛鞭效应:从 GPU 到存储的连锁瓶颈
AI 基础设施瓶颈正沿供应链依次传导,形成典型的牛鞭效应。2023 年初 GPU 短缺使 H100 租赁价超 $9/小时,随后压力转移至内存,企业级 SSD 合约价单季上涨 80%;到 2025 年底智能体推高 CPU 需求,2026 年存储短缺导致西数和希捷 2026 全年 nearline 产能售罄。数据中心建设成本已超 $20b/GW,变压器交期近三年,涡轮机订单排至 2031 年。
信息来源:Tomer Tunguz 博客(VC 分析)
论文研究普通
WorldToken:面向机器人模仿学习的时间优先序列建模
WorldToken 提出时间优先策略,将每决策步的多视角图像、本体感觉与任务条件融合为单一世界 token,由因果时序 Transformer 建模并配合扩散动作头生成动作块。在 23 个 RoboCasa 任务上,85.3M 参数策略借助每任务 2,900 条生成演示达到 59.45% 平均闭环成功率。缩减可见历史会显著降低闭环成功率,但结果不证明其优于其他序列组织方式。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
AstroPT 对星系的认知如何校准 LLM 可解释性研究
研究者用基于数百万星系图像训练的 Transformer 模型 AstroPT 作为校准测试平台,检验概念在训练中涌现的顺序。探针分析发现,星系属性按已知难度固定顺序涌现:直接编码于像素的量(如波段星等)早期即可解码且位于浅层,而基于多波段/光谱推断的量(如红移、恒星形成率)出现更晚且位于深层。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
AutoResearch:两阶段自主科研系统,让洞察进、幻觉出
AutoResearch 是一个两阶段自主科研系统,将想法生成与想法执行相连,通过多模型生成、交叉评审和基于证据的独立审查来确保研究过程科学可靠。在 RSICD 基准上,其生成的想法将平均 Recall 从 32.84 提升至 34.69,且仅记录 5 起经审计确认的问题事件,远低于其他自主科研系统的 11-27 起。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新普通
哈佛商学院推出 699 美元创业训练营,AI 数字分身提供路演反馈
哈佛商学院(HBS)推出为期 8 周、收费 699 美元的 HBS Foundry 创业训练营,借助 HeyGen 打造的 AI 虚拟形象在模拟路演和董事会会议中向学员提供反馈。项目负责人 Katharina Rings 称,学生反馈希望获得引导性更强、更具互动性的体验,参与者表示很喜欢这些 AI 虚拟形象。
信息来源:IT之家(RSS)
教程 / 实战普通
面向企业 AI 安全的 NeMo Guardrails 开发者指南
本教程讲解如何用 NeMo Guardrails 框架为基于 LLM 的应用构建生产级安全防护,超越简单提示词过滤,实现分层架构,包括确定性 PII 脱敏、检索过滤、输出掩码和基于策略的工具门控。通过集成有状态多轮评估与详细激活追踪,可构建可审计、安全且经济高效的 AI 助手,用于管理敏感金融交互并满足严格合规标准。
信息来源:MarkTechPost(RSS)
行业动态普通
IT早报 0823:特斯拉监督版 FSD 移除中国支持地区;DeepSeek 周末统一按低谷价计费;Anthropic 曝募资 1000 亿美元冲击全球最大 IPO
特斯拉官网更新,监督版 FSD 支持地区不再包含中国。DeepSeek 自 8 月 23 日起调整 API 计费,周末全天统一按低谷价收费。Anthropic 最早或于本月提交 IPO 申请,募资 1000 亿美元,目标估值 2 万亿美元。
信息来源:IT之家(RSS) · DeepSeek / Claude
行业动态普通
特斯拉正有意放缓 Model Y 加入 Robotaxi 车队,押注 Cybercab
特斯拉正有意放缓将 Model Y 纳入 Robotaxi 车队的速度,因其相信专为无人出租车设计的 Cybercab 能在短期内快速规模化部署。支撑这一调整的是 FSD V15,特斯拉称其性能提升幅度可与 V13 升级至 V14 时相提并论,该版本引入七项核心技术,其中约 40% 已在 Robotaxi 车队中测试。
信息来源:IT之家(RSS)
观点 / 方法普通
中国开源AI为何可能更强大
Aravind Srinivas 认为,出口管制是开源与前沿模型存在12个月差距的唯一原因,但这也可能促使中国在物理层面积累实力。中国在建设数据中心方面速度更快,电力、许可、人力、专业能力均不成问题,反而可能因此成为更强大的竞争对手。Anthropic 曾大力游说支持出口管制。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Claude
行业动态普通
特斯拉获内华达州批准,可部署最多 5000 辆 Robotaxi
内华达州运输管理局批准特斯拉完整"自动驾驶汽车网络公司"运营许可证,未来 12 个月可在克拉克县部署最多 5000 辆无人驾驶汽车,取代此前仅限拉斯维加斯大道 10 辆的临时许可。商业化载客服务预计未来 30 天内启动,但仍需完成车辆检查、保险备案及票价审批。实际部署数量将取决于 FSD v15 的推进速度。
信息来源:IT之家(RSS)
产品发布 / 更新普通
航天自研半人马机器人"小橙"首次公开亮相,未来有望奔赴太空作业
在2026世界机器人大会上,航天自研半人马重载智能机器人"小橙"首次公开亮相。该机器人将轮足底盘与人形双臂灵巧手合二为一,面向应急抢险及危险场景作业,时速近20公里,支持跨楼层自主导航,可执行寻找幸存者等任务,未来有望奔赴太空开展作业。
信息来源:IT之家(RSS)
观点 / 方法普通
使用 Codex 一周后的印象:与 Claude 的对比
开发者分享了一周内更多使用 Codex 而非 Claude 的个人印象。Codex 生成的代码注释更少、架构更简洁,但完成 PR 耗时并无优势;Claude 则更主动,常超出要求猜测意图,而 Codex 更倾向于只执行明确指令。在 Jira 集成和 MCP 登录流程上,Codex 的 CLI 方式更顺畅。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Claude
行业动态普通
OpenAI创始人与洪都拉斯自由城创始人是表亲
今天瑞典媒体爆出大新闻: OpenAI 那位老兄,和正在洪都拉斯筹建自由意志主义城市的那位老兄,是表兄弟。
信息来源:X:Gabriel (@gabriel1) · OpenAI
论文研究普通
TRACES:面向发现式智能的基准
检验结果,审计过程。 面向发现式智能的 benchmark:TRACES
信息来源:X:马东锡 NLP (@dongxi_nlp)
论文研究普通
TRACES 基准:评估 AI 调查过程而非只看答案
Apodex Discovery 推出 TRACES 基准,评估 AI 系统能否通过证据充分、可审计、可修复的调查得到正确结果。它同时检查最终答案与外部可见轨迹,用 HDS6 盲评六种过程能力(工具、修复、备选解释、连贯性、证据、适用边界)。在 434 条缺陷轨迹上,加入修复说明使环境结果得分平均提高 0.155,但实验缺少匹配对照组。
信息来源:X:马东锡 NLP (@dongxi_nlp)
观点 / 方法普通
Ox Alpha 模型 DeepSWE 测试接近 GPT-5.6 Sol mid
神秘模型 Ox Alpha 在 DeepSWE 测试中取得约 63% 成绩,表现与 GPT-5.6 Sol mid 相当。若该模型确为 GLM-5.3 Flash,能在 DGX Spark 上本地运行,将极具性价比。用户评价其代码质量好、处理复杂任务能力强,但速度偏慢且偶尔遗留死代码。
信息来源:X:Kim (@kimmonismus) · GPT / GLM
观点 / 方法普通
为什么你身边的LLM看起来比实际更"笨"
用户常因下载量化版模型而误判LLM真实能力,导致体验远低于社区评价。量化压缩会损失精度与推理质量,尤其在复杂任务上表现明显。实际性能差异源于部署方式而非模型本身缺陷。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究普通
斯坦福研究:AI智能体辩论提升确定性
斯坦福大学新研究发现,让AI智能体相互辩论能提升其确定性。团队运行超1万个由32个不同人格智能体组成的小型社区,经8轮信息交流后,数学问题上错误多数派转向正确答案的频率高于正确派转向错误;政治议题上,4个模型中3个出现右倾趋势。研究建议,若系统采用智能体辩论机制,应追踪群体漂移方向,而非仅看分数提升。
信息来源:X:Rohan Paul (@rohanpaul_ai)
产品发布 / 更新普通
哈佛商学院699美元创业训练营用AI虚拟形象提供个性化反馈
哈佛商学院在为期八周、售价699美元的HBS Foundry创业训练营中,引入由HeyGen创建的AI虚拟形象,为学员的练习路演和董事会会议提供反馈。项目总监Katharina Rings称,试运行后学生希望获得更具引导性的体验,而参与者对虚拟形象反响积极。
信息来源:TechCrunch:AI(RSS)
行业动态普通
开源模型将主导AI工作负载
最终,绝大多数AI工作负载将基于开源模型! 【引用 @rauchg】:今天是Vercel AI Gateway上开源权重token占比创纪录的一天。 8月22日(今天)🟦 开源:62% 🟨 闭源:38% 6月24日(约两个月前)🟦 开源:28.4% 🟨 闭源:71.6% 这可能只是开始,因为企业采用仍处于早期阶段,而harnesses、CLIs、IDEs、SDKs等还需要适配为模型无关。
信息来源:X:Clément Delangue(Hugging Face CEO) (@ClementDelangue) · Hugging Face
行业动态普通
北京人形机器人百米9.39秒超越博尔特
这不仅仅是机器人竞赛。历史刚刚被改写。来自北京的人形机器人以9.39秒跑完100米,快于博尔特2009年9.58秒的纪录。 而且今年的百米赛是纯自主模式,即机器人必须在不经人类操控的情况下完成比赛。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
智能体自我训练为何陷入局部最优
一篇新论文分析大量公开的后训练轨迹,发现智能体在第一步就锁定训练策略,剩余预算全用于局部调整,无法真正实现递归自我改进。研究者尝试三种升级方案:经验驱动脚手架在GSM8K提升12.6分、HumanEval提升40.8分,但策略仍冻结;人类引导和额外推理算力均未解决根本问题。核心缺失是智能体在执行中缺乏重新考虑策略的能力。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
观点 / 方法普通
TRACES基准:不信任正确答案的评测
TRACES 一个不信任正确答案的基准。
信息来源:X:马东锡 NLP (@dongxi_nlp)
观点 / 方法普通
英伟达自研编码框架满分通过ARC-AGI-3
NVIDIA 构建了自己的编码框架来优化 CUDA GPU 内核,并在 ARC-AGI-3 的 25 个公开游戏中取得了 100% 的分数,解决了全部 183 个关卡。 借助智能体,我们将从一个运行、优化、后训练自己的 AI 模型和内核相当困难的世界,迈向一个几乎人人都能做到的世界。 1 亿 AI 构建者何时到来?
信息来源:X:Clément Delangue(Hugging Face CEO) (@ClementDelangue) · NVIDIA / Hugging Face
观点 / 方法普通
Anthropic 回应 Opus 5 批评,承诺改进
Kim 对 Anthropic 认真对待批评表示认可,并指出 Opus 5 表现不佳已是共识。Anthropic 的 Thariq 承认 Opus 5 是"尖刺型"模型,与 Claude 一贯的稳定温和风格不符,并称改进是当前最高优先级。Kim 对 Opus 5.1 抱有希望,认为社区反馈能推动实质改善。
信息来源:X:Kim (@kimmonismus) · Claude
论文研究普通
Task-CoEvolve:用自适应测试选择优化AI智能体评测成本
东京大学新论文指出,多数AI智能体评测测试浪费资金--所有版本都能通过或都无法通过的任务占测试集超70%,却与其他测试成本相同。新方法Task-CoEvolve仅保留过往版本有分歧的测试,每轮重新选取,并调整评分以跨轮比较。在Terminal-Bench 2.1上,仅用89项任务中20%进行评测,结果与全量评测相差约一项任务,成本降低67%-80%,时间减半。
信息来源:X:Rohan Paul (@rohanpaul_ai)
产品发布 / 更新普通
Anthropic 正在对 Claude Code 中的工作量降低程度进行 A/B 测试
Anthropic 将 Claude Code 2.1.236+ 上的部分会话纳入一项实验,缩小工作量(effort)档位的规模,旧版本和 Opus 5 不受影响。这很可能是一次 A/B 测试,并非所有用户都会看到变化。如果你感觉"high"档位像"low"档位,说明你已被分入测试组。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Claude
观点 / 方法普通
Linus Torvalds 谈 AI 调试:虽多次想放弃,但忠实执行调试代码
Linus Torvalds 在 drm/xe 内核补丁提交说明中评价 AI 调试助手:它承担了大量基础工作,但多次断言问题"不可能解决",建议直接写报告。Torvalds 怀疑其训练数据来自不如自己固执的人,不过在他推动下,AI 仍持续添加调试代码并忠实分析,因此他让 AI 撰写了提交信息。
信息来源:Simon Willison 博客
论文研究普通
Task Model Induction:将录屏转为可复用技能
Task Model Induction(TMI)能从原始屏幕录制与鼠标键盘事件中提取符号化任务模型,任务分组与真实标注一致性达 0.974。该方法重建 74.9% 的执行步骤,基于任务模型提炼的技能在保留任务上较最强工作流归纳基线提升 30.0% 准确率。论文:arxiv.org/abs/2608.20319。
信息来源:X:DAIR.AI (@dair_ai)
教程 / 实战普通
如何信任Bot自主操作?设计思路解析
Lee Robinson 分享如何信任 Bot 自主操作:先用 LLM 自动审查每个动作,异常时请求批准;再配可自定义规则允许或拒绝操作,如明确阻止写入/破坏性动作并要求先批准。这是 YOLO 模式与全手动审查间的平衡,但也支持 YOLO 模式。
信息来源:X:Lee Robinson (@leerob)
产品发布 / 更新普通
Grok Bot 本周末向部分企业开放
本周末,我们将向一小部分企业开放 Grok Bot 的访问权限。 如果您希望我们明天或周一前往您在旧金山的办公室,为您的团队完成接入,请回复我们。
信息来源:X:Michael Truell (@mntruell) · Grok
行业动态普通
OpenCode 优化后错误率趋近于零
经过更多优化并分配更多资源后,错误率已回落至接近零。 感谢 @Cloudflare 团队及时介入并启用相关支持。 推理是一种特殊的工作负载,面临一些独特的挑战--相关文章即将发布。
信息来源:X:opencode (@opencode)
观点 / 方法普通
OpenAI 为何放弃非营利身份转向营利
OpenAI 联合创始人 Greg Brockman 透露,2017 年公司开始计算 AGI 所需的算力,意识到需要大规模计算资源,而 Cerebras 的独特硬件可能带来压倒性优势。由于非营利筹款存在上限,Elon、Sam、Ilya 与他一致认为,创建营利实体是达成使命的唯一路径。
信息来源:X:Rohan Paul (@rohanpaul_ai) · OpenAI
观点 / 方法普通
ARR 与 ARR:警惕同一缩写背后的两种含义
Anthropic 支持者正庆祝其 ARR,但 ARR 可指年度经常性收入或年化运行率,两者含义截然不同。前者代表订阅等可重复收入,后者可能只是将最佳月份乘以 12 的推算,未必能持续。Anthropic 今年第二季度的收入规模明年未必能重现,尤其在 tokenmaxxing 崩溃后,ATT 等公司为节省成本正转向其他厂商的开源模型。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS) · Claude
观点 / 方法普通
Claude Code"high=10"非降级,Anthropic澄清
Anthropic的Thariq回应称,Claude Code中"high=10"的输出是数值映射问题,并非性能降级,"high"仍代表高推理强度,内部评测确认无性能回退。用户仍反馈多数模型(尤其Opus)使用体验明显变笨,Anthropic建议遇到明显回退时通过/feedback反馈并附ID,将提供积分补偿。
信息来源:X:Kim (@kimmonismus) · Claude
产品发布 / 更新普通
Inkling 模型上线 DAIR.AI 免费体验
DAIR.AI 已将 Thinking Machines 的 Inkling 模型上线其 harness playground,用户可免费搭配 Pi 或 Hermes Agent 试用。该模型为开放权重 MoE 推理模型,支持文本、图像和音频输入,拥有 1M 上下文窗口,并已在 OpenRouter 上供 Claude Code、Codex 等智能体框架免费调用。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · Claude
观点 / 方法普通
Ox Alpha 表现平平,未达开源前沿
Ethan Mollick 实测神秘模型 Ox Alpha,认为其表现尚可但未达开源权重模型的前沿水平。在其新哥特城市 twigl shader 测试中,Ox Alpha 逊于引用推文中同样开源的 Kimi K3,后者被评价为"非常好的模型"。Mollick 表示仍在继续测试。
信息来源:X:Ethan Mollick (@emollick) · Kimi
产品发布 / 更新普通
DeepMind 校友创立的 Inherent 称其 AI"队友"在复现研究上超越 Anthropic 和 OpenAI
伦敦 AI 实验室 Inherent 称其新发布的智能体 Faraday 在独立复现已发表科学论文结论的任务上,超越了 Anthropic 的 Claude Opus 4.8 和 OpenAI 的 GPT-5.5。Faraday 基于仅 270 亿参数的 Qwen 3.6 模型,并借助强化学习训练"研究品味"。该公司刚以 5000 万美元种子轮融资走出隐身模式。
信息来源:TechCrunch:AI(RSS) · OpenAI / GPT / Qwen
观点 / 方法普通
庆幸自己热爱提示词工程
我真的很庆幸自己热爱提示词工程。
信息来源:X:fofr (@fofrAI)
观点 / 方法普通
智能体采用速度惊人,周处理超百亿token
智能体的采用速度非常快,很容易忘记这个领域已经走了多远。 【引用 @xeophon】:不到一年前,一年处理 10B token 还是一项重大成就,能让你获得一块奖牌。 现在我一周就能处理超过 10B token。
信息来源:X:Greg Brockman (@gdb)