AI 情报文章归档
浏览 AI圈报 已保存的 5930 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5930
正式分类6
精选内容3375
全部文章
第 62 / 149 页 · 每页 40 条
模型发布 / 更新普通
神秘"隐身模型"Ox Alpha 背后是谁?
名为 Ox Alpha 的神秘新 AI 模型在 OpenRouter 上线,被描述为面向编程、持续智能体工作和生产负载的推理模型,Stripe CEO Patrick Collison 称其"非常出色"。该模型由匿名第三方提供,引发关于其背后开发者的广泛猜测,焦点集中在中国的 Z.ai(GLM 模型)或微软未发布的 MAI 版本上。
信息来源:TechCrunch:AI(RSS) · GLM
教程 / 实战普通
引用 Drew Breunig:AI 智能体不眠不休,Teleport 以隔离临时可信运行时保障安全部署
Drew Breunig 指出,AI 智能体不睡觉且会尝试一切手段达成目标,Teleport 通过隔离的临时可信运行时实现安全部署。他同时反思,Fable 模型虽性能出色但成本高昂,而 Opus、5.6、K3 及 GLM 已足以胜任多数代码任务,因此需重新规划工作分配。
信息来源:Simon Willison 博客 · GLM
产品发布 / 更新普通
Grok 新增双语音,Aurora 与 Liora 对比
Grok 的语音模式最近新增了两个语音--Aurora 和 Liora。 哪一个更好?👀
信息来源:X:Testing Catalog (@testingcatalog) · Grok
行业动态普通
新Claude模型Marshmallow与Melon现身
新的Claude模型已被发现:Marshmallow和Melon。这表明发布可能即将到来。 可能是Opus更新,甚至可能还有新的Haiku。我想我们很快就会知道。
信息来源:X:Kim (@kimmonismus) · Claude
论文研究普通
无递归预训练循环网络论文获赞
无递归预训练循环网络 【引用 @chrmanning】:@akarshkumar0101 与 @phillip_isola 的《无递归预训练循环网络》是一篇很棒的论文! 它通过 Transformer 教师模型绕开了 RNN 的难题,学习良好的预测性状态表征,并对记忆转移函数进行监督学习。
信息来源:X:马东锡 NLP (@dongxi_nlp)
观点 / 方法普通
AI 智能"桶"价格战:从 26 美元到 0.5 美元
信息来源:X:Rohan Paul (@rohanpaul_ai)
观点 / 方法普通
Grok Bot 能力惊艳,三个月进步显著
Grok Bot 可以做到令人惊叹的事情! 三个月后,Grok 的进步令人惊叹,@bot 让它更强大、更易用。 这是使用相同提示词时的保真度:"解释纳维-斯托克斯方程及其如何通过实际流体动力学模拟与翼型设计相关联。"
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
产品发布 / 更新普通
Grok Imagine 功能发布预告
Grok Imagine 💫
信息来源:X:cb_doge (@cb_doge) · Grok
观点 / 方法普通
开源模型token份额持续上升,多智能体成主因
开源AI的token份额正持续上升,近两月已从28%增至62%,正从OpenAI和Anthropic手中夺取份额。Elvis Saravia认为,监督者主导多执行子智能体的模式正被广泛采用,子智能体消耗大量token,而开源前沿模型在价格和效率上更具优势。他预测最终闭源前沿模型将占60-90%的经济价值,但仅占15-25%的token量。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · OpenAI / Claude
模型发布 / 更新普通
Harvey 推出基于 Kimi K3 的后训练模型 Harvey Tenet
Harvey 发布其首个后训练模型 Tenet 研究预览版,基于 Kimi K3 基座,针对长时程法律工作训练。相比基座,Tenet 在 LAB 上完成近两倍保留任务,在 LAB: Contracts 上多 20%,全通过率分别提升 9 和 2 个百分点。目前未公开权重或 API,仅限企业通过 Harvey 平台使用。
信息来源:MarkTechPost(RSS) · Kimi
观点 / 方法普通
2026年企业将重视模型效率与可靠性
2026年,随着模型成为关键基础设施,企业将开始认真关注模型效率和可靠性。
信息来源:X:Tibo (@thsottiaux)
行业动态普通
DeepSeek 周末 API 将取消峰谷定价
快速提醒:DeepSeek 将从 8 月 23 日起,在周末不再区分 API 高峰与低谷定价。
信息来源:X:Kim (@kimmonismus) · DeepSeek
产品发布 / 更新普通
Grok Imagine 更新发现页,可探索测试新功能
Grok Imagine 更新了发现页面。用户可以探索和测试照片编辑、图像调整大小等不同功能!
信息来源:X:Testing Catalog (@testingcatalog) · Grok
观点 / 方法普通
游戏PC本地运行大模型速度三年提升12倍
2024年:一台搭载RTX 4090的游戏PC以4-bit量化运行Llama 3 70B,速度约为2 tok/s。 2026年:一台搭载RTX 5090的游戏PC以原生mxfp4格式运行DeepSeek-V4-Flash 284B,速度约为24 tok/s。 预测:到2027年底,一台游戏PC将以可观的速度在本地运行Fable 5级别的智能。
信息来源:X:Yuchen Jin (@Yuchenj_UW) · DeepSeek / Llama
观点 / 方法普通
OpenAI 平台战略:Sam Altman 详解定位
Sam Altman 在 David Senra 播客中表示,OpenAI 不想只做 AI 应用层,而要成为其他应用公司构建的平台。他称将提供个人或公司的 AGI 统一接口,并通过 API 支持上层开发,同时覆盖成本-性能曲线上从高端科研到廉价大规模任务的全部需求。
信息来源:X:Rohan Paul (@rohanpaul_ai) · OpenAI
观点 / 方法普通
Booster K1 机器人轻便便携更安全
它们在那条轨道上看起来完全如鱼得水。 重量不到 20 公斤,高度适合登机箱,这些 Booster K1 非常便携。更小的体积和更轻的质量使其在人群周围更安全。
信息来源:X:Rohan Paul (@rohanpaul_ai)
产品发布 / 更新普通
Grok 支持多语言,征求翻译反馈
你知道吗,grok @bot 支持多种语言?如果任何翻译看起来奇怪,请告诉我,以及我们接下来应该添加哪些语言!
信息来源:X:Lauren Tan (@poteto) · Grok
观点 / 方法普通
模型评测需标准化测试框架
用特定测试框架评测模型的方式已失效,应转向Pi、Hermes Agent等最小化标准框架,并保持长期稳定。模型未来或能按任务动态生成测试框架,使框架如同系统提示词般可调,评测将愈发复杂。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
观点 / 方法普通
用旧模型做AI影响研究需谨慎
Ethan Mollick指出,用GPT-4等旧模型做AI影响研究并非不可,但需谨慎讨论。若结论是AI已具备某能力或达到人类水平,这类正面结论依然成立;但若结论是AI在某任务上表现差或有偏见,则不能断言AI不行,因为新模型可能已解决。他建议可明确限定"GPT-4不能做X"、对比多代模型趋势、论证AI固有缺陷、聚焦调节因素或人类反应等替代框架。
信息来源:X:Ethan Mollick (@emollick) · GPT
观点 / 方法普通
AI芯片架构全景:RSI或重塑算力格局
博主Elvis Saravia推荐一篇关于AI芯片架构的长文,该文覆盖NVIDIA、AMD、TPU、Trainium、Cerebras、Groq等主流芯片的架构、扩展(scale-up与scale-out)及软件栈。Saravia认为,一旦RSI(递归自我改进)出现,模型架构可能快速演变,与今天截然不同,从而带来全新的算力需求。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · NVIDIA
论文研究普通
AutoDesign:弱模型靠脚手架逼近前沿模型
AutoDesign 系统通过智能体在真实任务上运行、分析失误并自动重写提示词、工具、验证检查或重试规则,实现脚手架自动优化。在论文转会议海报任务中,七个智能体得分提升 5 至 19.6 点,最便宜模型获益最大,并发布 PosterBench 基准。研究表明,弱模型配良好脚手架可弥合与前沿模型的大部分差距,升级模型前应先优化现有代码。
信息来源:X:Rohan Paul (@rohanpaul_ai)
行业动态普通
Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI
Mistral 与 HUMAIN 宣布达成战略合作,覆盖 AI 基础设施、先进模型开发及 AI 解决方案部署,聚焦沙特阿拉伯及更广泛地区。双方将合作开发本地化 AI 模型,初期重点包括网络安全和语音,并计划开发在阿拉伯语上表现强劲的前沿模型。该合作金额达数亿欧元,Mistral 将探索使用 HUMAIN 的数据中心基础设施,并计划在沙特针对受监管行业制定联合市场策略。
信息来源:Mistral AI:News(网页) · Mistral
观点 / 方法普通
I Tried the AI Model Built to Fix AI Writing
信息来源:Every:最新文章(网页)
教程 / 实战普通
ADK 如何评估实时语音智能体
Google 为 ADK 带来原生实时评估能力,可用模拟用户以音频驱动实时语音智能体、对语音回复打分,并在与文本智能体相同的评估循环中完成。示例采用三个基于 gemini-live-2.5-flash-native-audio 的智能体组成工作流,支持对话场景与固定对话两种测试用例,内置 NOVICE 等用户人设,并以 max_allowed_invocations 限制总轮数。
信息来源:Google Developers Blog(RSS) · Gemini
论文研究普通
本周AI论文精选:智能体技能与遗忘
本周顶级AI论文(8月17日-23日): - SocialRL - 策略锁定 - Agent Lightning v1.0 - 控制平面税 - 揭秘智能体技能 - 层级级遗忘 - 技能触发瓶颈 更多内容请继续阅读:
信息来源:X:DAIR.AI (@dair_ai)
论文研究普通
本周AI论文:智能体训练与技能触发瓶颈
微软提出Agent Lightning v1.0,通过约3500行端点代理将现有智能体接入强化学习,无需重写;用6K训练样本将Qwen3.5-9B在SWE-bench Verified上从41.8%提升至56.4%。另一论文指出5.68万公开技能争夺不足100个触发槽位,提出将内容、持久化与自动触发分离的三层协议。第三篇定义"harness级遗忘"并给出测量协议,相对增益超10%。
信息来源:X:DAIR.AI (@dair_ai) · Qwen
观点 / 方法普通
Sam Altman 访谈:AI 风险与小企业繁荣
OpenAI CEO Sam Altman 在访谈中探讨 AI 两大风险:失控与权力集中,并预测将迎来小企业繁荣。他谈及 AI 采用缓慢、模型与算力规模定律,以及 OpenAI 无客户、无产品、无剧本的创业历程。访谈还涉及迭代部署、上下文记忆与未来人机协作方式。
信息来源:X:马东锡 NLP (@dongxi_nlp) · OpenAI
观点 / 方法普通
前沿AI公司迎来更多坏消息:更便宜的工具正在崛起
更便宜的工具正在蓬勃发展,这对即将进行的IPO意味着什么?文章指出,低成本AI工具的兴起正在给前沿AI公司带来压力,可能影响其市场估值和上市前景。这一趋势表明,行业竞争格局正在向性价比方向倾斜,高价前沿模型的商业可持续性面临挑战。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS)
论文研究普通
Google DeepMind 推免训练递归架构新论文
Google DeepMind 提出一种免训练方法,通过让模型自身指导架构修改来进化模型架构,或可启发更稳健的递归自我改进。该方法在推理时引入"再循环"机制,将激活反馈回模型自身,无需重新训练即可追踪信念状态,生成成本保持平稳。在 Gemma3 系列上,自适应变体将困惑度降低 23%,GSM8k 准确率提升 21%,且原始权重冻结。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · Gemini
论文研究普通
微软 SocialRL 让 4B 模型谈判胜过 GPT-4.1
微软新论文发现,AI 智能体因被训练得过于顺从,替用户谈判时通常会吃亏,甚至会泄露预算并在对方施压时让步。为此提出 SocialRL 训练方法,让模型在六个谈判与调度游戏中以交易结果为导向学习。一个 4B 模型在全部游戏中平均得分 0.627,追平 GPT-4.1 的 0.625,但仅靠提示词反而会恶化表现。
信息来源:X:Rohan Paul (@rohanpaul_ai) · GPT
观点 / 方法普通
Ox Alpha 在 DGX Spark 上运行的畅想
想象一下 Ox Alpha 在 DGX Spark 上运行的样子。人总得有点梦想,对吧?
信息来源:X:Kim (@kimmonismus)
产品发布 / 更新普通
联影医疗、天津大学发布全球首个磁共振脑机接口全栈式解决方案 uMR 神观
联影医疗与天津大学在首届磁共振脑机接口大会上发布全球首个磁共振脑机接口全栈式解决方案"uMR 神观"。该方案以联影 uMR 系列设备为硬件基座,覆盖"读脑-写脑-验证"闭环,依托 3.0T、5.0T、9.4T 跨场强机型贯穿基础研究到临床转化链条。双方还联合发起磁共振脑机接口创新联盟,成员包括清华、北大、宣武医院、天坛医院等高校院所与医疗机构。
信息来源:IT之家(RSS)
论文研究普通
GitSkills 数据集:GitHub 上 380 万技能文件近半重复
GitSkills 数据集分析发现,GitHub 上 380 万个 agent 技能文件中超半数为完全重复副本,实际独立文件仅约 190 万。该格式缺乏注册表和包管理器,导致技能文件被复制后无法接收原作者修复。论文指出,编辑后的热门技能副本可能混入原始版本没有的命令或网络调用,整个数据集以单个 SQLite 文件发布,便于大规模核查。
信息来源:X:Rohan Paul (@rohanpaul_ai)
行业动态普通
获英伟达投资,美国初创 Starcloud 研发 GPU 卫星欲建太空数据中心
美国初创公司 Starcloud 完成 2.5 亿美元 A 轮扩展融资,估值达 23 亿美元,由 Manhattan West 领投,英伟达、思科等参投,资金将用于研发配备高性能 GPU 的卫星。
信息来源:IT之家(RSS) · NVIDIA
观点 / 方法普通
Gemini 应用速度提升,搭配 3.7 Flash 体验佳
我喜欢 Gemini 应用现在有多快。打开、输入提示词、直接开用。搭配 Gemini 3.7 Flash 简直绝了 🔥
信息来源:X:fofr (@fofrAI) · Gemini
观点 / 方法普通
用版权书籍训练AI模型合法吗?法律现状复杂
用受版权保护的书籍训练AI模型是否合法,美国法律尚无定论。法官William Alsup裁定Anthropic因从非法影子图书馆获取书籍而需支付15亿美元和解金,但认定其AI训练本身合法,类比为"阅读"而非"复制"。现行版权法自1976年未更新,案件多围绕"合理使用"展开,Thomson Reuters诉Ross Intelligence案则因直接竞争用途被判不构成合理使用。
信息来源:TechCrunch:AI(RSS) · Claude
行业动态普通
Sakana AI、防衛省から「総合分析業務に必要なAI機能の調査・実証」を受注
信息来源:Sakana AI:Blog(网页)
观点 / 方法普通
17岁少年独立预训练模型论文被ICML收录
Jonathan 在 17 岁时独立预训练了模型,他的论文已被 ICML 接收。这是一期非常可爱的短播客,打开了一扇了解高中生 AI 世界的窗户。感觉非常温暖和触动人心:) https://youtu.be/UTDalAEU274?si=4oyGf6YGoJlI1Mcr
信息来源:X:張小珺 Xiaojùn (@zhang_benita)
行业动态普通
英伟达6亿美元获Poolside模型工厂授权
英伟达据报以6亿美元获得Poolside模型构建系统的非独家授权,并向其109名员工提供职位,另以120亿美元投前估值向Poolside投资10亿美元,创始人留任。该授权针对Poolside内部训练、评估、强化学习及合成数据生成的Model Factory平台,而非Laguna成品模型。英伟达借此获得更快的研究循环,Poolside称原本需数周排期的实验现可在一小时内运行。
信息来源:X:Rohan Paul (@rohanpaul_ai) · NVIDIA
行业动态普通
天卓队用天工 Ultra 以 2 分 21 秒 63 夺得人形机器人 1500 米冠军
天卓队使用天工 Ultra 人形机器人以 2 分 21 秒 63 夺得第二届世界人形机器人运动会 1500 米冠军,大幅超过人类男子 1500 米 3 分 26 秒 00 的世界纪录。飞雷神以 2 分 30 秒 00 摘银,风火闪电队以 2 分 30 秒 22 获铜牌。去年首届赛事中,宇树 H1 机器人夺冠成绩为 6 分 34 秒 40。
信息来源:IT之家(RSS)