AI 情报文章归档
浏览 AI圈报 已保存的 5733 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5733
正式分类6
精选内容3361
全部文章
第 101 / 144 页 · 每页 40 条
模型发布 / 更新精选
阶跃星辰 Step 3.7 Flash 在 Fireworks AI 上架
阶跃星辰的 Step 3.7 Flash 已上架 Fireworks AI。该模型为 198B 稀疏 MoE 多模态大模型(VLM),含 196B 语言骨干和 1.8B 视觉编码器,从设计之初优化推理效率,采用硬件友好架构与 MTP 辅助解码,速度达 400 tokens/s。具备原生多模态理解与行动、可靠工具使用、增强搜索能力,面向真实智能体工作负载,采用 Apache 2.0 开源许可。
信息来源:X:阶跃星辰 StepFun (@StepFun_ai)
观点 / 方法精选
SkyClaw-v1.0 深度实测:Agent专属模型,顶尖性能表现,极致价格优势
5月26日,昆仑万维发布SkyClaw-v1.0,定位面向复杂工具使用和真实世界任务执行的高性能Agent模型,输入仅0.5元/百万token、输出4元/百万。实测显示,其从零生成番茄钟和记账本应用时,能自主用Web Audio API合成音效、用SVG手绘图表,细节处理成熟。在现有代码库修改任务中,越难的任务表现越好:单点bug修复精准,能准确诊断iOS Safari滚动问题并给出克制式修复方案。但官方未报告SWE-bench成绩,表明其优势集中在从零生成与模式匹配场景,…
信息来源:公众号:昆仑万维(天工)
观点 / 方法精选
Nemotron 3.5 ASR:为你的语言、领域或口音进行微调
Nemotron 3.5 ASR 是一个 600M 参数的多语言流式语音识别模型,单个检查点覆盖 40 种语言-地区(含英、西、德、法、意、日、韩、中、阿拉伯等)。采用 Cache-Aware FastConformer 编码器与 RNNT 解码器,缓存内部状态避免重复计算,实现低延迟流式转录且不损失精度。模型原生输出带标点和大写的生产级文本,无需后处理。支持指定语言(target_lang=es-ES)或自动语言检测(target_lang=auto)。通过注意力上下文大…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
OpenAI称AI递归自我改进迹象初现
OpenAI刚刚写道:"我们也看到了当今系统中递归自我改进(RSI)的早期迹象:AI开发本身正被AI加速。 我们预计这将加剧开发者与国家之间的竞争压力,并带来现有机构无法应对的治理挑战。 随着RSI的出现,社会将需要找到塑造AI发展轨迹的方法,确保其服务于人类利益。" 气氛变了,有事正在发生。
信息来源:X:Kim (@kimmonismus) · OpenAI
论文研究精选
EVA-Bench Data 2.0 发布:覆盖三大领域、121 个工具、213 个场景
EVA-Bench Data 2.0 将评估范围从单一企业领域扩展至航空公司客户服务管理(CSM)、企业 IT 服务管理(ITSM)和医疗 HR 服务交付(HRSD)三个领域,共涵盖 121 个工具、213 个场景,场景数较原始版本增长约 4 倍。每个场景均经 OpenAI GPT-5.4、Google Gemini 3.1 Pro 和 Anthropic Claude Opus 4.6 验证可解性。数据集遵循语音优先、真实性、多样性、认证流程和可复现性五项设计原则,包含单…
信息来源:Hugging Face:Blog(RSS) · OpenAI / GPT / Claude
观点 / 方法精选
OpenRouter 30 场 AI 大逃杀:11 个 LLM 对决,Claude 与 Grok 谁更优?
OpenRouter 展开了 30 场 AI 大逃杀式对比,涉及 11 个大语言模型,共消耗 482 美元推理费用。实验得出一个发现,该发现应改变用户阅读模型基准测试的方式。
信息来源:OpenRouter:Announcements(RSS) · Claude / Grok
观点 / 方法精选
OpenRouter 横评 11 款 LLM 机器人冲刺对决:Claude 与 Grok 谁更胜一筹?
OpenRouter 在 30 场机器人冲刺对决中测试了 11 款大语言模型,共耗 482 美元推理成本。结果指向一个发现:应该重新审视模型 benchmark 的解读方式。
信息来源:OpenRouter:Announcements(RSS) · Claude / Grok
观点 / 方法精选
OpenRouter 翻遍 11 款 LLM 找最快的决策模型:Claude vs. Grok 领衔
OpenRouter 用总价 482 美元的推理花费,让 11 款大语言模型在 30 轮实时决策的"大逃杀"挑战中正面竞争。实验结果表明,传统的静态 benchmark 排名无法反映模型在需要即时反应的智能体任务(如自主控制机器人)中的真实表现,Claude 和 Grok 系列模型在决策速度与任务成功率上表现突出,而多项高分模型的实时调度能力未达预期。
信息来源:OpenRouter:Announcements(RSS) · Claude / Grok
论文研究精选
Nemotron 预训练的任务种子合成问答生成
在 Nemotron-3 Nano 模型的 100B token 续训练实验中,任务种子合成数据生成(Task-Seeded SDG)使 MMLU-Pro 提升 1.8 分,平均代码提升 1.9 分,常识理解提升 1.6 分,GPQA 提升 11.1 分,数学成绩保持稳定。该流程利用 lm-eval-harness 中约 70 个公开任务(约 700 子任务)的训练集作为种子,生成新示例并补充推理和上下文,经过格式校验、去重和答案验证后得到精选合成数据集,用于 Nemotr…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
论文研究精选
RHO:利用过往轨迹优化LLM智能体工具链的自监督方法
Retrospective Harness Optimization (RHO) 是一种自监督方法,仅利用过往轨迹优化LLM智能体的工具链(技能、工具和工作流程集合)。RHO从历史任务中选取多样化的困难任务核心集,并行重新执行;智能体通过自我验证和自我一致性分析回放,生成候选工具链更新,并依据自身成对自我偏好选择最有效更新。在软件工程、技术工作和知识工作三个领域评估中,单轮优化将SWE-Bench Pro通过率从59%提升至78%,无需外部评分。分析表明RHO有效针对先前失…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新精选
Dreaming: ChatGPT 推出更强的记忆系统,更好记住用户偏好
ChatGPT 推出名为 Dreaming 的新记忆系统,能够更有效地记住用户偏好,并在跨对话场景中保持上下文的新鲜感和相关性,从而提升助手的个性化体验。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
产品发布 / 更新精选
Meet OpenJarvis:一个本地优先的设备端个人AI智能体框架,支持工具、记忆与学习
Stanford 研究人员发布 OpenJarvis,一个完全在设备端运行推理、智能体、记忆与学习的开源框架。它将个人 AI 系统分解为五个可组合原语:Intelligence、Engine、Agents、Tools & Memory 和 Learning。该框架与最佳云端模型的性能差距在 3.2 points 以内,边际 API 成本降低约 800 倍。
信息来源:MarkTechPost(RSS)
产品发布 / 更新精选
Grok 登陆 Cloudflare AI Gateway
xAI 与 Cloudflare 合作,将 Grok 的 LLM、音频、图像和视频模型接入 Cloudflare AI Gateway,用户可直接通过 Cloudflare 计费,无需额外认证或 API 密钥。Elon Musk 发推称 "Grok on Cloudflare"。
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
模型发布 / 更新精选
Grok Imagine 1.5制作《伊利亚特》预告片
伊利亚特(特洛伊)预告片由刚刚发布的 Grok Imagine 1.5 制作
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
行业动态精选
联合国报告:2030年AI数据中心水电消耗将翻倍
联合国大学水、环境与健康研究所报告指出,受AI需求驱动,去年全球数据中心耗电448太瓦时(AI占五分之一),耗水4.5万亿升,碳排放1.89亿吨。预计到2030年,年耗电量将翻倍至945太瓦时(AI占40%),耗水增至9.3万亿升,碳排放升至3.99亿吨,占地面积从6900平方公里扩展至14500平方公里。报告警告若忽视环境成本,AI落地还将加剧土地紧张与电子废弃物问题。
信息来源:IT之家(RSS)
模型发布 / 更新精选
Grok Imagine视频生成上线Vercel
Vercel 的 AI Gateway 上现已推出 Grok Imagine Video 1.5。该服务支持图生视频并同步音频,一次性完成。示例代码: `await generateVideo({ model: 'xai/grok-imagine-video-1.5-preview', prompt: 'a rabbit sprinting through nyc' });`
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
产品发布 / 更新精选
Hugging Face 为编码智能体重塑 hf CLI 输出格式
Hugging Face 重新设计 hf CLI,使其同时服务人类用户和编码智能体(Claude Code、Codex 等)。CLI 通过环境变量自动检测智能体驱动,输出紧凑无截断的 TSV 格式,避免 ANSI 和交互提示,大幅降低 token 消耗。复杂多步任务中,不使用 CLI 的智能体 token 消耗最高达 hf CLI 的 6 倍。2026 年 4 月起,Hugging Face 追踪 Hub 智能体流量,Claude Code 约 4 万用户、近 4900 万…
信息来源:Hugging Face:Blog(RSS) · Claude / Hugging Face
行业动态精选
深陷版权诉讼仍受资本热捧,AI 音乐生成公司 Suno 再融资 4 亿美元
AI 音乐生成企业 Suno 完成 4 亿美元 D 轮融资,投后估值 54 亿美元,较七个月前 C 轮估值翻番。公司承认使用受版权保护歌曲训练 AI 模型,但辩称符合合理使用原则。索尼与环球音乐 2024 年首次起诉后,涉案曲目从 560 首增至超 6.1 万首;华纳音乐于 2024 年 11 月与 Suno 和解并签订授权协议。本轮由 Bond Capital 领投,用户日均生成 AI 歌曲超 700 万首。
信息来源:IT之家(RSS)
产品发布 / 更新精选
Grok模型登陆Cloudflare AI Gateway
在 @Cloudflare 的 AI Gateway 上尝试 Grok 模型!
信息来源:X:SpaceXAI (@SpaceXAI) · Grok
模型发布 / 更新精选
GPT-Rosalind 重大升级,提升药物发现智能
GPT-Rosalind 重大升级,药物发现、分析、设计和实验工作流的智能大幅提升:
信息来源:X:Greg Brockman (@gdb) · GPT
模型发布 / 更新精选
MiniMax M3联袂Mem0推持久记忆AI
Mem0 是 MiniMax M3 的官方启动合作伙伴! M3 的 1M token 上下文窗口 + @mem0ai 的记忆层 = 真正记住的 AI 应用。 构建具有持久记忆的个性化 AI 智能体,现在启动周内 M3 享五折优惠。 开始使用 Minimax → https://platform.minimax.io/docs/guides/models-intro 注册 mem0 → http://app.mem0.ai/?utm_source=minimax_x_post
信息来源:X:MiniMax (@MiniMax_AI)
产品发布 / 更新精选
Claude Code v2.1.162 发布
Claude Code v2.1.162 发布,主要包含 Bug 修复和体验优化。`claude agents --json` 新增 `waitingFor` 字段,`/effort` 命令确认级别持久化,远程控制固定底部显示,`/ide` 菜单中 Windsurf 更名为 Devin Desktop。修复了配置文件只读导致启动黑屏、Windows 权限规则不匹配、LSP 的 `workspaceSymbol` 无结果、API 400 错误、MCP 超时低于 1000ms …
信息来源:Claude Code:GitHub Releases(RSS) · Claude
观点 / 方法精选
不,人工智能没有意识--陈景德
科幻作家陈景德(Ted Chiang)在《大西洋月刊》发表评论,直接否定人工智能具备意识的可能性。文章从哲学和认知科学角度论证,当前的大语言模型仅是模式匹配与文本生成的统计系统,并不拥有主观体验或自我意识。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
行业动态精选
OpenAI发布前沿AI民主治理与安全蓝图
我们发布了一份关于前沿AI民主治理的蓝图, 以及美国如何为前沿AI安全建立持久的机构。
信息来源:X:Greg Brockman (@gdb) · OpenAI
模型发布 / 更新精选
Gemma 4 12B发布:笔记本本地运行的多步推理模型
Gemma 4 系列累计下载量突破1.5亿次,Google随之推出新成员Gemma 4 12B。该模型仅12B参数,可在16GB VRAM笔记本上本地运行,兼顾尺寸与性能,支持多步推理和智能体工作流。采用Apache 2.0开源许可,供社区使用。
信息来源:X:Sundar Pichai (@sundarpichai)
观点 / 方法精选
世界模型的功能分类
World Labs团队与李飞飞发文,梳理"世界模型"这一被滥用的术语。对比语言模型学习文本统计,世界模型学习空间与时间统计(如光照、物理规律)。基于部分可观马尔可夫决策过程(POMDP)框架,智能体通过动作影响世界状态,观测是部分视图。当前被称为"世界模型"的不同系统本质上是同一循环的不同投影:第一类为渲染器,输出给人眼看的像素,以视觉保真度为核心。文章着重于概念分层,未给出具体模型名、参数或基准分数。
信息来源:X:Fei-Fei Li (@drfeifei, World Labs)
模型发布 / 更新精选
Gemma 4 12B 发布:150M+ 下载量里程碑,16GB VRAM 本地运行
Demis Hassabis 宣布 Gemma 4 系列下载量突破 1.5 亿,并正式发布新版 Gemma 4 12B 模型。该模型是一个统一的、无编码器的多模态模型,兼具边缘端效率与高级推理能力。尽管参数规模仅为 12B,但性能强劲,且足够小巧,可在仅需 16GB VRAM 的笔记本上本地运行。采用 Apache 2.0 开源许可证,方便开发者自由构建。
信息来源:X:Demis Hassabis (@demishassabis)
观点 / 方法精选
大型人工智能公司的一半股份应归公众所有
美国参议员伯尼·桑德斯(Bernie Sanders)在其官网发布的专栏文章中提出,大型人工智能公司的一半股份应归公众所有。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
模型发布 / 更新精选
Ideogram v4.0 发布:2K 分辨率和 JSON 提示支持
介绍 Ideogram v4.0。 原生 2K 分辨率,出色的文字渲染,支持 JSON 提示词。 立即在 Krea 中体验。
信息来源:X:Krea AI (@krea_ai)
模型发布 / 更新精选
Gemma 4 12B:一种统一的、无需编码器的多模态模型
Gemma 4 12B 是 Google 发布的一款统一架构、无需独立视觉编码器的多模态大语言模型(LLM)。该模型直接处理图像与文本输入,无需传统视觉编码器,简化了多模态推理流程。基于 12B 参数规模,Gemma 4 12B 面向开发者工具生态开放。目前其具体 benchmark 分数、上下文窗口、价格及开源/API 可用性等细节尚未披露。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
Replit上线SEO Agent助应用被发现
你发布了你的应用。然后呢? 你的应用可能看起来很棒,但如果没人能找到它,它就依然不可见。 发布只是开始。 认识一下SEO Agent。它会为你运行一次扫描,并建议修复措施,帮助你的应用在网页搜索和AI搜索中被发现。
信息来源:X:Replit (@Replit)
模型发布 / 更新精选
Miso One 开源语音模型:8B 参数、110ms 延迟、一次语音克隆
Miso One 正式发布,一个 8B 参数的开源权重语音模型(TTS),旨在模拟真实人类朗读的温暖与节奏。它支持一次语音克隆(只需短样本),推理延迟仅 110ms。模型权重已开源至 GitHub,无需 API 即可自托管,音频数据不离开本地。API 访问即将推出。演示已上线,可先试听再克隆仓库。
信息来源:X:Kim (@kimmonismus)
行业动态精选
Alphabet 融资850亿美元超额认购
周一我们宣布了Alphabet的股权融资--这是我们多年投资策略的一部分,旨在抓住未来的AI机遇并支持我们看到的来自企业和消费者的需求。很高兴告诉大家,此次融资已大幅超额认购。我们共募集了约450亿美元,另将通过Q3启动的"按市价发行"计划再募集400亿美元(总计约850亿美元)。非常感谢我们的投资者,包括投资了100亿美元的伯克希尔·哈撒韦。
信息来源:X:Sundar Pichai (@sundarpichai)
观点 / 方法精选
Boson AI 与 LMSYS 发布基于 SGLang-Omni 的 Higgs Audio v3 TTS 端到端服务
Boson AI 与 LMSYS 联合推出基于 SGLang-Omni 推理框架的 Higgs Audio v3 TTS 端到端服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持 100 种语言(内部评测覆盖 111 种),在 Seed-TTS、CV3、MiniMax-Multilingual 及 Higgs-Multilingual 零样本语音克隆任务中达到单字级 WER/CER。开发者可通过文本内控制标签实时调整情感(20+种)、风格、韵律(语速/音高/停顿…
信息来源:LMSYS:Blog(Chatbot Arena 团队) · Qwen
论文研究精选
Google Research 发布被动心率监测系统 PHRM
Google Research 开发了一种被动心率监测系统(PHRM),利用智能手机前置摄像头在日常使用中(人脸解锁后数秒内)捕捉面部视频,通过深度学习估算心率,平均绝对百分比误差(MAPE)低于10%(对比心电图金标准),满足各肤色人群的行业精度标准。系统将全天心率测量整合为每日静息心率(RHR),平均绝对误差(MAE)低于5 bpm(对比可穿戴设备)。研究同时发布了迄今最大规模的公开智能手机视频数据集及预训练模型PHRM-mini,合格研究人员可申请访问。
信息来源:Google Research:Blog(网页)
论文研究精选
多伦多大学研究人员演示AI蠕虫可攻击任何联网设备
多伦多大学研究人员展示了一种人工智能蠕虫,能够主动传播并攻击任何联网设备,无需人工干预即可在系统间移动。这项研究揭示了AI驱动自主攻击的潜在威胁。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
Gemini Spark 简化日常工作流演示
参加 @GoogleDeepMind 首席工程师 @__apf__ 的演示,了解 Gemini Spark 如何帮助简化您的日常工作流程。由 Gemini 3.5 Flash 驱动,Spark 建立在 Gemini 与 @GoogleWorkspace 应用(如 Docs 和 Gmail)连接的能力之上,以执行复杂任务。
信息来源:X:Gemini (@GeminiApp) · Gemini
行业动态精选
谷歌:Gemini App 月活超 9 亿同比翻倍,是其增长最快的产品之一
谷歌母公司 Alphabet 公布投资者演示文稿显示,Gemini App 月活跃用户超 9 亿,一年内翻倍超过一倍。Gemini 已为谷歌 13 款超 10 亿用户产品提供支持,其中 5 款用户量超 30 亿(搜索、Gmail、Android、Chrome、YouTube)。谷歌搜索 AI Overviews 月活跃用户超 25 亿。自 Gemini 3 推出,核心 AI 响应成本降低 30% 以上。谷歌预计本月推出 Gemini 3.5 Pro 模型。
信息来源:IT之家(RSS) · Gemini
行业动态精选
Suno完成4亿美元D轮融资
我们激动地宣布Suno的新篇章:4亿美元D轮融资,估值54亿美元!🚀 我们的使命一直很简单:让更多人能体验制作音乐的乐趣。非常感谢我们不可思议的社区和投资者与我们共同建设。 点击此处阅读Mikey的博客:https://suno.com/blog/series-d-announcement
信息来源:X:Suno (@suno)
模型发布 / 更新精选
商汤开源SenseNova U1:视觉理解推理生成一体模型
商汤(SenseTime)开源SenseNova U1模型,宣称实现"看、思考、创作"一体--从一张普通运动鞋图片直接生成营销视觉效果。该模型代表了架构上的范式转变。用户可通过SenseNova Studio、HuggingFace和GitHub尝试使用。
信息来源:X:商汤 SenseTime (@SenseTime_AI) · Hugging Face