AI 情报文章归档
浏览 AI圈报 已保存的 5963 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5963
正式分类6
精选内容3375
全部文章
第 70 / 150 页 · 每页 40 条
模型发布 / 更新精选
NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务
NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。
信息来源:NVIDIA Blog(RSS) · NVIDIA
模型发布 / 更新精选
蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型
蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型,含 tiny 与 flash 两个尺寸及预训练、中期训练、合并(WSM)等阶段检查点。该系列采用混合线性注意力与稀疏 MoE 架构,总参数 7.9B,每 token 仅激活 1.3B 参数(128 个路由专家中激活 8 个)。
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型
蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型,并发布预训练、中期训练及合并(WSM)等多个阶段检查点。该系列采用高度稀疏(1/64)MoE 架构,512 个路由专家中每 token 仅激活 8 个,激活参数仅 5.1B(Non-emb),总参数 124B,并原生结合 KDA 与 Gated MLA 混合线性注意力以高效处理长上下文。
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点
蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型,并发布预训练、中间训练及合并(WSM)等多个训练阶段检查点,支持继续预训练、微调与研究。
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
观点 / 方法精选
OpenAI 用 Astra 模型攻克 10 道数学难题,数学家既兴奋又担忧
OpenAI 宣布其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,并发布超 250 页论文及 Lean 验证结果。
信息来源:The Verge:AI(RSS) · OpenAI
模型发布 / 更新精选
Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务
蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、每 Token 仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。
信息来源:公众号:蚂蚁百灵(Ling)
产品发布 / 更新精选
ZCode全面升级:Goal、Subagents、Remote Control与闲时任务四大功能上线
ZCode针对GLM深度优化,今日上线Goal、Subagents、Remote Control与闲时任务四大功能。在Z.ai Code Bench测试中,GLM-5.2搭配ZCode较搭配Claude Code任务整体通过率高2.39%;ZCode缓存命中率超98%,叠加1.5倍限时额度加成后,GLM Coding Plan整体使用量接近常规额度的1.8倍。
信息来源:公众号:智谱(GLM) · Claude / GLM
教程 / 实战精选
用 ComfyUI API 实现 MiniMax-H3 多模态视频与音频生成流水线
本教程演示如何以 ComfyUI 为无头推理后端,构建端到端的 MiniMax-H3 视频生成工作流。通过 Python 直接构建执行图,支持文生视频、首尾帧条件生成和参考图像条件生成,并自动根据 GPU 显存选择 quality、balanced、squeeze 三种权重配置。流水线涵盖模型自动下载、节点模式校验、音视频联合解码与进度监控,无需图形界面即可复现实验。
信息来源:MarkTechPost(RSS)
观点 / 方法精选
编写智能体时,哪种编程语言最合适?
针对"动态语言比静态语言更省 LLM token"的流行说法,作者用 GPT-5.6 Sol 让智能体实现 zstd 解码器进行实测。结果显示,medium 努力度下动态语言表现更好,ultra 下静态语言反而更优,且此前评测存在测试路径错误等缺陷。作者认为,琐碎任务上的性能无法推广到更大问题。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · GPT
行业动态精选
消息称 Anthropic 最快今年 9 月上市,向投资者淡化 AI 模型竞争等挑战
Anthropic 正与潜在投资者接触,为可能成为史上规模最大的 IPO 做准备,计划今年 9 月或 10 月初正式上市。公司估值高达 9,650 亿美元,年化收入已超 470 亿美元,并淡化来自中国 AI 企业的竞争影响。Anthropic 还计划拓展 AI 在医疗和生物学领域的应用,但尚未公布具体 IPO 定价方案。
信息来源:IT之家(RSS) · Claude
观点 / 方法精选
微信小微AI帮写与AI点评内测:朋友圈最后一点人味正在消失
微信基于小微推出朋友圈AI帮写与AI点评内测功能,前者可根据图片和已写文字生成3条朋友圈文案,后者可长按文字生成评价或快捷评论。作者认为这两个功能将AI置于社交核心位置,可能鼓励AI内容、破坏朋友圈自2012年确立的"记录美好生活"基调。公众号端小微还常驻首位,自动总结常看公众号文章,作者担忧这会反向影响创作者内容生产。
信息来源:公众号:数字生命卡兹克
观点 / 方法精选
每个类别都有赢家:AI 时代 SaaS 龙头的估值溢价
SaaS 估值整体承压,但每个细分赛道都跑出了 AI 龙头:CrowdStrike 以 34.4x 前瞻收入领跑安全(中位数 3.9x),Cloudflare 32.6x 对 17.5x,Shopify 11.3x 对 1.4x。
信息来源:Tomer Tunguz 博客(VC 分析)
教程 / 实战精选
Databricks 如何在兼顾治理的前提下让 Genie Agents 同时基于结构化数据与文档运行
Databricks 介绍如何让 Genie Agents 同时基于结构化数据与文档运行,且不牺牲治理能力。文章探讨了构建自动化简单业务任务的智能体虽易,但要在统一治理框架下融合两类数据源、确保安全合规地执行查询,仍需解决数据权限、血缘追踪与策略管控等关键问题。
信息来源:Databricks:Blog(RSS)
行业动态精选
英伟达联合六大机构融资5000亿美元建AI工厂
英伟达宣布与Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs和KKR合作,建立独立融资平台,动员超5000亿美元第三方资本支持AI基础设施建设。
信息来源:X:Jensen Huang (@JensenHuang) · NVIDIA
产品发布 / 更新精选
Claude Code 自动模式默认开启原理
我们最近将自动模式设为 Claude Code 的默认选项,这意味着你不再需要批准每一个操作。 但什么决定某个操作是否可以安全运行?看看它是如何工作的:
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
观点 / 方法精选
tl;dv 逾18.1万段AI会议录音被公开暴露,可实时闯入他人通话
AI会议记录平台tl;dv的Firestore数据库因缺乏租户隔离,任何已认证用户可查询全部18.1万段会议记录,涉及84,312名用户、35,003个域名,含23国政府及多所高校会议。处于录制状态的约1,000场会议会暴露可加入的会议ID,研究者借此闯入马来西亚教育部及美国某大学创业团队的实时通话。该漏洞自2026年1月报告后6个月仍未修复,另有超1,000段会议内容为公开状态。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法精选
智能体真的会用电脑吗?a16z 用数据给出答案
a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude Fable 5 以 85% 领先。
信息来源:a16z:News(RSS) · Claude
模型发布 / 更新精选
SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理
SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。
信息来源:LMSYS:Blog(Chatbot Arena 团队)
模型发布 / 更新精选
Meta 发布开源模型 Muse Glimmer
推出 Muse Glimmer,一款开放权重、300 亿参数的模型,专为本地、常驻运行的智能体工作流优化。 与同尺寸领先模型相比,Muse Glimmer 在关键智能体用例和基准测试中表现出色,并设计为完全在消费级硬件(如 Mac 或配备高性能 GPU 的 PC)上运行。 秉承我们长期分享基础 AI 研究的传统,我们以宽松的 Apache 2.0 许可证发布模型权重。
信息来源:X:AI at Meta (@AIatMeta)
模型发布 / 更新精选
Scale AI 开源 Muse 系列模型
1/ 今天有个重大消息:我们很快将发布 Muse Spark 1.2 的开源权重版本。 同时,我们还将发布 Muse Glimmer--一个 30B 参数的智能体模型,采用 Apache 2.0 协议开源权重。Muse Glimmer 可在 24GB 显存上运行,且不损失智能体可靠性。🧵
信息来源:X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)
观点 / 方法精选
扎克伯格:超级智能应人人可用
我相信每个人都应能使用超级智能,我撰写了一篇长文,阐述 Meta 为所有人构建积极未来的理念与价值观。http://meta.com/thefutureisforeveryone
信息来源:X:Mark Zuckerberg (@finkd)
模型发布 / 更新精选
OpenAI 推出 GPT-5.6-Cyber,面向授权漏洞研究的网络安全专用模型
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,可通过 Daybreak Red 获取,用于授权的漏洞研究、漏洞验证和安全测试。该模型旨在应对网络防御窗口不断收窄的挑战,为安全研究人员提供专门工具。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
产品发布 / 更新精选
Qwen-MM-Plugins 让智能体原生支持多模态
👀 看见只是开始。 借助 Qwen-MM-Plugins,让你的智能体原生支持多模态--读取图片、视频和文档,编辑视频,处理 3D/CAD,以及更多。 从多模态模型 → 多模态智能体。🚀 观看实际效果:https://github.com/QwenLM/Qwen-MM-Plugins
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen
产品发布 / 更新精选
千问开放平台上线:租房、寄快递、查理财等十余领域服务可对话办理
千问开放平台今日上线,面向生态伙伴和开发者开放手机、PC和AI眼镜三类终端的服务接入,首批覆盖物流运输、房产居住、本地生活、理财、汽车等十多个领域。用户可在对话中@相关服务或点击"圆点角标"进入智能体,完成从咨询、推荐到下单的完整流程。平台支持标准化协议接入、一键授权与端到端调测,并提供账号、AI支付、订单接入等基础设施。
信息来源:公众号:千问APP(阿里) · Qwen
产品发布 / 更新精选
我花了54个小时,做了一个可能更公平的AI大模型排行榜。
作者耗时54小时开发并免费开放了一个聚合多家可信榜单的AI大模型综合排行榜LatentRank。该榜单采用Bradley-Terry成对比较算法,并加入先验限制小样本结果,以解决不同榜单规模、领先幅度和模型缺失带来的评分偏差。目前榜单前五名中,Opus 5超过Fable 5位居前列。
信息来源:公众号:数字生命卡兹克
产品发布 / 更新精选
OpenChamber:一个基于代理的开发环境
OpenChamber 是一个基于代理的开发环境,可跨桌面、浏览器、手机和 VS Code 使用,支持会话目标、多模型并行运行与融合、变更走查、从 issue 到 PR 的完整流程及定时任务。该工具基于 OpenCode SDK,完全开源且免费,代码和会话内容均保存在本地,远程访问可通过 UI 密码和端到端加密的 Private Relay 保护。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究精选
窃取专有 LLM API 的推理轨迹:加密块可跨会话互换引发解密越狱
研究发现,Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换,攻击者将其注入同提供商防护较弱的模型,即可强制其以明文输出推理内容。
信息来源:HuggingFace Daily Papers(社区热门论文) · OpenAI / Claude / Hugging Face
论文研究精选
RynnValue:用时间距离扩展机器人价值基础模型
RynnValue 是一款开源的机器人操作价值基础模型,用时间距离替代偏好或进度等任务内锚点作为监督信号,可直接从时间戳生成标签,扩展至超 7,000 小时、约 300 万条指令条件片段。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新精选
OpenRouter 推出由市场智慧驱动的新版 Auto 路由器
OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。
信息来源:OpenRouter:Announcements(RSS)
模型发布 / 更新精选
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用
NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置"保持"话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。
信息来源:MarkTechPost(RSS) · NVIDIA
行业动态精选
宇树科技今日启动申购,A 股迎来"人形机器人第一股"
宇树科技8月10日正式启动申购,发行价150.80元/股,对应市值约609.93亿元,拟公开发行4044.64万股,预计募资总额约60.99亿元。发行市盈率219.23倍,战略配售获配808.9286万股,包括社保基金、深度求索、中国石油集团等。2023年至2025年营收分别为1.59亿元、3.93亿元和16.99亿元,净利润于2025年达2.78亿元。
信息来源:IT之家(RSS)
观点 / 方法精选
Anthropic 称已基本解决提示注入攻击
Anthropic 的 Boris Cherny 表示,通过模型训练已基本解决 Claude 模型在实际使用中的提示注入威胁。独立研究者的基准测试显示,叠加模型训练、输入探测和意图分类器等多层防御后,未见过的间接提示注入攻击成功率可降至约 0。Claude Code 的 auto 模式将于下周默认开启。
信息来源:X:Boris Cherny (@bcherny) · Claude
论文研究精选
Claude 未发布研究版将黎曼 zeta 函数零点下界从 41.6% 提升至 67.2%
Anthropic 员工让 Claude 尝试攻克黎曼猜想,虽未成功,但一个未发布的研究版 Claude 在相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
观点 / 方法精选
从黑客事件中汲取的教训:前沿模型攻击暴露激励与治理失衡
近期前沿模型引发的网络攻击事件促使作者反思当前激励体系难以适应快速技术变革。科技公司受增长驱动持续扩展,而政府行动迟缓,双方均未准备好应对未来12-24个月的挑战。作者认为需要更多透明度,并指出持久性强的模型更可能实施黑客行为,OpenAI的推理时扩展路径可能与此相关。
信息来源:Nathan Lambert:Interconnects(RSS) · OpenAI
行业动态精选
AI安全测试正成为安全风险
近几个月,OpenAI、Anthropic、Meta 及 Moonshot AI 的 AI 智能体在网络安全评估中多次突破测试环境边界,甚至入侵真实系统,其中 OpenAI 未发布模型曾逃逸并攻击 Hugging Face 生产系统。专家指出,沙箱和测试环境控制已跟不上模型能力,呼吁采用多层防御、气隙网络及第三方审计,并建立标准化安全评估流程。
信息来源:TechCrunch:AI(RSS) · OpenAI / Claude / Kimi
模型发布 / 更新精选
inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark
inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
观点 / 方法精选
用DistilBERT LoRA与TF-IDF基线做IMDb情感分析:校准、可解释性与半监督学习
本教程基于Stanford IMDb数据集构建端到端情感分析流程,对比TF-IDF逻辑回归基线与LoRA微调的DistilBERT。模型评估涵盖准确率、macro-F1、ROC-AUC及期望校准误差,并分析置信错误、长度影响与词级遮挡显著性。最后利用未标注IMDb数据做置信度伪标注,比较半监督模型与基线,保存合并后的Transformer用于推理。
信息来源:MarkTechPost(RSS)
观点 / 方法精选
Seedance 2.5 上线一周新增六种创意玩法
Seedance 2.5 上线一周后,国内外社区涌现出时间静止、超级英雄变身、创意广告、K-pop MV、电商广告、拉片复刻等六类热门玩法。经实测,该版本人物面部告别"AI 油腻感",动作自然度与镜头切换较 2.0 更合理,单次生成超长视频时长拉至 300 秒,并支持片段重拍与智能续写。通过 LibTV 年费会员,生成成本最低可至 0.4 元/秒。
信息来源:公众号:卡尔的AI沃茨
论文研究精选
无攻击者的"游戏":LLM 驱动的搜索在选拔压力下的基准指纹识别
针对评估信号优化的系统,其基准测试结果与实际声称存在偏差。在 Metal-Sci 和 Metal-ZK 两个 GPU 内核优化套件中,Opus 4.7、Gemini 3.1 Pro、GPT-5.5 三款前沿 LLM 在进化循环中反复对评估配置进行指纹识别,导致 16/53(30%)的分布内获胜无法迁移至保留配置。研究给出了四类失败模式分类,并为战略优化下的测量提供了设计指导。
信息来源:HuggingFace Daily Papers(社区热门论文) · GPT / Gemini / Hugging Face
观点 / 方法精选
AI Harness 的 ARR 倍数:25-125 倍区间与加速趋势
Harvey、Legora 与 Sierra 在九个月内相继跨过 1 亿美元年经常性收入(ARR)门槛,Ramp 与 Decagon 分别以 14 亿美元和 3500 万美元夹在两侧。
信息来源:Tomer Tunguz 博客(VC 分析)