AI 情报文章归档
浏览 AI圈报 已保存的 5584 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5584
正式分类6
精选内容3485
全部文章
第 129 / 140 页 · 每页 40 条
模型发布 / 更新精选
Meta Adaptive Ranking Model:弯曲推理扩展曲线,为广告提供LLM规模模型服务
Meta将其广告推荐系统的运行时模型扩展至LLM的规模和复杂度,旨在更深入理解用户兴趣与意图,以提升广告效果。这一举措通过自适应排序模型,优化了推理阶段的扩展曲线,使部署大规模模型服务成为可能,标志着推荐系统性能向新前沿迈进。
信息来源:Meta Engineering Blog(RSS)
模型发布 / 更新精选
Granite 4.0 3B Vision:面向企业文档的紧凑型多模态智能
IBM Granite团队发布了Granite 4.0 3B Vision模型,这是一个专为企业文档处理设计的紧凑型多模态大语言模型。该模型参数为30亿,具备视觉理解能力,能够同时处理文本和图像信息,特别针对报告、表格、图表等企业文档进行优化。其紧凑尺寸旨在降低部署和运行成本,使企业能够在资源受限的环境中高效实现文档智能分析、信息提取和知识管理。模型已在Hugging Face平台发布。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
行业动态精选
加速 AI 下一阶段发展
OpenAI 获 1220 亿美元新融资,用于全球扩展前沿 AI、投资下一代算力,满足 ChatGPT、Codex 及企业 AI 的需求增长。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
模型发布 / 更新精选
KwaiKAT发布KAT-Coder-Pro V2:非推理代码模型性能比肩Claude Sonnet 4.6
KwaiKAT发布非推理代码模型KAT-Coder-Pro V2,在Artificial Analysis Intelligence Index获44分,较V1提升8分,与Claude Sonnet 4.6持平。该模型token效率显著,运行仅需约9M输出token,远低于Claude系列及DeepSeek等推理模型。Agent能力大幅提升,Terminal-Bench Hard得分49%(提升40个百分点),匹配Claude Opus 4.6。成本降至73美元,响应速度达…
信息来源:X:Artificial Analysis (@ArtificialAnlys) · DeepSeek / Claude
论文研究精选
以165美元成本训练25个物种的mRNA语言模型:构建从结构预测到密码子优化的AI流程
OpenMed团队构建了一个覆盖蛋白质结构预测、序列设计和密码子优化的端到端AI流程。在密码子优化环节,CodonRoBERTa-large-v2模型以4.10的困惑度和0.40的斯皮尔曼CAI相关性显著优于其他架构。研究将训练扩展至25个物种,仅用55个GPU小时训练了4个生产级模型,并建立了独特的物种条件化系统,实现了从蛋白质概念到合成就绪DNA序列的快速转化。完整代码与实验结果已开源。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
产品发布 / 更新精选
ADK Go 1.0 正式发布:迈向生产就绪的多智能体开发框架
Agent Development Kit (ADK) for Go 1.0 版本正式发布,标志着其从实验性脚本转向生产就绪的服务框架。本次更新核心在于强化可观测性、安全性与可扩展性,主要特性包括:原生集成OpenTelemetry以实现深度追踪;支持自愈逻辑的新插件系统;在敏感操作中引入"人在回路"安全确认机制。此外,新版本提供了基于YAML的配置以加速迭代,并优化了Agent2Agent协议,以支持跨编程语言的智能体无缝通信。该框架使开发者能够依托Go语言的高性能工程标…
信息来源:Google Developers Blog(RSS)
教程 / 实战精选
Boost Training Goodput: 连续检查点功能如何优化 Orbax 和 MaxText 的训练可靠性
Orbax 和 MaxText 引入了连续检查点新功能,旨在优化模型训练中可靠性与性能的平衡。它改变了传统固定频率检查点的模式,通过在前一个保存操作成功完成后才异步启动新操作,最大化I/O带宽并降低故障风险。基准测试表明,该方法显著缩短了检查点间隔,并实现了可观的资源节约,这在平均故障间隔时间较短的大规模训练任务中效果尤为突出。
信息来源:Google Developers Blog(RSS)
行业动态精选
AI助力美国产水泥与混凝土
Meta发布了名为贝叶斯优化的新AI模型,用于设计混凝土配比。该模型旨在帮助建筑行业生产更高质量、更可持续的混凝土混合物,并特别聚焦于美国本土生产的产品。此次发布与2026年美国混凝土学会春季大会同步进行,是Meta长期路线图的一部分,旨在推动建筑业利用人工智能优化材料性能与环保指标。
信息来源:Meta Engineering Blog(RSS)
观点 / 方法精选
This is a very good post:
这是一篇很好的文章: 【引用 @boazbaraktcs】:新博客文章:AI 安全现状,四张假图。https://t.co/Qv1BlwyfY5
信息来源:X:Sam Altman (@sama)
论文研究精选
Introducing Critique, a new multi-model deep research system in M365 Copilot. You can use multiple …
介绍 Critique,M365 Copilot 中全新的多模型深度研究系统。 你可以同时使用多个模型来生成最佳回复和报告。https://t.co/m4RlQmCKzs
信息来源:X:Satya Nadella (@satyanadella)
模型发布 / 更新精选
LongCat-AudioDiT-1B:高保真波形潜空间扩散式文本转语音模型
美团 LongCat 团队开源的扩散式 TTS 模型摒弃传统的 mel-spectrogram 中间表示,直接在波形潜空间操作,仅通过 Wav-VAE 与扩散骨干网络即可合成语音。该模型修复了训练-推理不匹配问题,并以自适应投影引导替代无分类器引导。最大版本 3.5B 在 Seed 基准实现 SOTA 零样本语音克隆,说话人相似度(SIM)在 Seed-ZH 达 0.818、Seed-Hard 达 0.797,超越此前最优的 Seed-TTS。研究还发现 Wav-VAE 的…
信息来源:美团 LongCat:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
分享我最喜爱的 Claude Code 隐藏功能与冷门特性
作者准备介绍一系列 Claude Code 中隐藏且未被充分利用的功能,重点分享个人日常使用最多的那些。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
Google 发布 Java 智能体开发套件 (ADK) 1.0.0 版本
Google 正式发布了 Java 版智能体开发套件 (ADK) 的 1.0.0 版本。该版本引入了多项关键功能:支持接入 Google Maps 数据、内置 URL 抓取工具,以及用于跨框架协作的标准化 Agent2Agent 协议。其全新的"App"和"Plugin"架构增强了控制能力,实现了全局日志记录、通过事件压缩自动管理上下文窗口,以及需要人工确认的"Human-in-the-Loop"工作流。此外,该版本深度集成 Google Cloud 服务(如 Firest…
信息来源:Google Developers Blog(RSS)
模型发布 / 更新精选
Qwen3.5-Omni:全面扩展,迈向原生全模态 AGI
Qwen Studio 发布,集成聊天机器人、图像视频理解、图像生成、文档处理、网页搜索、工具使用及 Artifacts 功能,提供全模态 AI 一站式解决方案。
信息来源:Qwen:Blog Retrieval(API) · Qwen
观点 / 方法精选
人类24小时可从规则构建3000 Elo国际象棋引擎
作者以"Glurg"游戏(实为 chess)假设情境论证:借助现有外部认知基础设施(计算机、互联网等),人类顶尖团队能在24小时内从规则解析开发出3000 Elo引擎,三周内可达3500 Elo且计算效率提升10倍。这表明人类智能已具备即时掌握复杂策略系统的能力,而非从零缓慢进化。该论述回应了关于现实世界更接近 chess 而非 Go 的争论,强调人类利用工具扩展认知边界的即时优势。
信息来源:X:Francois Chollet (@fchollet)
论文研究精选
Don Knuth 使用 AI 完全解决哈密顿分解问题奇偶情况
Don Knuth 借助 AI 完全解决哈密顿分解问题的奇偶情况。Opus 4.6/5.4 Pro 完成偶数情形证明,以 Lean 形式化验证并生成 14 页论文。Knuth 感叹:"我们确实生活在非常有趣的时代。"
信息来源:X:Deedy Das (@deedydas)
论文研究精选
当前前沿模型视觉理解的幻象
当前前沿多模态大模型在标准胸部X光问答基准测试中,无需访问任何图像即可获得顶级排名。这一反常现象暴露出模型视觉理解能力的严重缺陷,表明其性能可能依赖数据偏见或文本线索而非真实的图像解析能力。研究揭示了现有视觉语言模型评估体系的深层漏洞,指出所谓"视觉理解"可能只是缺乏真实感知能力的幻觉。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS)
模型发布 / 更新精选
LLM双向论证:从完善观点到被彻底推翻
推主先用LLM花费数小时精心完善博客论点,随后要求其论证相反立场,结果原观点被彻底推翻。这揭示了LLM具备强大的双向论证能力,可令人信服地支持几乎任何立场。这种特性使其成为有效的思维训练工具:通过主动寻求对立观点,可突破认知盲区,形成更独立的判断。但需警惕模型的sycophancy倾向,避免被其迎合性论证误导。
信息来源:X:Andrej Karpathy (@karpathy)
观点 / 方法精选
Codex use cases:面向人类的 Skills
OpenAI 推出 Codex use cases 示例库,涵盖编程与非编程任务的实用场景。用户可在 Codex 应用中直接打开各用例的 starter prompt 开始使用。
信息来源:X:Greg Brockman (@gdb) · OpenAI
模型发布 / 更新精选
构建做实事的语音代理
用 gpt-realtime-1.5 为新加坡诊所打造接待员演示,支持与患者自然对话,自动收集就诊信息并完成实时预约,展示语音代理在实际场景中的工作能力。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI / GPT
论文研究精选
Codex 插件?我们已为你搞定。
OpenAI Codex 推出插件使用案例库,涵盖 iOS 应用构建、数据集分析和报告生成等场景。支持一键在应用中打开,直接开始开发。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI
论文研究精选
Composer 2技术报告:面向智能体软件工程的代码模型训练
本报告介绍了代码模型Composer 2的训练过程。该模型基于开源基础模型Kimi K2.5,通过两阶段训练:首先进行侧重代码的持续预训练以深化编码知识,随后在高度模拟真实Cursor环境的大规模强化学习中提升端到端智能体性能。在自建的真实任务评估集CursorBench上,Composer 2得分为61.3,较前代提升37%,与前沿模型性能相当。在公开基准SWE-bench Multilingual和Terminal-Bench上分别获得73.7和61.7分,并在保持高精…
信息来源:Cursor Blog · Kimi / Cursor
观点 / 方法精选
直接开搞就行
Codex 已重置所有套餐的使用限制,方便用户体验新推出的插件。现在可以无限制地使用 Codex 构建项目,尽情尝试。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI
观点 / 方法精选
Codex 正式上线 Plugins 功能
Codex 正式上线 Plugins 功能,开箱即用支持 Slack、Figma、Notion、Gmail 等主流开发工具,开发者可直接在 Codex 中调用这些服务。
信息来源:X:Greg Brockman (@gdb)
观点 / 方法精选
Codex 推出插件功能
Codex 正式上线插件系统,开箱即用地支持 Slack、Figma、Notion、Gmail 等开发者常用工具。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI
教程 / 实战精选
Gemini 3.1 Flash Live 是迄今最高质量的音频与语音模型,也是构建下一代语音优先智能体的重要飞跃:更低延迟、更高精度、更自然的交互……现可在 Gemini App 通过 Gemini Live 体验,或在 Google AI Studio 中开发
Google 发布 Gemini 3.1 Flash Live,称其迄今最高质量音频模型,具备更低延迟、更高精度和更自然的对话体验,改进了函数调用能力。现已在 Gemini App 和 Google AI Studio 上线。
信息来源:X:Demis Hassabis (@demishassabis) · Gemini
产品发布 / 更新精选
Stripe Projects:让 AI 自动完成 DevOps 全流程
构建现代应用的最大挑战并非代码本身,而是 DevOps 中繁琐的服务集成、API 密钥管理和部署配置。作者期待未来 AI 智能体能自动完成从文档阅读到生产环境部署的全流程,无需人工点击网页或手动配置。Stripe 推出的 Projects 正是朝此方向迈进:开发者可通过 CLI 命令自动配置 PostHog 等第三方服务,实现账户创建、密钥获取和计费设置的自动化,真正将基础设施生命周期转化为代码。
信息来源:X:Andrej Karpathy (@karpathy)
模型发布 / 更新精选
Gemini 3.1 Flash Live 发布
Gemini 3.1 Flash Live 音频模型发布,支持更自然的实时对话,函数调用能力改进,使 AI 助手更实用、信息获取更充分。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
Gemini Live 迎来迄今最大升级,由 Gemini 3.1 Flash Live 驱动
Gemini Live 底层升级为 Gemini 3.1 Flash Live,响应更快且减少停顿,支持双倍时长对话保持连贯,可根据场景动态调整回答长度和语气。
信息来源:X:Gemini (@GeminiApp) · Gemini
模型发布 / 更新精选
Gemini 3.1 Flash Live 是迄今最高质量的音频和语音模型
Gemini 3.1 Flash Live 发布,为 Google 迄今最高质量音频语音模型,精度和推理能力显著提升,交互更自然直观。现已在 Google AI Studio 通过 Gemini Live API 预览版上线。
信息来源:X:Sundar Pichai (@sundarpichai) · Gemini
模型发布 / 更新精选
Gemini 3.1 Flash Live:让音频 AI 更自然、更可靠
Gemini 3.1 Flash Live 已上线 Google 全系产品,提供更自然、可靠的实时音频 AI 交互能力。
信息来源:Google Blog:AI(RSS) · Gemini
论文研究精选
OpenAI发布GPT-5.4 mini与nano轻量模型
OpenAI发布GPT-5.4 mini与nano轻量模型,保留多档推理能力与400K上下文窗口,价格降至$0.20/$1.25每百万token。基准测试显示,GPT-5.4 nano在τ2-Bench等多项测试中领先Claude Haiku 4.5与Gemini 3.1 Flash-Lite Preview,但幻觉率较高且token消耗量大。得益于极低单价,nano在Intelligence Index测试中的有效成本反而低于竞品,展现出优秀的性价比优势。
信息来源:X:Artificial Analysis (@ArtificialAnlys) · OpenAI / GPT / Claude
观点 / 方法精选
通过实时强化学习改进Composer编码模型
Cursor团队将实时强化学习技术应用于Composer编码模型,利用真实用户交互产生的推理令牌作为训练信号,以解决模拟环境与真实使用间的匹配问题。该技术使团队能够以每五小时一次的频率部署改进后的模型检查点。通过A/B测试,新版本实现了关键指标提升:代理编辑在代码库中的持久性增加2.28%,用户不满意后续减少3.13%,延迟降低10.3%。实时RL也带来了奖励黑客等新挑战,但真实用户反馈有助于识别和修正此类问题。
信息来源:Cursor Blog · Cursor
教程 / 实战精选
工程博客更新:我们如何设计 Claude Code auto mode
Anthropic 工程博客发文介绍 Claude Code auto mode 的设计思路。该模式作为无需人工确认和完全手动之间的安全中间方案,通过构建并测试分类器来替代人工审批决策。
信息来源:X:Anthropic (@AnthropicAI) · Claude
论文研究精选
AIによるAI研究の実現へ:AIサイエンティスト論文がNature誌に掲載
信息来源:Sakana AI:Blog(网页)
模型发布 / 更新精选
适合深夜2点专注工作的完美背景音乐--由 Lyria 3 Pro 全新打造。Google AI 订阅者…
Google DeepMind 推出 Lyria 3 Pro,可生成最长3分钟的高保真音乐,支持自由编排前奏、主歌、副歌与桥段。Google AI 订阅者现可在 Gemini App 体验,开发者也能通过 Google AI Studio API 接入创作。
信息来源:X:Demis Hassabis (@demishassabis) · Gemini
模型发布 / 更新精选
Claude 工作工具现已登陆移动端
Claude 移动端现已集成工作工具,支持在手机上直接查看 Figma 设计、创建 Canva 幻灯片及浏览 Amplitude 仪表盘,实现跨端协作功能。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
所有 LLM 个性化功能的通病:记忆对模型来说过于干扰
LLM 的记忆功能存在过度联想问题:两个月前随口一问会被当作深度兴趣永久存档,并在后续对话中反复提及,显得过于刻意且造成不必要的干扰。
信息来源:X:Andrej Karpathy (@karpathy)
模型发布 / 更新精选
基于 Lyria 3 构建:全新音乐生成模型开放预览
Lyria 3 音乐生成模型现已开放付费预览,开发者可通过 Gemini API 调用,或在 Google AI Studio 免费测试。
信息来源:Google Blog:AI(RSS) · Gemini
观点 / 方法精选
深入解析我们构建 Model Spec 的方法
OpenAI 公开 Model Spec 行为框架,阐述如何在安全、用户自由与问责制之间取得平衡,为 AI 系统发展提供可公开查阅的行为指导原则。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI