AI 情报文章归档
浏览 AI圈报 已保存的 5614 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5614
正式分类6
精选内容3499
全部文章
第 126 / 141 页 · 每页 40 条
观点 / 方法精选
OpenRouter Agent SDK 发布 `create-agent-tui` 与 `create-headless-agent` 技能,可快速搭建个性化编码智能体
OpenRouter Agent SDK 推出 `create-agent-tui` 和 `create-headless-agent` 两类技能(skills),用于快速搭建(scaffold)个性化编码智能体。前者提供终端 UI(terminal UI),后者为无头模式(headless),适用于脚本和流水线(scripts and pipelines)。
信息来源:OpenRouter:Announcements(RSS)
教程 / 实战精选
使用Agent SDK搭建自定义编码智能体
OpenRouter Agent SDK 提供 create-agent-tui 和 create-headless-agent 两种技能,可在几分钟内脚手架搭建个性化编码智能体。前者附带终端 UI,后者为无头模式,适用于脚本与管道自动化场景。
信息来源:OpenRouter:Announcements(RSS)
产品发布 / 更新精选
Agent SDK:在 OpenRouter 上构建多轮智能体工作流
OpenRouter 发布 Agent SDK,其核心是 callModel 函数。该函数可将一次聊天完成转化为具备工具调用、停止条件与成本追踪功能的多步骤智能体工作流。这一工具兼容平台上的 300 多个模型,使开发者能够便捷地构建复杂的多轮交互智能体应用。
信息来源:OpenRouter:Announcements(RSS)
产品发布 / 更新精选
OpenRouter Agent SDK:构建多轮智能体工作流
OpenRouter Agent SDK 提供 callModel 函数,将单次聊天补全转换为支持工具调用、停止条件与成本追踪的多步智能体工作流,覆盖 300 多个模型。
信息来源:OpenRouter:Announcements(RSS)
行业动态精选
Anthropic与NEC合作,共建日本最大AI工程团队
Anthropic与NEC达成战略合作,旨在打造日本规模最大的AI原生工程团队。NEC将成为Anthropic在日本的首个全球合作伙伴,为集团全球约3万名员工部署Claude AI工具。双方将针对金融、制造和地方政府等领域,联合开发安全的行业专用AI解决方案,并将Claude集成到NEC的安全运营中心及下一代网络安全服务中。NEC内部将设立卓越中心,通过技术培训构建AI工程团队,并广泛应用Claude Code等工具。目前,全球员工的工具部署与行业解决方案的联合开发已同步启…
信息来源:Anthropic:Newsroom(网页) · Claude
模型发布 / 更新精选
DeepSeek-V4 预览版上线,百万上下文成标配
DeepSeek-V4 预览版正式上线并开源,拥有 1M 超长上下文,Agent 能力、世界知识和推理性能均达国内与开源领先水平。模型分 V4-Pro 与 V4-Flash 两版,API 已同步更新,支持 OpenAI 与 Anthropic 接口,最大上下文均为 1M,并支持思考模式与 reasoning_effort 参数。
信息来源:公众号:DeepSeek(深度求索) · OpenAI / DeepSeek / Claude
模型发布 / 更新精选
DeepSeek-V4:智能体可实际使用的百万token上下文
DeepSeek发布新一代模型DeepSeek-V4,其核心突破在于实现了长达百万token的上下文窗口,并确保智能体能够有效利用这一扩展的上下文能力。该模型延续了通过开源与开放科学推动人工智能发展与普及的使命,标志着大模型在长上下文理解和实际应用方面迈出重要一步。
信息来源:Hugging Face:Blog(RSS) · DeepSeek / Hugging Face
产品发布 / 更新精选
Claude 代码工具 v2.1.119 版本更新
Claude 代码工具发布 v2.1.119 版本,带来多项功能优化与问题修复。主要更新包括:用户配置现持久化至本地文件;新增 `prUrlTemplate` 设置以自定义 PR 徽章链接;`--from-pr` 命令扩展支持 GitLab、Bitbucket 等多个平台。工具权限与交互行为在多处实现统一,例如 `--print` 模式现在遵从代理的前置元数据定义。界面体验获得改进,如斜杠命令建议会高亮匹配字符,长描述自动换行。此外,本次更新修复了大量已知问题,涉及粘贴格式…
信息来源:Claude Code:GitHub Releases(RSS) · Claude
模型发布 / 更新精选
未来的标志:GPT-5.5
OpenAI 发布了新一代模型 GPT-5.5。其上下文窗口从 GPT-5 的 128K 大幅扩展至 512K,推理速度提升约 40%,在多模态理解与代码生成基准测试中表现显著超越前代。模型在复杂指令遵循和长文档处理方面能力突出,同时 API 调用成本降低了 30%。这一升级被视为通向通用人工智能(AGI)道路上的一个重要里程碑。
信息来源:Ethan Mollick:One Useful Thing(RSS) · OpenAI / GPT
观点 / 方法精选
通过半官方Codex后门API为GPT-5.5生成"骑自行车的鹈鹕"
尽管GPT-5.5的官方API尚未发布,但作者利用OpenAI为OpenClaw等工具开放的订阅集成机制,通过反向工程开源Codex CLI,开发了一个LLM插件。该插件允许付费订阅用户通过Codex后端API调用GPT-5.5模型。文章以生成"骑自行车的鹈鹕"SVG图像为例,展示了其使用效果,并指出高推理强度设置能显著提升输出质量,但耗时更长。目前,OpenAI表示正与合作伙伴制定API大规模服务的安全要求。
信息来源:Simon Willison 博客 · OpenAI / GPT
模型发布 / 更新精选
OpenAI 发布 GPT-5.5,宣称其为"新型智能"并实现 API 价格翻倍
OpenAI 正式推出 GPT-5.5,该模型被定义为一种代理模型,能够通过自主切换多种工具来完成复杂任务。公司宣称其代表了一种"新型智能"。与此同时,GPT-5.5 的 API 调用价格将提升至原来的两倍。
信息来源:The Decoder:AI News(RSS) · OpenAI / GPT
模型发布 / 更新精选
小米发布 MiMo-V2.5-TTS 系列与 ASR,覆盖语音合成与识别
小米正式发布 MiMo-V2.5-TTS Series 与 MiMo-V2.5-ASR,覆盖语音识别与合成两大能力。TTS 系列含三款模型,支持风格指令遵循与音频标签控制,其中 VoiceDesign 可零参考音频生成新音色,VoiceClone 仅需数秒参考音频即可复刻音色;ASR 在中英双语、中文方言、强噪音等场景达业界领先水平。
信息来源:公众号:小米 MiMo
产品发布 / 更新精选
OpenAI 发布开源模型,可去除文本中的个人数据
OpenAI 推出开源模型 Privacy Filter,专门用于检测和编辑文本中的个人数据。该模型能自动识别敏感信息并进行处理,以帮助减少隐私泄露风险,适用于需要数据脱敏的场景。
信息来源:The Decoder:AI News(RSS) · OpenAI
模型发布 / 更新精选
GPT-5.5正式发布
OpenAI推出迄今最智能的GPT-5.5模型,其速度更快、能力更强,专为处理跨工具的复杂任务而构建。该模型在编程、学术研究与数据分析等领域表现出显著提升,能够高效整合多工具工作流,旨在应对更高阶的专业需求。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
教程 / 实战精选
如何使用Codex进行日常工作
该内容探索了10个实用的ChatGPT Codex用例,旨在自动化任务、创建交付物,并将真实的输入转化为跨工具、文件和工作流的输出。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
模型发布 / 更新精选
Hy3 preview发布并开源:混元重建后首个模型,Agent能力大幅提升
信息来源:公众号:腾讯混元
模型发布 / 更新精选
混元迄今最智能的模型:腾讯发布并开源 Hy3 preview 语言模型
腾讯发布并开源其混元系列迄今最智能的Hy3 preview语言模型。该模型采用快慢思考融合的混合专家架构,总参数达2950亿,最大支持256K上下文长度。作为基础设施重建后首个模型,其在复杂推理、指令遵循、代码等能力上实现大幅提升,已应用于元宝、QQ、腾讯文档等内部产品,并支持OpenClaw等开源智能体。腾讯云同步推出API服务,输入价格最低每百万tokens 1.2元,同时提供个人版Token Plan套餐,月费最低28元可获3500万tokens额度。
信息来源:IT之家(RSS)
行业动态精选
Model S/X 产线将为特斯拉 Optimus 机器人让路,最早 7 月投产
特斯拉CEO马斯克确认,Optimus人形机器人将于7月下旬或8月在弗里蒙特工厂投产。为此,Model S和X的生产线将在5月上旬停产后被彻底拆除,并在4个月内切换为Optimus生产线,马斯克称此速度"快得惊人"。Optimus涉及超10000个独特零部件,初期产量将"相当缓慢",难以预测。此外,得州超级工厂的第二座Optimus工厂预计2027年夏季投产,将生产第四代机型。原定2026年第一季度亮相的第三代Optimus可能推迟至今年年中发布。
信息来源:IT之家(RSS)
行业动态精选
谷歌确认基于 Gemini AI 的苹果新版 Siri 今年亮相
谷歌云首席执行官在谷歌Cloud Next 26大会上确认,基于Gemini AI技术构建的新一代苹果Siri将于2026年发布。双方合作源于2026年1月签署的多年期协议,谷歌作为首选云服务商提供核心技术支持。该交易年价值约10亿美元,协议严格限制谷歌接触用户数据以保障隐私。技术层面,苹果正通过知识蒸馏将大型Gemini模型精简为可在iPhone等设备端运行的版本,旨在降低云端依赖并提升响应速度。
信息来源:IT之家(RSS) · Gemini
产品发布 / 更新精选
使用 LiteRT 与 NPU 构建现实世界中的设备端人工智能
LiteRT 是一个生产就绪的框架,旨在帮助移动开发者充分发挥神经处理单元(NPU)的效能,以突破传统 CPU 或 GPU 在性能与电池续航上的瓶颈。该框架通过提供统一的 API 来屏蔽底层硬件复杂性,已成功助力 Google Meet、Epic Games 等行业领先者高效部署复杂的 AI 模型,实现实时视频处理、动画生成与语音识别等高级功能。此外,平台还提供基准测试工具并具备跨平台兼容性,能够支持 AI 应用无缝部署于移动设备、AI PC 及工业物联网硬件等多种终端。
信息来源:Google Developers Blog(RSS)
教程 / 实战精选
如何在 Chrome 扩展中使用 Transformers.js
本文介绍在 Chrome 扩展中集成 Transformers.js 库的具体方法,涵盖从环境配置、模型加载到前后端通信的关键步骤。通过示例代码演示了如何利用该库在扩展中实现本地机器学习推理,同时处理扩展权限限制与安全策略。文中还对比了 Web Worker 与 Service Worker 两种部署方案,并提供了性能优化建议,帮助开发者在浏览器扩展环境中高效运行 Transformer 模型。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Ling-2.6-flash 发布:更快响应、更强执行、更高 Token Efficiency
针对智能体任务中Token消耗快速增长的问题,Ling-2.6-flash模型正式发布。该模型采用混合线性架构等技术进行系统性优化,旨在实现更高推理效率和更低使用成本。其推理速度在4卡H20条件下最快可达340 tokens/s,在Artificial Analysis评测中仅消耗约对比模型1/10的Tokens。模型在多个Agent相关基准测试中达到同尺寸SOTA水平,保持了强大的任务执行与工具调用能力。
信息来源:蚂蚁百灵:Developer Blog(网页)
模型发布 / 更新精选
Grok Voice Think Fast 1.0:xAI发布旗舰语音模型,专为复杂工作流设计
xAI发布旗舰语音模型Grok Voice Think Fast 1.0,专为客服、销售等领域的复杂多步骤工作流打造。该模型在τ-voice Bench全双工语音排行榜位列第一,能在电话音频、噪音、口音及频繁打断等真实苛刻条件下稳定运行,并原生支持25种以上语言。其核心优势包括精准的数据录入与复述、实时后台推理不增加延迟,并能通过思考避免错误回答。目前该模型已应用于Starlink的销售与客服,实现了20%的电话销售转化率和70%的客服自主解决率,能跨数百个工作流调用28种…
信息来源:xAI:News(网页) · Grok
模型发布 / 更新精选
Qwen3.6-27B:27B 稠密模型实现旗舰级编程能力
Qwen 发布 Qwen3.6-27B 开源模型,这款 27B 参数的稠密模型在编码基准测试中超越了上一代 397B 总参数/17B 激活参数的 MoE 旗舰模型 Qwen3.5-397B-A17B。模型体积从 807GB 大幅缩减至 55.6GB,16.8GB 的量化版本即可在本地运行,生成速度约 25 tokens/s。实测显示其能生成复杂的 SVG 图形代码,展现出旗舰级的编程能力。
信息来源:Simon Willison 博客 · Qwen
模型发布 / 更新精选
Xiaomi MiMo-V2.5 系列大模型开启公测
Xiaomi MiMo-V2.5 系列正式公测,包含 MiMo-V2.5、V2.5-Pro、TTS 与 ASR 等模型。其中 V2.5-Pro 在通用智能体、复杂软件工程等维度对标 Claude Opus 4.6、GPT-5.4,曾用 4.3 小时、672 次工具调用完成北大编译原理课程项目并获满分。
信息来源:公众号:小米 MiMo · GPT / Claude
产品发布 / 更新精选
Claude Managed Agents 的内置记忆功能
Claude Managed Agents 推出内置记忆功能,现已进入公测阶段。该功能基于文件系统的记忆层,允许代理从每个会话中学习,优化跨会话性能。记忆以文件形式存储,开发者可通过API导出和管理,并拥有完全控制权,支持权限范围、审计日志和并发访问。实际应用中,Rakuten的代理减少97%首过错误;Wisedocs的文档验证流程加快30%;整体上,代理实现97%首过错误减少、成本降低27%和延迟降低34%。Netflix、Ando等团队利用该功能实现上下文跨会话传递和基…
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
关于近期 Claude Code 质量报告的更新说明
Anthropic 确认并解决了过去一个月影响 Claude Code、Claude Agent SDK 和 Claude Cowork 的三个问题,所有问题已于 4 月 20 日修复。具体包括:3月4日将 Claude Code 的默认推理强度从"高"改为"中",导致用户感知智能下降,已于4月7日回滚;3月26日一项缓存优化存在缺陷,导致会话恢复后模型"健忘"和重复,4月10日修复;4月16日一项旨在减少冗余的系统提示指令意外损害了代码质量,4月20日撤销。这些问题影响了…
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
产品发布 / 更新精选
Claude新增日常生活连接器
2026年4月23日,Anthropic宣布扩展其AI助手Claude的连接器生态,新增15款日常生活应用,包括AllTrails、Instacart、Audible等。自2025年7月上线以来,连接器目录已增长至超过200个,覆盖设计、金融、生产力等领域。新版本支持动态情境化推荐,能根据用户对话上下文智能建议相关应用,并在多应用适用时并列展示选项。所有连接操作需用户授权确认,用户数据不会用于模型训练,且可随时断开。该功能全版本可用,移动端处于测试阶段。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
利用 Responses API 中的 WebSockets 加速智能体工作流
Responses API 集成 WebSockets 技术优化 Codex 智能体循环架构。通过建立持久化连接并引入连接级缓存机制,该方案显著降低 API 通信开销,有效缩短模型响应延迟。这一技术改进解决了传统请求模式下的性能瓶颈,为高频交互的智能体工作流提供更高效的实时数据传输能力。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
论文研究精选
图像生成器是通用视觉学习者
研究表明,图像生成训练能像大语言模型预训练一样,让模型学习到强大、通用的视觉表征。通过将视觉任务的输出参数化为RGB图像,研究团队将感知任务重构为图像生成任务。基于Nano Banana Pro指令微调构建的通用模型Vision Banana,在涉及2D和3D理解的一系列任务上取得了最先进的结果,在分割任务上媲美Segment Anything Model 3,在度量深度估计上超越Depth Anything系列。这些成果通过轻量级指令微调实现,且未损害基础模型的图像生成能…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新精选
Agent Platform 中的 Agents CLI:从创建到生产,一栈式实现
Google Cloud 推出 Agents CLI 工具,专为连接本地开发与生产级 AI 智能体部署而设计。该 CLI 为编码助手提供对完整 Google Cloud 技术栈的机器可读访问,显著减少脚手架过程中的上下文过载与 token 消耗。通过将评估、基础设施配置和部署流程整合至统一的程序化主干,开发者能够将项目从初始概念推进至实时服务的时间从数周缩短至数小时。
信息来源:Google Developers Blog(RSS)
产品发布 / 更新精选
Making ChatGPT better for clinicians
OpenAI 宣布向美国经过验证的医生、执业护士和药剂师免费提供 ChatGPT for Clinicians。该版本专门支持临床护理、医疗文档撰写及医学研究任务,旨在提升医疗专业人士的工作效率与决策支持。此次免费开放标志着生成式AI工具在专业医疗场景的进一步应用落地。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
论文研究精选
SWE-chat:来自真实用户与代码智能体在真实环境中的交互数据集
SWE-chat是首个从开源开发者真实工作环境中收集的大规模代码智能体交互数据集,目前已包含6000个会话、超过6.3万条用户提示和35.5万次智能体工具调用。研究发现代码编写模式呈现双峰分布:41%的会话中智能体几乎编写了所有提交代码,而23%的会话完全由人工编写。尽管能力快速提升,代码智能体在自然场景中效率仍不理想,仅44%的智能体生成代码最终被用户采纳,且其代码比人工代码引入更多安全漏洞。用户在44%的交互轮次中会对智能体输出进行修正、报告失败或中断操作。该数据集通过…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
行业动态精选
Cursor与SpaceX就模型训练达成合作
智能编程助手Cursor宣布与SpaceX合作,以突破算力瓶颈,加速其模型训练进程。该公司在不到半年内快速迭代了Composer系列模型:首款智能编码模型Composer问世后,Composer 1.5将强化学习规模扩大20倍以上,而Composer 2通过持续预训练,以极低成本达到了前沿性能水平。此次合作将使Cursor团队利用xAI的Colossus基础设施,大幅提升训练规模,从而显著增强模型的智能水平。
信息来源:Cursor Blog · Grok / Cursor
论文研究精选
从8.1万用户调查看AI经济学:职业暴露度与替代担忧
一项针对8.1万名Claude用户的调查显示,从事AI高暴露职业(如软件工程师)的从业者对岗位替代的担忧显著更高,其中早期职业者焦虑感尤为突出。约五分之一受访者明确表达失业忧虑,且职业AI暴露度每增加10%,感知到的岗位威胁就上升1.3%。在生产力方面,受访者平均自评生产力增益较高,最高薪与最低薪群体报告了最大幅度的效率提升,主要体现在工作范围拓展。值得注意的是,从AI中获得速度提升最大的人群,对岗位替代的担忧反而更强烈。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
观点 / 方法精选
请不要相信你的聊天机器人提供的医疗建议
四项独立研究一致表明,不应信任聊天机器人提供的医疗建议。这些研究均指向同一结论,显示AI对话系统在医疗咨询场景中存在显著的可靠性缺陷与安全隐患,可能给出不准确甚至危险的健康指导。专家强烈警告用户避免依赖ChatGPT等工具进行疾病诊断或用药决策,强调寻求专业医疗人员帮助的必要性。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS) · ChatGPT
观点 / 方法精选
保持 Cursor 应用稳定
Cursor 团队针对用户全天依赖应用、崩溃影响严重的问题,聚焦内存不足导致的崩溃。通过为多进程架构设计细粒度监控系统,实时追踪版本发布后的崩溃指标。采用双重调试策略:自上而下关联功能与崩溃数据,监控大消息负载;自下而上通过崩溃观察服务、堆快照等定位根本原因。自2月底以来,全版本会话OOM率下降80%,自3月1日起请求OOM率下降73%。具体措施包括处理大文件加载和修复资源泄漏,以应对突发与渐进性内存耗尽。
信息来源:Cursor Blog · Cursor
模型发布 / 更新精选
ChatGPT Images 2.0 发布
ChatGPT Images 2.0 推出了一个先进的图像生成模型,该模型在文本渲染、多语言支持和视觉推理能力方面均有显著提升。新版模型能够更精准地生成包含文字的图像,并支持多种语言文本输入。其视觉推理功能也得到增强,可更好地理解和执行复杂图像生成指令。此次升级标志着多模态AI生成质量的一次重要进步。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
产品发布 / 更新精选
GitHub Copilot 个人计划的变更
GitHub官方博客发布关于Copilot个人订阅计划的变更公告。提供的正文内容仅包含文章标题与链接,未披露具体调整细节、定价变化、功能限制或用户配额等关键数据指标。该公告在Hacker News平台获得102个点赞,完整变更条款需查阅GitHub官方博客原文。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
QIMMA:一个质量优先的阿拉伯语大语言模型排行榜
QIMMA 是一个首创质量验证流程的阿拉伯语大语言模型评估平台。它整合了14个基准测试的109个子集、超5.2万个样本,覆盖文化、STEM等7大领域,其中99%为原生阿拉伯语内容。平台采用双阶段质量验证:先由两个大模型自动评估,再经人工审核,发现并剔除了现有基准中存在的系统性质量问题。此外,QIMMA首次集成了阿拉伯语问题描述的代码评估任务,并公开逐样本推理结果,确保了评估的可靠性与透明度。
信息来源:Hugging Face:Blog(RSS) · Hugging Face