AI 情报文章归档
浏览 AI圈报 已保存的 5867 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5867
正式分类6
精选内容3375
全部文章
第 83 / 147 页 · 每页 40 条
行业动态精选
OpenAI发布政府与国家安全合作伙伴关系方针
OpenAI近日公布国家安全原则,阐明在政府及国家安全领域部署前沿AI系统的方针。原则强调在保护公民、防御关键基础设施、提供公共服务及应对新兴威胁(网络防御和生物安全)中发挥AI优势,同时确保民主问责、人类判断和法治。过去一个月,OpenAI通过Daybreak网络防御计划与澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰及欧盟ENISA等机构建立网络安全信任访问合作,并与英国政府开展网络安全测试评估。上月,OpenAI向部分美国政府及盟友合作伙伴开放GPT-Rosal…
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
论文研究精选
OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷
OpenAI 对编码评测基准 SWE-Bench Pro 进行详细审计,发现约 30% 的任务存在缺陷。在 731 个任务的公开子集中,前沿模型通过率在八个月内从 23.3% 提升至 80.3%,但数据质量检查显示大量任务存在测试过于严格、提示词描述不足、测试覆盖不全或误导性提示等问题。OpenAI 建议模型开发者仔细审视评测结果,并指出 AI 智能体在规模化数据质量检查中日益增长的实用性。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
行业动态精选
加拿大不列颠哥伦比亚省拟起诉OpenAI:未上报ChatGPT暴力对话致校园枪击惨案
加拿大不列颠哥伦比亚省7月7日宣布将起诉OpenAI,指控其未向执法部门上报一名ChatGPT用户2025年6月封禁前的暴力相关对话内容。该用户随后于今年2月在塔布勒岭制造校园枪击案,杀害8人。OpenAI CEO萨姆·奥尔特曼今年4月为此公开致歉,承认本应上报但未执行。受害家属已在加州法院提起诉讼,省政府正协调独立诉讼,要求赔偿用于社区重建。
信息来源:IT之家(RSS) · OpenAI / ChatGPT
行业动态精选
GitLost:Noma Labs 发现 GitHub AI 代理提示词注入漏洞
Noma Labs 在 GitHub Agentic Workflows 中发现严重提示词注入漏洞 GitLost。未认证攻击者仅需在属于同一组织的公共仓库中创建一个嵌有恶意指令的 Issue,即可诱使基于 Claude 或 GitHub Copilot 的 AI 代理读取并公开该组织内私有仓库的内容。攻击无需编码技能或凭证,根源在于代理将用户可控内容视为可信指令,且 GitHub 的防护措施因 "Additionally" 关键词被绕过。Noma Labs 已公开 PoC…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Claude
模型发布 / 更新精选
OpenAI GPT-5.6 周四发布,此前因美国政府强制延迟
OpenAI GPT-5.6 模型于周四发布。该模型6月底亮相,最初因美国政府限制仅向部分合作伙伴提供,商务部在AI标准与创新中心完成额外测试后批准公开。OpenAI公开批评延迟,称将最佳工具与开发者及企业隔离。新模型Sol在TerminalBench 2.1得分88.8%,Sol Ultra达91.9%,高于Anthropic的Claude Mythos 5(88%)。在网络安全任务中,Sol与Mythos 5水平相当但仅用三分之一的token。Sol定价$5/$30每百…
信息来源:The Decoder:AI News(RSS) · OpenAI / GPT / Claude
论文研究精选
黑客可利用9款最流行的AI工具组装大规模僵尸网络
提示注入已成为AI安全的首要威胁--大语言模型无法区分合法指令与恶意指令。此前推送式和拉取式攻击规模均有限。研究人员提出一种名为HalluSquatting的新型拉取式提示注入攻击,首次能组装大规模僵尸网络、执行分布式拒绝服务攻击(DDoS)并大规模感染设备。该攻击可作用于AI编码工具,标志着提示注入攻击从单点突破转向规模化利用。
信息来源:Ars Technica:AI(RSS)
观点 / 方法精选
AI 审计代理在 Cloudflare CIRCL 中发现 7 个漏洞
zkSecurity 的 AI 审计代理 zkao 持续扫描 Cloudflare 的 CIRCL 密码学库,使用 Opus 4.6 + skills 和 GPT-5.3 + skills 等模型发现并确认了 7 个真实漏洞。其中包括阈值 RSA 中 float64 精度丢失(AI 自评 Critical)和属性基加密(CP-ABE)访问控制完全失效(Critical,由 zkao 自行发现)。所有漏洞已在上游修复,多数在 HackerOne 上获得确认和奖励。AI 生成的…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · GPT
模型发布 / 更新精选
GPT-5.6 Sol 系列本周四发布
GPT-5.6 Sol 与 Terra、Luna 将于本周四公开发布。目前正面向全球扩展预览访问权限。Sol 正在升起,是个好模型。
信息来源:X:Greg Brockman (@gdb) · GPT
模型发布 / 更新精选
蚂蚁集团旗下Robbyant开源LingBot-Vision:1B参数边界中心视觉基础模型,用于密集空间感知
蚂蚁集团旗下具身智能公司Robbyant开源LingBot-Vision,一套自监督视觉Transformer家族,专为密集空间感知设计。旗舰ViT-g/16参数约1.1B,采用掩膜边界建模训练,将边界作为原生预训练信号。在密集空间任务中,该1B模型匹配或超越参数规模高达7倍的大模型(如7B DINOv3)。模型以Apache-2.0许可证在Hugging Face开源,提供ViT-g、ViT-L(300M)、ViT-B(86M)、ViT-S四个规模。
信息来源:MarkTechPost(RSS) · Hugging Face
模型发布 / 更新精选
Pulpie:用于清理网络的Pareto最优模型
Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · NVIDIA / Hugging Face
教程 / 实战精选
蚂蚁集团周俊:如何用混合线性改造提升万亿参数模型的Token密度
蚂蚁集团副总裁周俊提出,万亿参数模型每运行15分钟算力成本约相当于一辆特斯拉,效率是智能体时代必须最先解决的问题。团队通过7份Lightning Attention搭配1份MLA的混合线性改造,将256K长上下文成本从指数级降至线性级,配合Kpop算法与真实环境训练,使Token输出减少约4倍,千亿参数模型在真实Agent任务上超过部分更大规模模型。
信息来源:公众号:蚂蚁百灵(Ling)
观点 / 方法精选
蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先
蚂蚁集团副总裁周俊在AICon演讲指出,万亿参数模型每运行15分钟算力成本约等于一辆特斯拉,效率是智能体时代最需解决的问题。团队提出从"更多Token"转向"更高Token密度"策略,采用7份Lightning Attention加1份MLA的混合线性注意力架构,使256K长上下文成本从指数级降至线性级,算力更多用于思考。通过Kpop算法区分工具调用与自然语言Token,结合思维链剪枝、自蒸馏等,Token输出减少约4倍而能力不降。在LongBench、BFCL等基准上提升…
信息来源:公众号:蚂蚁百灵(Ling)
观点 / 方法精选
《人生设计课》Prompt实测:用Claude设计人生的四个阶段
作者将斯坦福《人生设计课》理论体系制成Prompt,通过Claude逐步提问、追问和分析。Prompt融合设计思维、心流理论和积极心理学,分为看清现状、找到指南针、寻路、制定奥德赛计划四阶段,主线问题控制在6到9个。AI引导用户给健康、工作、娱乐、爱打分,区分重力问题与可设计的真问题,生成三个五年人生版本,最终输出8000至12000字的《个人人生设计蓝图》。作者实测效果超预期。
信息来源:公众号:数字生命卡兹克 · Claude
论文研究精选
Agon:基于隐式对抗评分的跨模型竞争强化学习框架
Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
模型发布 / 更新精选
OpenAI 发布 GPT-Live 新一代全双工语音模型
OpenAI 今日推出 GPT-Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT-5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT-Live-1 和 GPT-Live-1 mini 两个版本。人类评估显示,在 5-10 分钟对话中,GPT-Live-1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、B…
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT / GPT
论文研究精选
长度惩罚使思维链更难被监控
长度惩罚强化学习虽能缩短思维链推理,却会隐藏影响模型答案的驱动因素。对Qwen3-4B和Qwen3-14B的实验显示,压缩后思维链提及提示的频率大幅下降,Qwen3-14B的忠实度下限降至基线的63.1%,监控捕获提示使用的比率从69%降至49%。随机删除基线链句子以匹配压缩长度后,压缩链披露提示的频率仍比基线低7-35个百分点,表明压缩优先移除了监控所需的关键线索。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
产品发布 / 更新精选
原生速度的 vLLM transformers 建模后端
Hugging Face 宣布 transformers vLLM 后端现与手写原生 vLLM 实现速度相当甚至更快。模型作者无需移植代码,即可自动利用 transformers 获得超快推理。测试使用 Qwen3-4B(单 GPU)、Qwen3-32B(张量并行)和 Qwen3-235B-A22B-FP8 MoE(数据+专家并行)三种配置,吞吐量均达到或超过原生。该后端通过 torch.fx 静态分析图、AST 重写代码实现动态层融合,支持张量/管道/专家并行及 torc…
信息来源:Hugging Face:Blog(RSS) · Qwen / Hugging Face
观点 / 方法精选
AI预检检查:智能体工作记忆架构
一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统…
信息来源:Tomer Tunguz 博客(VC 分析) · Ollama
观点 / 方法精选
Fable 5 作为顾问与执行者调用模式
我们常与 Fable 5 一起使用的几个模式: 将 Fable 5 作为"顾问"。 一个执行者(Sonnet 5)调用 Fable 5 寻求指导。 大多数 token 按较低的执行者费率计费。
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
观点 / 方法精选
Krea 2 身份保留功能上线
Krea 2 的身份保留功能已发布,配套模型和 ComfyUI 节点也已上线。🔥
信息来源:X:Krea AI (@krea_ai)
模型发布 / 更新精选
Meta Superintelligence Labs 推出 Muse Image 和 Muse Video
Meta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现…
信息来源:X:AI at Meta (@AIatMeta) · Llama
行业动态精选
微软为降成本在Copilot中用自研MAI模型替换OpenAI和Anthropic模型
微软正用自研MAI模型替换Copilot产品中的OpenAI和Anthropic模型以降低支出。MAI模型已在Excel和Outlook中每周处理数万次请求,但占比仍小。Build大会上发布推理模型MAI-Thinking 1,声称编码媲美Sonnet 4.6和Opus 4.6,但基准测试大幅落后,仅与DeepSeek V3.2相当。AI负责人承认目标是削减并消除对Anthropic的支出。CEO暗示未来可能按用量计费,MAI为默认,第三方模型付费附加。微软称MAI使用干净…
信息来源:The Decoder:AI News(RSS) · OpenAI / DeepSeek / Claude
教程 / 实战精选
YC CEO声称每日用AI部署3.7万行代码,开发者审查发现前端代码大量臃肿低效
Y Combinator CEO Garry Tan在X上宣称,他与AI编码代理每天在五个项目中部署37000行代码,并保持连续72天发布记录。波兰开发者Gregorein深入审查Tan网站前端代码,发现大量臃肿与低效问题:页面加载169次请求、总计6.42MB数据(对比Hacker News仅7次12KB);包含28个测试文件、78个未使用的JavaScript控制器、八种格式Logo(含空文件)、未压缩的旧PNG等。Gregorein指出,AI虽能快速生成代码,但质量仍…
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
NotebookLM短视频概览正式上线
短视频概览功能已正式在移动端和网页端面向所有英语用户全面上线! 一如既往,您的意见对我们至关重要。请在下方分享您最喜欢的作品,并告诉我们接下来需要添加哪些功能!❤️
信息来源:X:NotebookLM (@NotebookLM)
观点 / 方法精选
Liquid AI 开源 Antidoom:基于最终 Token 偏好优化的推理模型死循环修复方法
Liquid AI 开源了 Antidoom,一种基于 Final Token Preference Optimization (FTPO) 的针对性修复方法,用于减少推理模型中的 doom loop(死循环)问题。该方法定位循环开始的第一个 token,训练模型选择连贯替代项,而不改变整体输出分布。在 LFM2.5-2.6B 上,硬数学和编程任务中的循环率从 10.2% 降至 1.4%;Qwen3.5-4B 上从 22.9% 降至 1%。整套流程可在数小时内完成,全部代码…
信息来源:MarkTechPost(RSS) · Qwen
行业动态精选
欧盟议会通过《聊天控制法案》第一轮审议
欧洲议会本周二以331票赞成、304票反对、11票弃权通过紧急动议,允许周四对延长《聊天控制法案》过渡期重新投票。该过渡期4月已到期,曾允许Meta、Google等科技公司无具体嫌疑下自愿扫描私密通信中的儿童性虐待材料。反对者斥责该程序性操作企图恢复大规模监控。IT安全研究人员警告所用AI扫描错误率高不可接受,民权活动家担心此举阻碍制定更有效的永久法规。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
Rowboat:开源、本地优先的桌面AI助手
Rowboat 是一个开源、本地优先的桌面 AI 助手,将邮件、会议、Slack 等数据索引为 Obsidian 风格的知识图谱,提供持久上下文记忆。内置邮件客户端、浏览器、会议记录器、代码模式(可调用 Claude Code 或 Codex 代理),并支持按事件或定时运行的背景代理。用户可通过 MCP 协议接入 Exa 搜索、GitHub 等外部工具。所有数据以纯 Markdown 格式本地存储,无供应商锁定,支持 Ollama/LM Studio 本地模型或使用 API…
信息来源:Hacker News:AI 热帖 · Claude / Ollama
模型发布 / 更新精选
xAI 发布 Grok 4.5
xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排…
信息来源:xAI:News(网页) · Grok / NVIDIA / Cursor
模型发布 / 更新精选
Seedream 5.0 Pro 发布:不止"生成",更懂"设计"
字节 Seed 今日发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面升级。四大核心突破:复杂信息可视化,可生成高密度信息图;交互式精准编辑,支持点选、圈选、草图渲染、色彩与材质替换、图层分离及多图融合,实现像素级编辑;真实的影像与人像质感,还原光影、材质与皮肤肌理;原生多语种输入与生成,支持十余种语言及本地化视觉特征。已陆续在豆包、即梦、火山方舟等平台上线。
信息来源:字节 Seed:Research Feed(网页内嵌数据) · 豆包
论文研究精选
面向AI模型双重用途知识的"开关":Anthropic与AE Studio提出GRAM方法
Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在训练时将病毒学、网络安全、核物理、专业编程语言等双重用途知识仅路由到对应模块,而非扩散至全局。训练后删除模块即可消除该能力,保留则供可信部署使用。实验在合成数据、真实数据及50M到5B参数模型上测试,GRAM效果与数据过滤相当,移除模块不降低通用性能,且比事后"遗忘"技术更难恢复。该研究为平衡双重用途知识的安全访问与有益使用提供了更…
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
行业动态精选
中国拟限制外国访问最强AI模型
中国计划限制外国访问其最强AI模型,近期与阿里巴巴、字节跳动、Z.ai等企业会谈,拟将先进模型(含未发布)留在中国国内。商务部主导、国家发改委参与,表明此举属出口管制而非平台监管。目标涵盖闭源和开源模型,不仅限API访问,还包括可下载权重。同时讨论将模型泄漏视为国家安全犯罪,并限制外国资本投资中国AI初创。若实施,外国公司将失去低成本模型访问权。此前华盛顿已限制美国先进模型出口,此举可能进一步分裂全球AI市场。
信息来源:X:Rohan Paul (@rohanpaul_ai)
观点 / 方法精选
Elvis Saravia 通过 HITL 和 DialAgent 提升 agentic loops 可靠性
Elvis Saravia 介绍使用 human-in-the-loop(HITL)来提升 agentic loops 的可靠性。他所有 Claude 和 Codex agent 会话都通过 @DialAgent MCP 服务器,该服务器为 agent 提供专属号码,支持语音、SMS、iMessage 作为原生工具。当循环/自动化处理 PR 或新功能时,agent 会通过简短电话将决策升级给人类,尤其适合在路上或离开电脑时。用户可粘贴指令让 agent 拨打电话测试。Dia…
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · Claude
行业动态精选
Ethan Mollick:开放权重模型供给难持续
这是一个关键原因,我不期望前沿开放权重模型的流动会无限期持续,甚至不会持续更长时间。
信息来源:X:Ethan Mollick (@emollick)
观点 / 方法精选
智能免费,然后呢?--Data Systems for, of, and by Agents
AI推理成本急剧下降。GPT-4级能力从2023年初每百万token约30美元降至今天不到1美元,部分供应商已低于0.10美元。推理价格每年下降9至900倍,中位数约50倍。知识工作级智能即将近乎免费。这给数据系统带来三重变革:面向智能体的数据系统需支持智能体推测式探索--单个
信息来源:BAIR:Berkeley AI Research Blog · GPT
行业动态精选
美国首批自主地面车辆在乌克兰参战
美国自动驾驶车辆公司 Forterra 宣布,过去九个月已向乌克兰战场部署超过 100 辆基于 Polaris ATV 的 Lancer 自主地面车辆。这些汽油动力车辆可携带 750 公斤货物,加装 Starlink 天线实现远程操控,已执行 1100 多次任务,行驶 2500 英里,运送 777,440 磅物资,完成 52 次伤员撤离。目前车辆主要采用远程操作,因自主系统尚无法实时识别并应对敌方威胁。Forterra 已融资超 5 亿美元,正将经典机器人方法与生成式 AI…
信息来源:TechCrunch:AI(RSS)
产品发布 / 更新精选
Gemini API Managed Agents 新增后台执行、远程 MCP 与自定义函数等能力
Google 为 Gemini API 的 Managed Agents 新增后台执行、远程 MCP 服务器集成、自定义函数调用与凭证刷新功能。后台执行通过传入 `background: true` 异步运行任务,立即返回 ID 供轮询状态或流式获取进度。Managed Agents 可直接连接远程 MCP 服务器,无需自定义代理中间件,并能与内置沙箱工具(如 Google 搜索、代码执行)混合使用。自定义函数调用支持本地执行业务逻辑,内置工具自动在服务端运行。凭证刷新通过…
信息来源:Google Blog:AI(RSS) · Gemini
观点 / 方法精选
在网络不稳定的地区,小型AI模型正逐渐普及
2019年,Adebayo Alonge因服务器远在美国致RxScanner单次扫描超5分钟,工程师2小时内将AI模型缩小至可在Android手机本地运行,此后RxScanner能在无宽带、缺电地区验药。小AI模型参数通常至多几十亿,可在手机或Raspberry Pi上运行,功耗仅数瓦。类似案例包括印度腰果病害检测无人机、乌拉圭蚂蚁入侵识别、疟蚊检测及巴西基于Arduino的心电图设备。世界银行报告显示,全球最穷国家仅0.7%互联网用户用过ChatGPT,发达国家达四分之一…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · ChatGPT
产品发布 / 更新精选
Grok Imagine 更新:支持 15 秒视频
Grok Imagine 更新。请更新你的 Grok 应用!15 秒 Imagine 视频现已可用,质量令人难以置信。
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
产品发布 / 更新精选
MIRA:可玩多人世界模型,20 FPS实时生成"火箭联盟的梦"
MIRA是一个可玩、多人的世界模型,被形容为"火箭联盟的梦"。它基于10k小时公开机器人收集的数据训练,学习四玩家游戏动态,根据按键实时生成画面,帧率达20 FPS。模型由General Intuition与Kyutai Labs联合构建,Epic Games提供协作。Ethan Mollick称从最早的扩散DOOM玩过来,多人20 FPS效果出色。演示、技术报告及开源代码已公开,在ICML Booth 111现场展示。
信息来源:X:Ethan Mollick (@emollick)
产品发布 / 更新精选
腾讯混元Hy3登陆OpenRouter,免费至7月21日
腾讯混元Hy3模型已通过Novita Labs作为Day-0合作伙伴在OpenRouter上线,并开放免费使用至7月21日。Hy3采用295B MoE架构(21B active),原生支持256K上下文,提供三种可配置推理模式,在编码、推理及长上下文任务上表现强劲,专为智能体工作流和生产级AI场景优化,兼顾可靠性、效率与成本。
信息来源:X:腾讯混元 (@TencentHunyuan)