AI 情报文章归档
浏览 AI圈报 已保存的 5559 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5559
正式分类6
精选内容3470
全部文章
第 4 / 139 页 · 每页 40 条
论文研究普通
记忆是长周期智能体的短板:LLM 运营足球俱乐部 20 个赛季的基准测试
DAIR.AI 的基准测试让 15 个前沿 LLM 智能体通过 26 个工具、约 340-400 次决策运营足球俱乐部 20 个游戏年,全部存活,而脚本基线大多失败。规模、价格、供应商或 token 消耗均无法预测排名,顶尖模型差异在于管理行为。所有模型存在两个普遍失败:无法从被拒报价中学习隐藏价格,自我管理记忆退化为只增不减的存档或每赛季重写的计划。
信息来源:X:DAIR.AI (@dair_ai)
行业动态普通
企业AI Agent团队扩招远程全栈工程师
一家已跑通企业定制AI Agent商业回款闭环的团队,正式开放远程全栈工程师岗位。团队已完成多笔协会与企业定制项目交付,首个行业协会产品即将商业化运营,技术栈为React、Electron、TypeScript、Python、FastAPI、PostgreSQL、Redis。岗位默认使用Claude Code、Codex等AI编程工具,结果导向,直接与创始人对接。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · Claude
教程 / 实战精选
I built an autonomous treasury agent, then let a code review bot find every way it could lose money
I just submitted TreasuryForge to the WeMakeDevs × TrueFoundry Agent Harness Hackathon, an autonomous...
信息来源:DEV Community
观点 / 方法普通
自动驾驶若普及,年救八万生命
这是一次有趣的对话 如果所有汽车都像 Waymo 一样安全,美洲每年可挽救 8 万条生命,仅美国就有 3 万。还有数十万起受伤。 因此,反对自动驾驶的主要游说群体是事故律师。 死亡和受伤减少 = 和解费和律师费减少
信息来源:X:Emad Mostaque (@EMostaque)
观点 / 方法普通
自主AI科学家前景与差距并存
这篇论文很好地展示了自主AI科学家的前景与不足。关键问题在于,更先进的模型能在多大程度上弥合这些差距。
信息来源:X:Ethan Mollick (@emollick)
产品发布 / 更新普通
MiniMax H3 接入 Twitch 直播无限生成视频
@rehan_shei 可能刚刚发明了最好的基准测试:生成速度能比 Twitch 直播还快吗?🤔📺🌀 太不可思议了,看到 @fal 把 MiniMax H3 推向全新的体验。 【引用 @rehan_shei】:MiniMax H3 Max 生成视频的速度比你观看的速度还快,所以我把它接入了 Twitch 直播!现在你可以观看无限的跨维度频道--直播链接在下方
信息来源:X:MiniMax (@MiniMax_AI)
教程 / 实战精选
Design Patterns of Agentic AI
The Design Patterns Nobody Told You About Agentic AI Here's a confession: the first...
信息来源:DEV Community
产品发布 / 更新普通
Claude Code周限额削减17%引热议
他们删除了关于将每周限额削减25%的帖子,重新计算后发现实际降幅"仅"17%后才重新发布。 哇。
信息来源:X:Kim (@kimmonismus) · Claude
行业动态普通
美拟限制中国AI实验室远程访问海外芯片
特朗普政府正起草规则,限制中国AI实验室通过云基础设施远程访问海外AI芯片。美国商务部拟将客户筛查和限制中国远程用户作为接收先进GPU的条件,以填补现有出口管制未覆盖远程访问的空白。BIS 2026年5月指南已要求向中国关联实体提供先进计算物品需许可证,新规将正式废除拜登时代扩散框架并简化替代。
信息来源:X:Rohan Paul (@rohanpaul_ai)
观点 / 方法普通
杰文斯悖论在视频领域显现
我们已在编程领域见证了杰文斯悖论,如今视频领域的数据也出现了。 借助AI制作动画短剧的成本降低了10倍,速度提升了450倍,这促使中国版TikTok上的创作量增长了12倍以上,观看量增长了10倍。
信息来源:X:Deedy Das (@deedydas)
教程 / 实战精选
I Tried Getting Closer to the GPU With Triton
I've been trying to understand what actually happens when a piece of ML code reaches the GPU. Not the...
信息来源:DEV Community
产品发布 / 更新普通
Claude Code 9月14日起永久提高周限额25%
自9月14日起,我们将永久性地将Claude Code中Pro、Max、Team及按席位计费的Enterprise套餐的标准每周限额提高25%。在此之前,目前50%的增幅将继续生效。
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
行业动态普通
Cursor 的成功启示:AI 公司须自拥智能栈
Cursor 是业内通过自拥 harness 与模型实现成功的典范,但已有其他新兴全栈 AI 公司效仿。未来公司必须拥有自己的智能栈。此前 OpenAI 计划三个月内阻止 Cursor 用户访问其模型,涉及约 5% 的 Cursor 用户流量,双方正协商解决。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · OpenAI / Cursor
论文研究普通
Agent Seer:从 MCP 规范自动合成智能体评测
Apple 发布 Agent Seer,可从单一 MCP 规范自动合成多轮智能体测试场景,无需示例、实时工具访问或领域微调。该方法在 7 个 MCP 规范上验证,小中型规范实现完整工具覆盖;参数模式复杂度比工具集规模更能预测质量差异,参数值准确性是主要失败模式。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
教程 / 实战精选
I Asked for a Portfolio but Got a Filing Cabinet
Every AI redesign of my portfolio looked different and was the same filing cabinet underneath. What a style guide couldn't fix — and the one instruction that did.
信息来源:DEV Community
观点 / 方法普通
Anthropic 删除推文承认周费率下调25%
Anthropic 删除了那条推文。我猜他们知道自己搞砸了。
信息来源:X:Kim (@kimmonismus) · Claude
观点 / 方法普通
掌控模型层:AI自主性的关键
各位,请掌控好你的工具链。 这样,你就能决定使用哪些模型以及如何使用它们。 但别止步于此。如果条件允许,开始思考如何掌控模型层。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
观点 / 方法普通
Grok Bot 强制命名机器人是优点而非缺点
Elvis Saravia 反驳"Grok @bot 每次都要先命名机器人很蠢"的观点,认为强制命名让智能体团队易于识别,是设计优点。他将 Grok Bot 视为团队管理,由 CTO、CMO 等高层智能体自动处理子任务命名与分支,减少认知负担,使 PR 交付量提升约 5 倍。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · Grok
教程 / 实战精选
I A/B tested my own system prompt: 24 generations, one clear win, one rule that did nothing | Flash Onyx 2.2
Five new sections in Flash Onyx 2.2, measured against the build from before them, then six rounds of fixing what the run found. Including the round where adding one more sentence made everything worse.
信息来源:DEV Community
观点 / 方法普通
托马斯·沃尔夫自嘲成梗:训练微型鸭找针
变成了一个梗 【引用 @cdngdev】:我正在折磨我的微型鸭,训练它玩"大海捞针"游戏
信息来源:X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf) · Hugging Face
产品发布 / 更新普通
Anthropic 宣布 Claude 使用额度永久提升 25%
ANTHROPIC 🔥:从 9 月 14 日起,Claude 使用额度将永久提升 25%。 > 适用于 Pro、Max、Team 以及按席位计费的 Enterprise 套餐。 这意味着什么? 目前生效的临时 50% 提升将于 9 月 14 日结束。 也就是说,与现在相比,9 月 14 日之后你的使用额度将减少 17%。
信息来源:X:Testing Catalog (@testingcatalog) · Claude
观点 / 方法精选
I measured what 300 websites actually serve to AI agents
People keep saying that sites treat cryptographically signed AI agents differently, or that they hide...
信息来源:DEV Community
模型发布 / 更新普通
腾讯混元开源 Hy4 preview:1M 上下文 MoE
腾讯混元开源 Hy4 preview,旗舰 MoE 模型,支持 1M 上下文,采用 Apache 2.0 协议。模型总参数量 770B,每 token 激活 49B,原生集成 MTP 层支持投机解码。163 位内部专家在 203 项真实工程任务中的盲测中,Hy4 preview 平均分 2.99,优于 GLM 5.3(2.92)和 Kimi K3(2.94)。
信息来源:X:腾讯混元 (@TencentHunyuan) · GLM / Kimi
教程 / 实战精选
GPT-5.6 Sol Fast Mode vs Standard: When Double the Price Actually Buys You Speed
Last month I sat watching one of my own agent pipelines grind through a step that a human was...
信息来源:DEV Community · GPT
模型发布 / 更新普通
Hy4-preview 在 vLLM 中运行
腾讯混元 Hy4-preview 从发布首日起即支持在 vLLM 中运行,并已在 NVIDIA GPU 上完成验证。该模型总参数量 770B,激活参数 49B,采用 256 个路由专家加 1 个共享专家,支持 1M 上下文但每次查询仅关注 2048 个 token。
信息来源:X:腾讯混元 (@TencentHunyuan) · NVIDIA
模型发布 / 更新普通
OpenAI Astra 代号 ultima-alpha 测试中,或下周扩大上线
OpenAI 正以代号"ultima-alpha"向部分合作伙伴测试 Astra,若本周末反馈积极,下周将扩大早期访问,目标在下周四(3日)至随后一周内广泛上线。更新版 GPT-Image 2 也在推进,发布时间窗口相近,可能同步推出。
信息来源:X:Kim (@kimmonismus) · OpenAI / GPT
观点 / 方法普通
长程智能体可靠性未至,WeaveBench 最佳仅 41.2%
长程智能体可靠性尚未随更强模型到来,在 WeaveBench 的 114 项混合 GUI-CLI 任务中,官方报告的最佳通过率仅 41.2%。当前模型能处理局部步骤,但需显式审计状态才能保持全程任务不偏轨。论文提出 LongHorizon-Harness,认为长程可靠性取决于模型外围的 harness 而非模型本身。
信息来源:X:Rohan Paul (@rohanpaul_ai)
产品发布 / 更新普通
Claude 9月14日起上调标准周限额25%
自9月14日起,我们将永久性地将Pro、Max、Team及按席位计费的Enterprise套餐的标准周限额上调25%。在此之前,目前50%的增幅将持续至9月13日。
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
观点 / 方法精选
Your Sent Items Folder Is a Phishing Kit Now
The most convincing phishing email your finance team gets this year won't have a single typo. It will...
信息来源:DEV Community
观点 / 方法精选
Undox: approval-gated data-broker opt-outs on TrueForge
People-search sites still republish names, addresses, phones, and dates of birth. Opting out is...
信息来源:DEV Community
行业动态普通
Runway HORSE挑战赛开启,赢百万积分
还剩2小时。规则如下。让我们看看你的最佳表现。 【引用 @runwayml】:来玩个游戏吧。 一场HORSE投篮挑战赛。我们先来(见下方视频)。参与方式:评论"HORSE"并引用转发此帖,附上你的最佳应战作品。 → 获胜者将获得1,000,000积分。 → 仅限24小时。 提示词和角色见帖内🧵
信息来源:X:Runway (@runwayml)
观点 / 方法精选
"Don't you trust the AI vendor's own sandbox?" I didn't have a good answer.
I build an open-source AI sandbox project, and when I mention it to people building products and...
信息来源:DEV Community
教程 / 实战精选
curl your own homepage. That is all ChatGPT sees.
Run this against your site right now: curl -s https://yoursite.com | grep -o...
信息来源:DEV Community · ChatGPT
观点 / 方法精选
Why Gin Fits the AI Agent Era
Gin's speed, focused API, and mature Go ecosystem make it a strong backend choice for the AI agent era.
信息来源:DEV Community
观点 / 方法精选
Why I separated live discovery from the AI chat box
Most AI workspaces start with the same useful primitive: a chat box. I kept one in AI Workstation...
信息来源:DEV Community
观点 / 方法普通
用户质疑Anthropic对Cursor收购双标
当Windsurf将被竞争对手收购时,你们毫不留情地切断访问。现在Cursor被SpaceX收购,而SpaceX也拥有xAI,你们却突然强调忠诚,甚至扩大支持。这太虚伪了,Anthropic。
信息来源:X:Kim (@kimmonismus) · Claude / Grok / Cursor
教程 / 实战普通
Google WikiSkill:Agent 技能库构建指南
Google 新论文 WikiSkill 提出 Agent 技能库应物理拆分为原始轨迹、复盘认知、执行手册三层,强调失败认知需永久保留以产生复利。实验显示 9B 模型配结构化手册可干翻 27B 裸跑,27B 模型加手册在复杂表格任务上从 40% 提升至 81%;而弱者写的保守补丁会把 Gemini Flash 从 50% 拖累至 18%,实战中偷看知识库反而导致手册质量退步。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · Gemini
观点 / 方法普通
AI 基建瓶颈:美国仅 2% 电工持直流电认证
a16z 联合创始人 Ben Horowitz 指出,AI 基础设施正暴露物理瓶颈:美国仅 2% 电工持有直流电(DC)认证。从传统交流配电转向 800VDC 系统,行业急需能安全安装、调试与维护的人才,电工将成为 AI 热潮中最重要的工作之一。
信息来源:X:Rohan Paul (@rohanpaul_ai)
行业动态普通
Debian 投票通过允许"负责任地使用生成式人工智能"
Debian 项目投票通过决议,既不支持也不禁止在软件开发、维护及文档编写中使用生成式 AI 工具,但要求所有贡献无论以何种工具产出,均须满足相同的质量、正确性、可维护性与法律合规标准,且使用 AI 工具不减轻贡献者的责任。投票中试图修改社会契约或行为准则以惩罚不遵守反 AI 路线的极端选项均被否决。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法精选
Your AI agent rebuilds context from scratch every session. One file gives it the map.
AI agents changed who writes the documents in my repositories. They didn't change who has to find...
信息来源:DEV Community