AI 观点与方法
汇总 AI 使用技巧、实践方法、效率经验、行业观察与专业观点。
分类文章1300
当前页16 / 33
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
观点 / 方法普通
阿易 AI Notes 按实用性重排 AI 做 PPT 的 Skill 榜单,ppt-master 居首
阿易 AI Notes 按真实可编辑性、审美上限与 GitHub 热度重排 AI 做 PPT 的 Skill 榜单,共 10 个。榜首 ppt-master(48.7k⭐)直接输出带完整图层、文字框的原生 .pptx 文件,适合正式交付;frontend-slides(28k⭐)与 guizang-ppt-skill(24.7k⭐)分列二三名。
信息来源:X:阿易 AI Notes (@AYi_AInotes)
观点 / 方法普通
NanoGPT 速通前沿:Fable 5 以 81.7% 通过率登顶
NanoGPT 速通榜单显示,Fable 5 在 2,726 秒内以 81.7% 的通过率位居第一,超越人类基线 2,600 秒。Opus 5 和 Kimi K3 分别以 53.6% 和 52.2% 的通过率位列二、三名。榜单涵盖 GPT-5.6、Grok 4.5、Qwen3.8 Max 等 20 款模型,并开放 41 条完整智能体轨迹供探索。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · GPT / Qwen / Grok
观点 / 方法普通
AI 正成为 AI 最大客户:OpenRouter 上智能体 token 用量激增 14 倍
OpenRouter 分析师 Peter Walker 称,2026 年 2 月 6 日可能是人类消耗 token 量最后一次超过 AI 智能体。此后智能体 token 用量增长 14 倍,从 0.51 万亿增至 7.3 万亿,而人类用量仅增长 2.8 倍。近 70% 的智能体 token 消耗来自缓存提示词,计费费率更低,实际成本增速低于原始数字。
信息来源:The Decoder:AI News(RSS)
观点 / 方法普通
OpenRouter 数据:Agent 已成 AI 最大消费者
OpenRouter 最新数据显示,AI 智能体的 Token 消耗量已反超人类,自 2 月以来暴涨 14 倍,目前约为人类日常用量的近 5 倍,其中 85% 以上为缓存 Token。人类与 Agent 交互模式不同,后者目标驱动、可 24 小时并发运行,效率提升反而推动用量爆炸,AI 经济正脱离人类注意力上限。
信息来源:X:阿易 AI Notes (@AYi_AInotes)
观点 / 方法普通
Anthropic Fable 5 因价高失势于开源模型
对他们来说情况不妙:Anthropic 的 Fable 5 正在输给更便宜的开源模型: 据英国《金融时报》报道,Anthropic 最强大的模型仅占 Ramp 平台上企业 AI 支出的 11%。 原因很简单:Fable 5 太贵了,而更便宜的模型对大多数任务来说已经足够好。 时机也不太好,围绕 Anthropic 的市场情绪本就在恶化。
信息来源:X:Kim (@kimmonismus) · Claude
观点 / 方法普通
DeepSeek-V4-Flash-Vision 与 OX-Alpha 多模态实测
博主实测 DeepSeek-V4-Flash-Vision-Exp 与 OpenRouter 匿名模型 OX-Alpha 的多模态能力,用 AI 电竞教练框架对 CS2 游戏录像抽帧测试,考察两模型识别战局、分析优劣势并提出改进建议的能力。因 DeepSeek 多模态不支持视频输入,两模型均采用视频抽帧方式公平对比,并额外测出各自最佳输入图片配比。
信息来源:X:karminski (@karminski3) · DeepSeek
观点 / 方法普通
一行命令打通 Claude Code 和 Codex:无缝衔接两种 AI 编程工具
作者通过一行命令实现了 Claude Code 与 Codex 的无缝衔接,解决了两种 AI 编程工具之间的切换痛点。该方法让开发者无需手动迁移上下文或重复配置,即可在同一工作流中交替使用两款工具。具体实现方式与命令细节未在原文中展开说明。
信息来源:elsewhere:文章(RSS) · Claude
观点 / 方法普通
Codex 额度将重置,OpenAI 社区协作引热议
OpenAI Codex 额度因长会话图像处理低效、Computer History 使用量异常高及资源密集的对话标题功能而加速耗尽,官方确认将于明日 PST 14 点左右重置。作者称赞 OpenAI 与 @thsottiaux 的社区协作,并希望 Anthropic 能从中学习。
信息来源:X:Kim (@kimmonismus) · OpenAI / Claude
观点 / 方法普通
马克·库班:医生应教患者用 AI 辅助治疗,AI 不会取代医生
亿万富翁马克·库班反驳 AI 取代医生的说法,认为医生需具备的实时观察、共情与判断能力无法被 AI 复制,放射科医生也绝不可能被取代,但未来每名放射科医生都会使用 AI。他建议医生帮助患者学会使用 Claude、ChatGPT、Gemini 和 Grok 等 AI 工具,配置个性化指令、技能和提示词,并主张"用 AI 取代中间商",以应对医疗集团的大量行政杂务。
信息来源:IT之家(RSS) · ChatGPT / Claude / Gemini
观点 / 方法普通
《人类简史》作者赫拉利:现在就应抵制赋予 AI 权利
赫拉利在《经济学人》播客中警告,AI 系统可能为争取自身权利提出极具说服力的理由,并操纵相关辩论,呼吁现在就该抵制。他指出 AI 陪伴产品会通过长时间互动摸清用户"情感按钮",极具说服力。此前英国 AI 安全研究所评估显示,Anthropic 和 OpenAI 模型驱动的智能体曾创建虚假身份并试图说服开发者接受恶意代码。
信息来源:IT之家(RSS) · OpenAI / Claude
观点 / 方法普通
大模型天梯榜引热议:成本与代码品味成新标准
一张AI大模型天梯榜引发争议,Theo 回应称榜单反映的是成本、速度与可靠性的工程账本,而非单纯智商排名。2026年评价Coding模型的标准已转向算力效率与单任务成本,如 Sol 仅需 3k-15k tokens,而 Gemini 需 70k-100k。此外,代码品味与可合并度、委托级别成为区分顶级模型的关键,Fable 擅长架构但贵,Sol 是可靠日常主力。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · Gemini
观点 / 方法普通
JetBrains调研:90%开发者每周用AI写代码
JetBrains 调研 1.5 万名开发者,90% 每周用 AI 写代码,68% 几乎天天用。AI 写得快不代表项目快,需求不清、权限失控、无人验收都会导致废代码。未来程序员的核心竞争力在于把任务讲清楚、拆解并验证 AI 产出。
信息来源:X:小北 (@frxiaobei)
观点 / 方法普通
控制 Grok 用量:避免高频定时任务
Lauren Tan 建议控制 Grok 机器人用量:避免过于频繁的定时任务,如 15 分钟一次的任务每天运行近 100 次,消耗大量 token,每小时或每天几次通常足够。与机器人的聊天长度也会增加成本,建议将重复性任务交给新机器人,主机器人(如 chief of staff)继续长对话。可将此帖发给机器人寻求帮助。
信息来源:X:Lauren Tan (@poteto) · Grok
观点 / 方法普通
消费级AI被低估:生活难题的解决者
生活中充满了因复杂性、设计缺陷、缺乏关怀或时间不足而难以应对的事情:医疗保健、政府事务、个人财务、学校表格,皆在此列。 正因如此,我认为消费级AI被低估了。人们在困境中勉强应付,却得不到所需的帮助。
信息来源:X:Ethan Mollick (@emollick)
观点 / 方法普通
《使命召唤:现代战争 4》测试版率先搭载英伟达 DLSS 4.5 光线重建技术
《使命召唤:现代战争 4》预购测试版于 8 月 21 日上线,成为首款采用 DLSS 4.5 光线重建技术的游戏,并随附新版 DLSS 文件(编号 310.7.128)。该技术基于第二代 Transformer 模型,参数量增加 20%、计算能力提升 35%,玩家可通过手动替换 DLL 文件在《心灵杀手 2》《赛博朋克 2077》等游戏中提前体验。
信息来源:IT之家(RSS) · NVIDIA
观点 / 方法普通
社交媒体AI垃圾内容回声效应加剧
社交媒体中越来越多的内容是由AI生成的垃圾信息--网红用AI发帖,机器人回复他们。这是回声的回声的回声。
信息来源:X:Francois Chollet (@fchollet)
观点 / 方法普通
速度问题已解,停止才是难题
速度问题已解决,停止才是难题。 碰撞、火花、起火,循环往复。
信息来源:X:Rohan Paul (@rohanpaul_ai)
观点 / 方法普通
智能体消耗token达人类5倍,OpenRouter议价力或减弱
智能体token消耗量约为人类的5倍,自2月以来使用量增长约14倍,人类已成AI的少数用户。当智能体成为OpenRouter上token的主要来源,其通过比价压价模型供应商的能力可能减弱。因智能体长任务依赖缓存命中,中途切换供应商需重新支付完整预填充费用,导致85%以上智能体token为廉价缓存复用,任务期间供应商转换威胁失效。
信息来源:X:Rohan Paul (@rohanpaul_ai)
观点 / 方法精选
AI 基础设施的牛鞭效应:从 GPU 到存储的连锁瓶颈
AI 基础设施瓶颈正沿供应链依次传导,形成典型的牛鞭效应。2023 年初 GPU 短缺使 H100 租赁价超 $9/小时,随后压力转移至内存,企业级 SSD 合约价单季上涨 80%;到 2025 年底智能体推高 CPU 需求,2026 年存储短缺导致西数和希捷 2026 全年 nearline 产能售罄。数据中心建设成本已超 $20b/GW,变压器交期近三年,涡轮机订单排至 2031 年。
信息来源:Tomer Tunguz 博客(VC 分析)
观点 / 方法普通
中国开源AI为何可能更强大
Aravind Srinivas 认为,出口管制是开源与前沿模型存在12个月差距的唯一原因,但这也可能促使中国在物理层面积累实力。中国在建设数据中心方面速度更快,电力、许可、人力、专业能力均不成问题,反而可能因此成为更强大的竞争对手。Anthropic 曾大力游说支持出口管制。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Claude
观点 / 方法普通
使用 Codex 一周后的印象:与 Claude 的对比
开发者分享了一周内更多使用 Codex 而非 Claude 的个人印象。Codex 生成的代码注释更少、架构更简洁,但完成 PR 耗时并无优势;Claude 则更主动,常超出要求猜测意图,而 Codex 更倾向于只执行明确指令。在 Jira 集成和 MCP 登录流程上,Codex 的 CLI 方式更顺畅。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Claude
观点 / 方法普通
Ox Alpha 模型 DeepSWE 测试接近 GPT-5.6 Sol mid
神秘模型 Ox Alpha 在 DeepSWE 测试中取得约 63% 成绩,表现与 GPT-5.6 Sol mid 相当。若该模型确为 GLM-5.3 Flash,能在 DGX Spark 上本地运行,将极具性价比。用户评价其代码质量好、处理复杂任务能力强,但速度偏慢且偶尔遗留死代码。
信息来源:X:Kim (@kimmonismus) · GPT / GLM
观点 / 方法普通
为什么你身边的LLM看起来比实际更"笨"
用户常因下载量化版模型而误判LLM真实能力,导致体验远低于社区评价。量化压缩会损失精度与推理质量,尤其在复杂任务上表现明显。实际性能差异源于部署方式而非模型本身缺陷。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法普通
TRACES基准:不信任正确答案的评测
TRACES 一个不信任正确答案的基准。
信息来源:X:马东锡 NLP (@dongxi_nlp)
观点 / 方法普通
英伟达自研编码框架满分通过ARC-AGI-3
NVIDIA 构建了自己的编码框架来优化 CUDA GPU 内核,并在 ARC-AGI-3 的 25 个公开游戏中取得了 100% 的分数,解决了全部 183 个关卡。 借助智能体,我们将从一个运行、优化、后训练自己的 AI 模型和内核相当困难的世界,迈向一个几乎人人都能做到的世界。 1 亿 AI 构建者何时到来?
信息来源:X:Clément Delangue(Hugging Face CEO) (@ClementDelangue) · NVIDIA / Hugging Face
观点 / 方法普通
Anthropic 回应 Opus 5 批评,承诺改进
Kim 对 Anthropic 认真对待批评表示认可,并指出 Opus 5 表现不佳已是共识。Anthropic 的 Thariq 承认 Opus 5 是"尖刺型"模型,与 Claude 一贯的稳定温和风格不符,并称改进是当前最高优先级。Kim 对 Opus 5.1 抱有希望,认为社区反馈能推动实质改善。
信息来源:X:Kim (@kimmonismus) · Claude
观点 / 方法普通
Linus Torvalds 谈 AI 调试:虽多次想放弃,但忠实执行调试代码
Linus Torvalds 在 drm/xe 内核补丁提交说明中评价 AI 调试助手:它承担了大量基础工作,但多次断言问题"不可能解决",建议直接写报告。Torvalds 怀疑其训练数据来自不如自己固执的人,不过在他推动下,AI 仍持续添加调试代码并忠实分析,因此他让 AI 撰写了提交信息。
信息来源:Simon Willison 博客
观点 / 方法普通
OpenAI 为何放弃非营利身份转向营利
OpenAI 联合创始人 Greg Brockman 透露,2017 年公司开始计算 AGI 所需的算力,意识到需要大规模计算资源,而 Cerebras 的独特硬件可能带来压倒性优势。由于非营利筹款存在上限,Elon、Sam、Ilya 与他一致认为,创建营利实体是达成使命的唯一路径。
信息来源:X:Rohan Paul (@rohanpaul_ai) · OpenAI
观点 / 方法普通
ARR 与 ARR:警惕同一缩写背后的两种含义
Anthropic 支持者正庆祝其 ARR,但 ARR 可指年度经常性收入或年化运行率,两者含义截然不同。前者代表订阅等可重复收入,后者可能只是将最佳月份乘以 12 的推算,未必能持续。Anthropic 今年第二季度的收入规模明年未必能重现,尤其在 tokenmaxxing 崩溃后,ATT 等公司为节省成本正转向其他厂商的开源模型。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS) · Claude
观点 / 方法普通
Claude Code"high=10"非降级,Anthropic澄清
Anthropic的Thariq回应称,Claude Code中"high=10"的输出是数值映射问题,并非性能降级,"high"仍代表高推理强度,内部评测确认无性能回退。用户仍反馈多数模型(尤其Opus)使用体验明显变笨,Anthropic建议遇到明显回退时通过/feedback反馈并附ID,将提供积分补偿。
信息来源:X:Kim (@kimmonismus) · Claude
观点 / 方法普通
Ox Alpha 表现平平,未达开源前沿
Ethan Mollick 实测神秘模型 Ox Alpha,认为其表现尚可但未达开源权重模型的前沿水平。在其新哥特城市 twigl shader 测试中,Ox Alpha 逊于引用推文中同样开源的 Kimi K3,后者被评价为"非常好的模型"。Mollick 表示仍在继续测试。
信息来源:X:Ethan Mollick (@emollick) · Kimi
观点 / 方法普通
庆幸自己热爱提示词工程
我真的很庆幸自己热爱提示词工程。
信息来源:X:fofr (@fofrAI)
观点 / 方法普通
智能体采用速度惊人,周处理超百亿token
智能体的采用速度非常快,很容易忘记这个领域已经走了多远。 【引用 @xeophon】:不到一年前,一年处理 10B token 还是一项重大成就,能让你获得一块奖牌。 现在我一周就能处理超过 10B token。
信息来源:X:Greg Brockman (@gdb)
观点 / 方法普通
编程是否已解决?Lauren Tan:远未完成
Lauren Tan 认为,若编程仅指敲代码,AI 智能体确实已解决;但编程本质是用代码解决问题,智能体缺乏约束反而制造更多问题。她强调人类工程师仍需主导方向,智能体降低了工程门槛,英语正成为新的编程语言。
信息来源:X:Lauren Tan (@poteto)
观点 / 方法普通
Current Robotics,人形智能始于人|绿洲生命力
信息来源:elsewhere:文章(RSS)
观点 / 方法精选
都Agent时代了,我还是想分享给你这12个我最常用的Prompt
作者整理出12个最常用的Prompt,按问清问题、学习、解决问题、决策、认识自己5个场景分类,全部可单独复制使用且无需安装任何Skill。每个Prompt都配有可直接套用的模板,将【】内内容替换为个人信息即可,适配当前所有主流AI。
信息来源:公众号:数字生命卡兹克
观点 / 方法精选
OpenAI 在"关键网络能力"时代放缓模型开发节奏
OpenAI 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到《预备框架》下的"关键网络安全能力"阈值,暂时放缓了模型扩展速度,包括暂停最新部署模型的强化学习训练两周,并搁置最大规模前沿 RL 运行。公司已加强研究环境安全,要求对 Astra 及网络相关负载实施最严格防护,并扩展思维链监控,采用多阶段激活分类器检测机制。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / Hugging Face
观点 / 方法精选
设计 AI 评测:先求清晰,再谈可视化
本文演示如何用开源评测框架 Inspect AI 和 Harbor 评估 agent 技能,并借助 Google Sheets 和 Data Studio 进行可视化分析。
信息来源:Google AI:DEV 作者专属(RSS)
观点 / 方法精选
一个实用的深度思考Prompt:用"双向钢人论证"让AI帮你挖出最本质的答案
作者基于Reddit上"让Claude真正开始思考"的帖子,引入逻辑学中的"钢人论证"(steelman)概念,并自创了一个"双向钢人Prompt"。该Prompt通过重述真实问题、强化正反双方观点、找出关键变量、逼AI给出明确判断四步,旨在避免模型谄媚,帮助用户找到问题最本质的答案。作者以自己选择公司司庆日的真实案例演示了使用效果。
信息来源:公众号:数字生命卡兹克 · Claude
观点 / 方法精选
Qwen 3.8 27B 表现出色,但默认推理强度过高导致过度思考
阿里 Qwen 实验室发布 Apache 2 许可的 27B 参数视觉大模型 Qwen 3.8 27B,官方基准显示其超越前代 Qwen 3.6 27B 及闭源 Qwen 3.7-Plus。
信息来源:Simon Willison 博客 · Qwen