AI 观点与方法
汇总 AI 使用技巧、实践方法、效率经验、行业观察与专业观点。
分类文章1289
当前页25 / 33
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
观点 / 方法精选
Claude Code团队工程总监分享5条AI原生工作原则
Claude Code团队工程总监Fiona Fung提出,AI时代软件工程瓶颈从"写代码太贵"转移至验证、评审与安全。团队采用JIT规划,先做原型再补文档;遇到重复工作追问"能否自动化",形成肌肉记忆。代码评审中Claude承担60-70%风格检查与漏洞捕捉,人类聚焦法律、安全与产品判断。角色边界模糊,PM写代码、工程师用Claude起草文案,招聘看重品味与判断力而非代码产出速度。
信息来源:公众号:数字生命卡兹克 · Claude
观点 / 方法精选
智能性价比
微软在模型发布卡中首次加入平均token使用量指标。其模型在SWE-Bench Verified上达71.6分,仅消耗约Claude Haiku 4.5三分之一的token。Artificial Analysis的Intelligence Index显示GPT 5.5与Claude Opus 4.8得分相近(约60分),但Opus 4.8运行成本高出40%($4,685 vs $3,357)。Uber因四个月内AI预算超支而限制员工使用;Salesforce花费$3亿购买A…
信息来源:Tomer Tunguz 博客(VC 分析) · GPT / Claude
观点 / 方法精选
Claude Code 自我检查与反馈闭环技巧
如何让 Claude Code 在交回工作前检查自己的成果? 看看如何编码你的手动检查,让 Claude 自己关闭反馈循环:
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
观点 / 方法精选
突发:AI理智的梦想成真时刻
Gary Marcus在其个人专栏中分享了一个真实的瞬间,以此反映了他对于人工智能实现稳定、可靠(即"理智")发展的思考与期许。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS)
观点 / 方法精选
Anthropic 用 Claude 赋能自助数据分析
Anthropic 使用 Claude 自动化了 95% 的业务分析查询,整体准确率约 95%。其关键在于构建智能体分析栈(agentic analytics stack),通过数据基础层、维护验证流程和技能(skills)分别解决概念-实体歧义、数据过时和检索失败三大错误来源。相比编码场景,数据分析的难点在于将用户问题映射到正确的数据实体,而执行 SQL 反而是简单的。Anthropic 的数据科学团队因此得以专注于因果建模、预测和机器学习等战略工作。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
Claude Code技能使用经验:Anthropic内部实践
Anthropic 分享了内部使用 Claude Code 的 Skills(技能)功能的经验。Skills 是指令、脚本和资源的文件夹,智能体可发现并调用它们以提升准确性和效率。Anthropic 内部已有数百个活跃使用的技能,它们可归为九类,包括库和 API 参考、产品验证、数据获取与分析、业务流程与团队自动化、代码脚手架与模板、代码质量与审查等。最佳技能专注于单一类别,涵盖过多功能会混淆智能体。团队发现,投入时间优化验证类技能对 Claude 输出质量的提升最显著。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
洪水韧性新篇章:Google 开源水文建模框架
Google Research 在 GitHub 开源了其水文建模框架,这是一个基于 PyTorch 的 Python 包,采用与 Flood Hub 河段洪水预报相同的模型架构和训练数据。该框架允许研究者和预报员训练 AI 洪水预报模型、添加新模型与数据,并已与捷克水文气象研究所(CHMI)等合作测试。开放模型架构和训练管线旨在让各国气象水文部门在保留数据完全控制权的同时,整合基于 AI 的洪水预报。
信息来源:Google Research:Blog(网页)
观点 / 方法精选
Gary Marcus:为什么事情终将崩塌
知名人工智能批评者Gary Marcus在其关于可信赖AI的专栏中,探讨了人工智能发展面临的根本性挑战。文章开篇即指向问题的核心,指出相关数学理论的局限性与人类心理的复杂性,是导致AI系统最终可能出现问题的根源。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS)
观点 / 方法精选
商汤开源SenseNova-Skills AI办公技能套件
商汤开源了AI办公技能套件SenseNova-Skills。这是一个为任何技能兼容智能体(如OpenClaw与HermesAgent)设计的开源技能集合,提供四大核心功能:图像信息图表生成(可镜像参考风格)、数据分析(支持多表解析、清洗与可视化)、PPT创建(生成大纲内容并智能排版,输出可编辑文件)以及深度研究(跨学术、技术、社交等多源搜索并生成报告)。该技能套件现已完全开源。
信息来源:X:商汤 SenseTime (@SenseTime_AI)
观点 / 方法精选
基于 Codex 的开源 AI 技能"清理垃圾.skill":自动扫描电脑生成 HTML 报告,一键清理垃圾
作者基于 Codex 创建并开源了"清理垃圾.skill",可对 Mac 和 Windows 电脑进行只读扫描,自动生成可交互的 HTML 报告,将文件按优先级分为绿灯(可自动清理)、黄灯(建议手动)、红灯(跳过)。在作者的 MacBook Air 上扫出近 120 GB 垃圾,其中 96.7 GB 为 B 站离线缓存视频,而 CleanMyMac 仅检出 15.8 GB。用户可在网页上逐项或一键清理,全程需二次确认,项目已开源至 GitHub。
信息来源:公众号:数字生命卡兹克
观点 / 方法精选
Karpathy 分享学习方法论
🎯 Andrej Karpathy 谈如何学习。
信息来源:X:Rohan Paul (@rohanpaul_ai)
观点 / 方法精选
开放模型的繁荣生态
根据OpenRouter平台数据,自2025年以来,开放模型使用量显著增长。最新数据显示,开放权重模型产生了69.1%的token使用量,闭源模型为30.9%。新模型的发布会吸引开发者测试,推动token使用量达到新的平台期。开放模型市场内部竞争激烈,领导地位频繁更迭,如DeepSeek的早期优势在2025年末至2026年初被MiniMax与Kimi模型取代,随后MiMo、Qwen、腾讯Hy3、阿里巴巴及Arcee等模型的发布再次改变了份额格局。尽管开放模型目前仍只占推理总…
信息来源:Tomer Tunguz 博客(VC 分析) · DeepSeek / Qwen / Kimi
观点 / 方法精选
Sam Altman强调AI发展应以人为本
Sam Altman在采访中表示,AI不应被设计为追求脱离人类需求的目标,人类必须始终处于AI发展的中心。他批判了行业内"AI将摧毁大量工作"等言论,认为人们担忧的并非AI带来的好处,而是自身在未来的角色、经济前景与自主权。他指出,AI行业的失败在于未能清晰解释人类如何在每一步保持对未来的控制权,以及如何在AI时代继续拥有充实、有意义的生活。
信息来源:X:Rohan Paul (@rohanpaul_ai)
观点 / 方法精选
Google AI 展示并行子智能体自动整理文件
从杂乱到清晰。观看 @Antigravity 中的并行子智能体对数百个营销资产进行分类和重命名,消除手动文件管理。
信息来源:X:Google AI for Developers (@googleaidevs)
观点 / 方法精选
Gemini Omni支持创建个人数字分身
轻松将自己添加到Gemini的视频创作中。 以下是如何使用Gemini Omni创建一个外观和声音都像你的数字分身。🧵
信息来源:X:Gemini (@GeminiApp) · Gemini
观点 / 方法精选
超越LLM:为何可扩展的企业AI采用取决于智能体逻辑
可扩展的企业AI采用需超越大语言模型,依靠智能体逻辑来引导模型执行动态、长周期且受约束的企业工作流,从而提升质量、降低成本并建立信任。文中以IBM watsonx Code Assistant for Z为例,展示了智能体逻辑如何通过程序分析等技术,在理解大型遗留代码库时,相比纯LLM基线方法,能以约30倍更低的token消耗达到更优性能。在加速测试生成任务中,该方法亦能使代码覆盖度提升20%-45%,同时token消耗降低最高达15倍。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
开源与闭源模型在不同的增长曲线上
当模型智能的微小提升能直接转化为实际价值时,开源与闭源模型正沿着不同的增长路径发展。闭源模型通过在特定场景下提供更高的边际智能来创造价值,而开源模型则在其他维度寻找增长点,两者形成了差异化的竞争格局。
信息来源:Nathan Lambert:Interconnects(RSS)
观点 / 方法精选
AI看跌情绪地图
金融市场对AI的看跌情绪正从整体上升转向板块分化。上季度,软件、半导体、云及超大规模公司的空头比例中位数上升约24%。GPU数据中心业务空头股份在过去一年激增60%。AI云与新型云公司的当前空头比例中位数最高,达16.8%,SaaS与开发工具领域随后,分别为9.5%和8.9%。相比之下,超大规模公司和NVIDIA的空头比例极低,仅为1.1%和1.2%。市场怀疑主要针对那些AI业务仍依赖未来资本、需求或运营杠杆的中小型公司。
信息来源:Tomer Tunguz 博客(VC 分析) · NVIDIA
观点 / 方法精选
Anthropic CEO Dario Amodei:AI指数级发展呼唤政策紧急应对
Anthropic CEO Dario Amodei 发表博客指出,AI 以指数级速度发展--四年内模型从勉强写出一行连贯代码到编写主流 AI 公司的大部分代码,而政策制定周期却极其缓慢。Claude Mythos Preview 证明了前沿模型对网络安全构成真实威胁,可能冲击金融、关键基础设施和国家安全。Amodei 认为生物风险与 AI 自主风险即将接踵而至,呼吁全球重新审视监管、宏观经济、科学创新、国家权力和地缘政治五大领域。Anthropic 同日发布了前沿模型测试…
信息来源:Dario Amodei:Blog(网页) · Claude
观点 / 方法精选
我花200英镑把一台数据中心级GPU装进了我的游戏电脑
一名用户以200英镑的价格购入了一块数据中心级GPU,并将其成功安装到自己的游戏电脑中。文章记述了这一非标准硬件改装过程、遇到的技术挑战以及最终实现本地运行大语言模型的体验。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法精选
Step 3.7 Flash:可运行于桌面级设备的198B视觉模型
阶跃星辰发布了Step 3.7 Flash,这是一款198B参数的视觉模型,旨在DGX Spark等桌面设备上运行。用户实测表明,128GB统一内存是运行门槛,模型占用约104GB。部署无需官方专用llama.cpp分支,主线版本即可。在上下文长度上存在权衡:启用视觉功能时,基于q8 KV cache的64K为上限;若要使用最高256K上下文,则需禁用视觉并切换至q4 KV cache,此时模型与缓存共占约114GB内存。该模型是推理模型,思考过程可能消耗大量max_tok…
信息来源:X:阶跃星辰 StepFun (@StepFun_ai) · Llama
观点 / 方法精选
AI引发的职业焦虑:席卷科技从业者的心理危机
AI 技术的快速发展在科技从业者中引发了普遍的职业焦虑与心理危机。文章指出,许多专业人士担心自身技能被自动化取代,从而产生强烈的不安全感、抑郁情绪及身份认同危机。这种焦虑不仅源于对失业的恐惧,也涉及工作意义感的丧失、人际关系的变化以及对未来的迷茫。面对冲击,个体反应不一,但整体而言,这已演变为一场需严肃对待的行业心理挑战。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法精选
在浏览器中通过 Pyodide 和 Service Worker 运行 Python ASGI 应用
作者展示了如何在浏览器中通过 Pyodide 和 Service Worker 运行 Python ASGI 应用。此前的 Datasette Lite 使用 Web Workers,但无法执行 ` ` 标签中的 JavaScript。新方案由 Claude Opus 4.8 协助完成开发,解决了这一问题。作者已展示了基础的 ASGI FastCGI 演示和运行 Datasette 1.0a31 的演示,并计划后续将此方法应用于升级 Datasette Lite。
信息来源:Simon Willison 博客 · Claude
观点 / 方法精选
NVIDIA 或将于六月发布整合 Blackwell GPU 与 AI 单元的 ARM 笔记本芯片 N1X
NVIDIA、微软与 Arm 同步发布指向台北音乐中心的坐标,暗示 6 月 1 日发布会将有重大动作。此举被认为是 NVIDIA 与联发科合作的 ARM 笔记本芯片 N1X 的预告。该芯片整合了 CPU、基于 Blackwell 架构的 GPU 及 AI 单元,目标是使轻薄本具备接近 RTX 4070 的图形性能。这标志着 NVIDIA 的战略转变:从显卡供应商,转型为定义整机核心方案的提供商,将直接冲击 Intel、AMD 和高通在 PC 市场的地位。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · NVIDIA
观点 / 方法精选
随着成本飙升,美国企业开始对人工智能实施配给
由于运行和使用AI工具的成本持续飙升,美国企业正开始对人工智能的使用实施配给制。企业通过限制使用量、设置分层级审批流程等方式控制开支,以应对AI费用增长过快的问题。这种从广泛采用转向精细化管理的策略,标志着企业在AI应用上从追求速度转向注重成本效益。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法精选
免费领取6个月ChatGPT Pro及AI工具思考
OpenAI为开源项目维护者提供福利,可免费领取6个月ChatGPT Pro(价值$1200),申请无硬性Star数要求,有项目链接即可。同时,文章引用讨论了AI工具的分类:一类是"agent型"(如Claude Code、Codex),可自主运行;另一类是"实习生型"(如Cursor),需人工决策,有助于使用者以术入道、培养判断力,但受限于需人在场。作者推荐了网易的UU远程工具,称其免费两年,支持4K 144帧无延迟连接Mac并可使用原生终端,解决了"实习生型"工具的地点…
信息来源:X:阿易 AI Notes (@AYi_AInotes) · OpenAI / ChatGPT / Claude
观点 / 方法精选
参与我们的 I/O 2026 测验:该测验由 Google AI Studio 氛围编程生成
Google 使用其开发工具 Google AI Studio,通过氛围编程(vibe coding)方式,创建了一个关于 Google I/O 2026 主要公告的在线测验。
信息来源:Google Blog:AI(RSS)
观点 / 方法精选
当公司过于"AI上瘾"时会发生什么?
Box创始人Aaron Levie指出,决定用AI替代员工的人往往最不了解工作的实际内容,他将此称为"AI psychosis"。ClickUp近期为部署AI智能体裁员22%即是一例。2026年的科技行业裁员规模已接近2025年全年。
信息来源:TechCrunch:AI(RSS)
观点 / 方法精选
亲测为实:难以置信的推理速度
Kog团队在标准数据中心GPU上实现了极高的单用户推理速度,在8× AMD MI300X GPUs上达到3,000 tokens/s,在8× NVIDIA H200上达到2,100 tokens/s。相比常规推理速度(约100-300 tokens/s),实现了10-30倍提升。其核心思路是将LLM解码视为内存流问题,通过协同设计monokernel、重建同步机制、针对性内存访问映射及采用延迟张量并行的Laneformer模型架构,消除了传统流程的阻塞点。
信息来源:X:Rohan Paul (@rohanpaul_ai) · NVIDIA
观点 / 方法精选
通义实验室发布教程:在 Android 手机部署 MCP 感知服务器
通义实验室发布教程,演示如何在 Android 手机上部署 MCP 感知服务器,使手机具备本地视觉与听觉分析能力。核心基于端侧 MNN 推理引擎和 Qwen3-VL 2B 模型(约 1.3GB),摄像头与麦克风采集的音视频在本地实时转化为结构化 JSON,再通过 MCP Tool 供 Claude Code 等云端 Agent 远程调用。整个过程不上传原始数据,仅传输语义提取结果。项目已开源,实测可识别红绿灯状态等场景。
信息来源:公众号:通义实验室(千问) · Qwen / Claude
观点 / 方法精选
谷歌 DeepMind CEO 哈萨比斯:AGI 最快三年内到来,研发速度远超预期
谷歌 DeepMind 首席执行官德米斯·哈萨比斯预测,AGI 研发速度远超预期,最快可能在 2029 年至 2030 年前后出现。作为 AlphaGo、AlphaFold 的主导者,他认为当前 AI 智能体是未来更强智能的预演,随着多模态和自主决策能力成熟,三年内迎来 AGI 关键突破已非科幻。但他同时警示,全球社会对 AGI 到来的准备严重不足,必须提前建立规则与防护机制。
信息来源:IT之家(RSS)
观点 / 方法精选
特斯拉 FSD 安全性宣称遭质疑
特斯拉声称其全自动驾驶软件(FSD)安全性最高可达人类的10倍,但路透社调查发现此数据经不起推敲。参与训练FSD的员工表示该技术远未成熟,其安全演示高度依赖人工。统计方法被11位交通安全研究人员指出存在缺陷,例如与更广泛的联邦事故数据进行不恰当比较。相比之下,竞争对手Waymo采用了更严谨的统计方法。目前,特斯拉FSD仍需驾驶员主动监督,安全部署可能还需数年。
信息来源:IT之家(RSS)
观点 / 方法精选
技能提炼
"技能提炼"是一种知识转移方法,由前沿大模型(如 Opus 4.7、GPT-5.1、Gemini 3 Pro)负责撰写并优化标准化的 SKILL.md 流程文件。然后,本地运行的小模型(如 Qwen 35B、Gemma 26B)直接执行这些文件。此过程不同于压缩模型权重的知识蒸馏、训练权重的指令微调或检索事实的 RAG,其核心是提取并转移操作流程,让小模型按步骤执行,从而形成前沿模型作教师、小模型作执行者的循环。
信息来源:Tomer Tunguz 博客(VC 分析) · GPT / Qwen / Gemini
观点 / 方法精选
LMSYS与Intel合作通过异构CPU+GPU EPD架构提升视觉语言模型服务性能
LMSYS团队(Intel与SGLang)通过Dynamo和SGLang框架,为视觉语言模型(VLM)启用了异构编码-预填充-解耦(EPD)架构。该方案将视觉编码任务从GPU卸载至CPU(如Intel Xeon 6747P),与GPU协同工作。在Qwen3-VL-8B-Instruct模型的测试中,采用4 CPU + 1 GPU作为编码器、4 GPU作为预填充解码器(能力比R=12)的配置,在ISL/OSL 128/256、1080p 8张图像的负载下,实现了P99 TTF…
信息来源:LMSYS:Blog(Chatbot Arena 团队) · Qwen
观点 / 方法精选
OpenRouter 支持模型现可选 Flex 与 Priority 服务层级
提示:您可以为支持的模型(OpenAI、Google Vertex 等)使用 Flex 和 Priority 层级。 定价信息请查看各模型页面。文档:https://openrouter.ai/docs/guides/features/service-tiers
信息来源:X:OpenRouter (@OpenRouter) · OpenAI
观点 / 方法精选
英伟达推出 AI 框架 Polar,让 Codex 跑分暴涨 594.74%
英伟达研究团队开源了智能体强化学习框架 Polar。该框架无需重写现有智能体执行框架(如 Codex CLI、Claude Code、Qwen Code、Pi),通过在模型 API 边界放置智能体来接入 GRPO 训练。实验显示,基于 Qwen3.5-4B 模型,Polar 将 Codex 在 SWE-Bench Verified 上的 pass@1 分数从 3.8% 提升至 26.4%(增涨 594.74%)。效率上,其 prefix_merging 技术将训练步骤从 1…
信息来源:IT之家(RSS) · Qwen / Claude / NVIDIA
观点 / 方法精选
人民日报专访华为何庭波:今年秋季的新麒麟手机芯片,性能等相比去年是"跳跃性"提升
华为何庭波提出半导体新演进路径"韬(τ)定律",以"时间缩微"(如逻辑折叠)替代"几何缩微"作为新指导原则。她表示,过去6年华为已基于此自主研发381款芯片。今年秋季将发布新的麒麟手机芯片,这是首个完整的"韬芯片",其性能、集成度相比去年是"跳跃性"提升。
信息来源:IT之家(RSS)
观点 / 方法精选
AI智能体时代下的安全变革
Lemonade的CISO Jonathan Jaffe探讨了AI智能体时代的安全新挑战。他指出,AI对攻击者和防御者同样强大,但可被利用的漏洞窗口正在缩小,因为AI能更快地生成、审查和修补代码。为此,安全团队正向工程团队转型,例如Lemonade的安全部门均由工程师组成,并构建了包含智能体的内部AI平台。同时,每个智能体(单个终端上可能运行200到10000个)都需要被赋予身份,并在操作点由策略进行更复杂的管控,这超越了当前身份与访问管理系统的能力。
信息来源:Tomer Tunguz 博客(VC 分析)
观点 / 方法精选
我认为 Anthropic 和 OpenAI 找到了产品市场契合点
Anthropic 与 OpenAI 通过编程智能体找到了产品市场契合点,这导致企业客户成本显著上升。两家公司已于 2026 年 4 月前后调整了企业套餐定价,从原先的高额折扣改为与 API 用量挂钩。Anthropic Enterprise 套餐变为每席位 20 美元/月外加 API 费用,OpenAI Codex 则按 API token 用量计费。同期发布的新模型 GPT-5.5(4月23日)和 Opus 4.7(4月16日)的 API 定价也显著高于前代版本。
信息来源:Simon Willison 博客 · OpenAI / GPT / Claude
观点 / 方法精选
与Google搜索产品副总裁Robby Stein的访谈:AI原生搜索时代
本文记录了与Google搜索产品副总裁Robby Stein在Google I/O的访谈,核心探讨Google Search向"AI原生"模式的重大转变。讨论话题包括AI Mode是进化还是重塑、如何将复杂问题拆解为多轮搜索、AI搜索的高运行成本、Google TPU及基础设施的优势、AI时代搜索量不减反增的原因,以及优质AI回答与出版商流量之间的张力。访谈还涉及Google决定展示哪些信息源与链接的逻辑,并围绕一个核心问题展开:如果Google直接给出答案,传统的基于链接…
信息来源:X:Kim (@kimmonismus)