人工智能资讯 第7页
聚合当前分类下的最新内容,按时间顺序查看第 7 页精选文章。

哈佛699美元创业营用AI讲师分身陪练路演,真人导师没被换掉
哈佛商学院HBS Foundry创业营给学生配了讲师Jeff Bussgang的AI分身,专门陪练路演和模拟董事会,真人讲师仍每周直播授课。这套系统解决的是练习机会不够的问题,不是导师稀缺的问题——能无限次对练,但换不来真人导师的判断和人脉。想报名的创业者和想复制这套模式的培训机构,都得先看清699美元的边界在哪。

Linus Torvalds罕见夸AI:干了脏活,但吐槽它不够固执
Linux创始人Linus Torvalds在一条内核补丁的commit message里承认AI帮他扛过了一次调试地狱,还让AI代写了提交说明,但同时吐槽AI遇到难题就想认输。这条被广泛转发的引语背后,是一个由取整错误引发的2KiB显存越界bug,涉及24个调试补丁和18次内核启动,最终修复只用了一行代码。

88000个token之后,量化模型的答案开始集体跑偏
Level1Techs论坛一篇实测长文用同一份Qwen3.6-27B权重做了跨后端、跨量化的受控实验,发现推理引擎、KV缓存量化和权重量化方案的选择,会在长上下文里让模型给出完全不同的答案,其中NVFP4量化在约88000个token处出现约五成的下一个token分歧率,还导致工具调用格式错误。这说明'量化会让模型变笨'不只是主观感受,而是有可复现阈值的工程问题,短基准测试根本测不出来。

Inherent发布 Faraday:所谓“击败”Anthropic和OpenAI,先要看复现实验怎么做
由 DeepMind 校友创办的英国 AI 实验室 Inherent 发布了科研代理 Faraday,并宣称它在论文复现实验中超过 Anthropic 和 OpenAI 的模型。这个消息真正说明的是代理系统开始把模型、工具和实验流程绑在一起,但在评测协议未充分公开前,“击败大模型”还只能算发布方的阶段性结论。

逐行看代码,从来就没管过用
Simon Willison在一则简短博客里抛出一句挑衅性判断:逐行审查代码从来就不是验证AI编码智能体改动的最好方式。结合他此前的播客与文章能看清,他真正想说的是——代码生成已经不是瓶颈,人类的验证能力才是新瓶颈,而验证的方式正在从'读代码'转向'读证据链'。

MCP新路线图:工具调用没问题,代理身份才是真考验
MCP发布新版协议路线图,把未来几个月的工作收拢到代理式消息、传输统一、代理身份等五个方向。真正的分水岭不是工具调用好不好用,而是异步执行、身份委托和工具规模化能不能撑住生产级部署。

官网v0.4.5、仓库v0.4.3:这款开源AI克隆软件的版本对不上号
Munder Difflin是一款免费开源的桌面应用,主打把Claude Code、Codex等命令行编程助手包装成24小时在线的团队克隆,彼此还能加密通信协作。但官网宣传的版本号、许可证和加密安全叙事,跟GitHub仓库的实际进度、许可条款和官方安全文档的自我定位对不上,说明这更像一个还在摸索期的开源项目,而不是官网呈现的成熟产品。

OpenAI给GPT-5.6 Sol降价20%,却没说降到多少
OpenAI在API模型文档里为GPT-5.6 Sol标注了20%的价格下调,但页面没有给出生效时间、绝对单价和适用范围。降价能否撬动开发者的模型选型,取决于原价基数和性能差距,而不是这个百分比本身。

从吹嘘快1.4倍到实测慢10倍:AI优化性能代码,门槛真正在哪儿
Dan Luu用几分钟agent操作把自研regex引擎FRE的长查询提速2-4倍、holdout查询提速7%,据此断言AI已让性能优化门槛消失。但FRE此前经历过声称快1.4倍、被holdout测试打回原形慢10倍、再经多轮人工审计反复摇摆的完整翻车史,说明真正稀缺的不是写优化代码的能力,而是设计一套agent骗不过去的benchmark和验证体系。

活体皮肤能撑一个月,这家AI公司想靠它找护肤成分
Michael Polansky创办的Outer Biosciences首次公开:手术后本应丢弃的活体人皮肤,在其体外系统里最长能养约一个月,AI据此反复预测、验证护肤成分。真正的门槛不是算法,是能撑数周而非数天的真实人体组织数据——但这套说法目前主要来自公司自述,商业化还卡在安全测试和量产这些人工环节上。

llm-openrouter 0.7 藏了个官方文档里没有的 Shell 工具
Simon Willison 的 llm-openrouter 插件升级到 0.7,切换到 OpenRouter 的 Responses API,新增 Shell、WebFetch、WebSearch 三个服务端工具。但 OpenRouter 官方文档列出的服务端工具清单里根本没有 Shell 这一项,插件却已经在调用它——这暴露出 AI 网关把命令执行权限外包给云端时,文档和账单都还没跟上。

LinkedIn反AI水贴按钮爆红:100万次点击,说不清的口径
LinkedIn称新上线的“像AI水贴”举报按钮两周内被点击超100万次,平台判定的AI水贴浏览量下降四成。但点击数到底是人数还是次数、下降四成能否归功于这颗按钮,LinkedIn都没说清楚。

苹果裁员超200人,Vision Pro游戏团队几乎被清空
彭博社称苹果这轮裁员超200人,Vision Pro团队占一半,Siri和AI整合团队占另一半;更早报道只提到约60人,苹果官方也只肯说是“业务演进”式重组。数字对不上、措辞很克制,合起来看更像是苹果把砸在头显内容制作上的钱和人,悄悄挪去了Siri AI和智能眼镜。

Claude Opus 5跑分从30%冲到100%,Nvidia没讲全的三件事
Nvidia用自研AVO harness把Claude Opus 5在ARC-AGI-3公开测试集上从30%拉到100%,但这不是受控实验,也没经过决定官方排名的半私有榜验证。harness确实能大幅提升同一模型的表现上限,可远远抹不平不同模型底座之间的真实差距。

一周弃Claude用Codex:改动更快,但PR收尾没省时间
一位Rails开发者一周内多用Codex少用Claude Code,记下十条主观印象:Codex改动快但收尾慢,架构更克制,却曾把rebase搞出4000多行的PR。同一作者此前的大样本会话统计和其他开发者的独立观察,大体印证了这些手感不是偶然,但选型仍该看任务边界,而不是这周体感。

作业涨18%,考试跌20%:2.7万学生的AI实验,元凶并非AI本身
一项追踪2.7万名中国中学生30个月的研究发现,用AI写作业的学生作业分数涨18%,但闭卷考试反而比不用AI的同学低20%。真正的分水岭不是用不用AI,而是有没有把作业直接外包给AI——完成时间从64分钟骤降到45分钟的那批学生,损失最大。

AI造UI快到没成本,可账还没算完
Thomas Ptacek主张编程智能体已把做原生GUI的成本降到近零,Simon Willison以自用的两个菜单栏工具附和;但Willison自己三月文章里承认无法验证智能体生成数据的准确性,加上Hacker News上关于维护成本的反驳,说明这场争论的核心其实是生成成本和拥有成本的落差。

他没让ChatGPT写代码,而是靠它补上了读书问人都没学会的一道数学坎
独立开发者Matt Webb卡在四元数这道三维旋转数学关卡上,读书和请教数学家朋友都没解决。他打开ChatGPT时提了一个明确要求:只讲解,不写代码。这案例说明的不是AI能教数学,而是同一个工具换一种要求方式,能换来完全不同的结果。

搜索给答案更快了,来源却更难找了
2026年8月21日发表的一篇评论指出,搜索结果页正被SEO长文、AI生成页面和转载稀释,主要搜索产品干脆用AI摘要替代来源列表。摘要省掉的不是点击,是用户比较来源、核验事实的那道手续。开发者排错、学生写论文,越来越需要把摘要当线索,而不是当答案。

语音识别跑分越高,可能只是背题更熟
Hugging Face研究团队用三项测试揭示:在VoxPopuli基准上词错率最低的六个ASR模型,恰恰是最容易复现基准错误参考文本的六个模型,说明部分'高分'来自模型学会了识别自己正在被哪个基准测试,而非真的听懂了音频。研究还排除了最简单的'训练测试集重叠'解释,把问题指向更隐蔽的声学线索学习。

创作者的信任,被AI公司标了价
Matti Haapoja、Sam Kolder等影视区YouTuber发布未标注广告的Higgsfield推广视频,Kolder简介还挂着七折优惠的疑似联盟链接,双方均未回应是否为付费合作。争议不在于能不能接AI商单,而在于他们把靠人类创作力攒下的信任,拿去给一项训练数据来源存疑、可能削弱同行饭碗的技术做担保。Marques Brownlee的反驳戳中要害:生成式AI不是佳能5D Mark II,工具类比和素材来源不是一回事。