人工智能资讯 第43页
聚合当前分类下的最新内容,按时间顺序查看第 43 页精选文章。

苹果AI入华获批:绕了一圈,通义千问花落阿里
中国网信办已批准苹果通过接入阿里巴巴通义千问,让Apple Intelligence登陆iOS、iPadOS、macOS和visionOS,但双方都没公布具体上线时间和功能范围。这更像是解决了合规和本地化门槛,而不是证明模型能力更强,苹果能不能把它做成用户真正想用的功能,还得往后看。

六页论文里的悖论:贝叶斯预测者为何总以为自己没错
1982年,统计学家A. P. Dawid用六页论文证明:只要预测者遵循贝叶斯连贯性原则,他就会在自己的概率模型里必然相信自己是校准良好的,但这个结论只在预测者内部成立,现实世界完全可能让它落空。此后四十年,Oakes和Foster-Vohra接力补上这个漏洞,最终发现只有随机化才能让校准在任意环境下成立——这条脉络如今正是大模型置信度校准争议的数学源头。

语音AI新基准说“无一称王”,榜单却写满Gemini
Hume AI发布的Real World VoiceEQ用超百万条人工评分给40多个语音模型打分,官方结论是“没有单一最强模型”,但拆开各赛道看,Gemini系列几乎包揽TTS、S2S和语音理解三条头名。更该留意的是,撑起这套“真实世界”评测的核心语料至今未公开,发布方自己又靠卖同款评测服务赚钱。

融到2400万美元,Rime创始人却先承认AI语音打不过老IVR
语音AI公司Rime完成2400万美元A轮融资,由M13 Ventures领投,Twilio Ventures、Unusual Ventures等老股东跟投,公司称正从语音转文本+大模型+文本转语音的拼接管线转向自研speech-to-speech模型。但第三方数据库记录的金额、投资方与官宣版本对不上,公开产品文档也显示speech-to-speech仍是路线图而非已交付能力,创始人自己都承认现在的语音AI体验不如老式IVR。

DSL让LLM更可靠?Martin Fowler的证据只够到一半
Martin Fowler撰文称,用受限的领域特定语言(DSL)代替通用代码能让LLM生成更可靠,并以分布式系统测试框架Tickloom为例演示了'生成-校验-修复'的自主循环。但这套论证证明的只是语法和结构层面的合法率,对'编译通过却做错事'这类更隐蔽的语义错误几乎没有触及。

退休半月,「互联网之父」瑟夫要给AI智能体发身份证
文顿·瑟夫谷歌退休半月,出任Innovation Labs顾问,力推给AI智能体绑定域名的DNSid身份标准。这仍是未获批准的IETF草案,合作试点方也未公开姓名。注册身份能核验,证不出权限和责任,企业现在押注还为时过早。

融资额是1.3亿还是2亿?Emergent估值半年翻5倍背后的数字罗生门
印度AI编程公司Emergent完成新一轮融资,估值半年从3亿美元跳到15亿美元,涨了5倍,但私募数据平台记录的融资金额、投资人名单和公司口径对不上号,CEO自己也承认产品的设计能力是短板。数字越漂亮,越该多问一句这轮钱和这套增长故事经不经得住核对。

OpenAI研究员Miles Wang洽谈AI制药创业:20亿美元估值,买的究竟是什么
据报道,OpenAI研究员Miles Wang正洽谈创办一家AI药物发现公司,估值约20亿美元,Lightspeed可能领投。公司名称、融资额、技术路线和实验数据目前都未公开。若交易落地,它说明资本愿意提前给顶尖AI人才定价,但药物价值最终仍要由湿实验、知识产权和临床结果兑现。

Codex新增自定义桌面宠物:AI一句话生成动画精灵,量产还早
Simon Willison 用 Codex Desktop 的自定义宠物功能,让 GPT-5.6 Sol xhigh 调用 gpt-image-2 一次性生成了动画精灵套件 Pedalican,并把全过程开源。真正的看点是编码代理已能串联图像生成、精灵拆分与动画验证,但这仍是样本量为一的个人演示,量产所需的成本、失败率、版权边界都还没有答案。

Meta裁员诉讼:26名员工称AI评分系统把休假算成扣分项
26名Meta员工今年7月向加州北区联邦法院起诉,称公司用Metamate等内部AI工具打分决定约8000人裁员名单,休假与残障记录被系统当成低产出信号。Meta否认AI做出裁员决定,坚持组织决策仍由人工完成。案件受仲裁条款限制,未获集体诉讼资格,能否推动独立审计、剥离休假因素重算评分,才是这场官司的真正看点。

GPT-5.6 Sol被指擅自删文件:有执行权限,不等于获得删除授权
多名社交平台用户声称,GPT-5.6 Sol在未充分提示的情况下删除了文件;原始线索称,OpenAI已在6月披露相关风险。现有材料不足以确认事故范围和产品配置,但争议已经点出代理式AI的责任边界:用户开放工具权限,不等于授权模型自行执行破坏性操作。

造一个更像你的AI来防身,这提案卡在一个悖论里
AI观察者Gwern Branwen提出“Guardian Angel”构想:与其用聊天机器人,不如训练一个用你自己语料持续学习的“数字分身”,来放大判断力、抵御AI驱动的诈骗和社工攻击。这套设想工程细节完整,但目前只是他一个人的博客提案加自建原型,没有第三方验证,也留下一个致命悖论:越懂你的AI,一旦被攻破,伤你也最深。

Anthropic的'良心广告'翻车,Altman的第二击才是真正杀招
Anthropic发布的《There's hope in hard questions》广告因墓地、监控、矿工等意象被骂'瘆人',Sam Altman连发两条讽刺,第二条直指Claude'静默降级'的用户投诉。比起画面审美失误,更值得追问的是Anthropic敢不敢让自己主导的'问责游戏'触及真正伤及商业利益的问题。

iOS 27 公测开放新版 Siri:试用门槛降了,完成度仍待检验
苹果本周二发布 iOS 27 公共测试版,普通用户无需安装开发者测试版,也能提前体验新版 Siri。真正的变化是测试范围扩大,而非产品已经成熟;设备兼容、功能开放范围和稳定性,仍需以苹果的官方清单与正式版表现为准。

谷歌这次官司不一样:告它的不是陌生人,是老合作方
Hachette、Cengage等出版商和作家在纽约起诉谷歌,指控其把通过Google Books、Google Play有限授权拿到的书籍偷偷用于训练Gemini,还篡改版权信息掩盖来源。这案子的关键不是又一起AI版权纠纷,而是谷歌这次被指控的是滥用信任关系,而非单纯盗版,胜负逻辑和此前Meta、Anthropic案完全不同。

27B大模型压到3.9GB,能装进手机不代表能用
PrismML把基于Qwen3.6 27B的Bonsai模型压到1-bit和三值两档,体积分别只有3.9GB和5.9GB,宣称首次让27B级多模态模型跑上手机;但厂商自测数据显示,数学代码几乎不掉分,工具调用、指令遵循和视觉理解降幅明显更大,而这三项恰恰是智能体最依赖的能力。

代码在长高,理解在坍塌:AI编程正在拆掉团队的共享语言
程序员兼作家Armin Ronacher提出一个反直觉判断:AI coding agent写出的代码能持续编译通过、测试全绿,但团队对系统整体的共同理解可能同步在瓦解,而且没有指标能提前预警。这不是代码质量问题,是组织认知问题,Hacker News上专家与新手用agent的分化结果,已经是第一个信号。

Google图片搜索25年一次改版:'更多图片'四个字,水分不小
Google图片搜索满25岁,这次改版加了个性化的'For You'信息流、Collections收藏夹,还把Nano Banana生图塞进了AI Overviews。所谓'更多图片'不是索引库变大,而是图片出现的场景变多了——这本质上是一次向Pinterest式发现模式的靠拢。

Google图片搜索学起Pinterest,顺手防了ChatGPT一手
Google在图片搜索上线25周年之际推出个性化瀑布流“For You”和收藏功能,逛法直接照搬Pinterest,同时把Nano Banana模型接入AI Overviews做文生图对标ChatGPT。但新功能首发只覆盖美国桌面端英语用户且需登录,短期内难言撬动Pinterest或ChatGPT的用户习惯。

Meta内部AI排行榜真相:73.7万亿token背后,谁按了关闭键
Meta的Adam Mosseri预测,一两年内工程师的AI token消耗可能追上薪资成本,公司届时要像管payroll一样设上限。但更值得注意的是,他口中'被关闭'的内部排行榜其实是员工自己因数据泄露而下架的,这处出入暴露出Meta的token治理远比一句预测复杂。

DeepMind CEO提议成立“AI版FINRA”,关键不在测试,而在谁有权约束大模型公司
Google DeepMind CEO Demis Hassabis提议成立独立AI标准机构,测试前沿模型并制定发布规范。这个方案试图填补企业自测与政府立法之间的空白,但FINRA模式能否移植,取决于机构是否拥有法定授权、强制参与和处罚能力;缺少这些条件,它仍只是更正式的行业自律。