人工智能资讯 第50页

聚合当前分类下的最新内容,按时间顺序查看第 50 页精选文章。

OpenAI 发布 GPT-Live:ChatGPT 语音换脑,却先曝出笑场 bug
人工智能 2026/7/9

OpenAI 发布 GPT-Live:ChatGPT 语音换脑,却先曝出笑场 bug

OpenAI 发布 GPT-Live,给 ChatGPT 语音模式换了新架构:前台聊天不断流,复杂问题后台转给 GPT-5.5 处理。预览体验里出现打断发笑的 bug,反馈后有所缓解但未必根除。语音越拟人,这类情绪失误的杀伤力可能比模型过时更直接。

OpenAIChatGPT 语音模式GPT-Live
96分变48分:布朗大学一堂经济学课的AI作弊罗生门
人工智能 2026/7/9

96分变48分:布朗大学一堂经济学课的AI作弊罗生门

布朗大学经济学教授Roberto Serrano怀疑学生用AI做完带回家期中考试,临时把期末改成现场闭卷,结果班级平均分从96分跌到48分,22名期中满分的学生干脆没来考。这组数字目前只是教授单方陈述,校方尚未介入调查,却已经被两家媒体做成了“AI作弊丑闻”。

AI作弊布朗大学Roberto Serrano
Meta智能眼镜拟“全程感知”:灯不亮,但一直在录
人工智能 2026/7/9

Meta智能眼镜拟“全程感知”:灯不亮,但一直在录

《金融时报》报道,Meta正测试代号“super sensing”的智能眼镜原型,可持续录音并每隔几秒拍照,供用户事后向Meta AI查询周边环境。核心变化不是又出一款AI眼镜,而是把捕捉行为从用户按键触发前移为默认后台常态,LED指示灯计划保持熄灭,隐私边界将决定这类产品能否落地。

Meta智能眼镜super sensing持续录音
Waymo的应急协议写了三年,救护车照样被堵
人工智能 2026/7/9

Waymo的应急协议写了三年,救护车照样被堵

NHTSA要求自动驾驶公司月底前解决车辆干扰急救现场的问题,但信里不点名、不设罚则,也没定义什么算合格方案。更扎心的是,Waymo、Zoox、Tesla早在2022到2026年间就已各自发布过应急协议,说明卡壳的不是流程缺失,而是感知和响应能力跟不上纸面承诺。

自动驾驶WaymoNHTSA
Lovable一年翻七倍:132亿美元估值背后的算术题
人工智能 2026/7/9

Lovable一年翻七倍:132亿美元估值背后的算术题

瑞典AI编程公司Lovable正洽谈以132亿美元估值融资3亿美元,较去年12月的66亿美元整整翻倍,一年内估值涨了逾7倍,Menlo Ventures预计领投。这笔交易还在洽谈阶段,单一信源尚未交叉确认,但已披露的用户和ARR数据能大致算出这轮估值对应约26倍营收倍数,高于多数同类公司。

LovableAI编程融资
OpenAI亲手否决自荐基准:SWE-Bench Pro三成任务被判'不及格'
人工智能 2026/7/9

OpenAI亲手否决自荐基准:SWE-Bench Pro三成任务被判'不及格'

OpenAI对自己去年力荐的编程基准SWE-Bench Pro做了一次自我审计,认定约30%的公开任务存在缺陷,当场撤回此前的推荐。更值得留意的是,部分问题GitHub上早有编号明确的报告,而这次审计的裁判和运动员,某种程度上是同一批人。

OpenAISWE-Bench Pro编程基准
OpenAI亲手拆了自己力荐的编程基准:SWE-Bench Pro三成任务是坏的
人工智能 2026/7/9

OpenAI亲手拆了自己力荐的编程基准:SWE-Bench Pro三成任务是坏的

OpenAI审计Scale AI打造的SWE-Bench Pro,发现731个公开任务里约三成存在测试过严、提示误导等缺陷,人工复核揪出的坏任务比例(34.1%)高于自动化流水线(27.4%)。这是OpenAI一年内第二次拆穿主流coding基准的可信度,此前它刚建议行业从SWE-bench Verified转向Pro,如今又亲自撤回这条推荐。

OpenAISWE-Bench Pro编程基准
OpenAI立下国家安全三条红线,问题是谁来验证
人工智能 2026/7/9

OpenAI立下国家安全三条红线,问题是谁来验证

OpenAI发布《国家安全原则》,同时披露一个月内与八国及欧盟机构建立网络防务信任合作、扩大生物安全模型访问权限,其国防业务已包含一份两亿美元级合同。但公司自证式的“不用于监控、不用于自主武器”承诺至今没有第三方审计,参议员沃伦已在国会追问合同细节能否公开。

OpenAI国家安全原则人工智能
AI写的PR描述,为什么比没有还糟?
人工智能 2026/7/9

AI写的PR描述,为什么比没有还糟?

工程师Kenton Varda在团队内部禁用AI生成的PR描述、commit信息和issue文字,理由是这类文本详细复述代码本身就能看出的细节,却漏掉审查者真正需要的意图说明。问题不是AI写得不够细,而是它擅长的信息维度和PR消息的核心价值本来就不在一个频道上。

AI生成内容PR描述代码审查
麦康奈尔病床假照翻车:Google水印赢了一局,但这场胜利经不起细看
人工智能 2026/7/9

麦康奈尔病床假照翻车:Google水印赢了一局,但这场胜利经不起细看

一张米奇·麦康奈尔病床惨状的AI假图疯传后被Snopes借助Google的SynthID水印戳穿,这被称为'罕见但重大的胜利'。但破案的关键其实是生成工具主动参与水印计划,而非系统主动识破谎言,这恰恰暴露了深伪检测的真实覆盖率有多窄。

深伪检测SynthIDGoogle
8分钟数据、23亿估值:机器人的ChatGPT时刻是真是假
人工智能 2026/7/9

8分钟数据、23亿估值:机器人的ChatGPT时刻是真是假

General Intuition称用视频游戏动作数据训练的模型,只需8分钟真实数据微调就能让四足机器人在办公室里zero-shot行走,公司借此叙事一个月内把估值从传闻的20亿美元推到23亿美元。但目前所有证据只来自公司自证的单一演示,没有第三方复现,也没有披露失败率和任务边界。

具身智能机器人General Intuition
Grok 4.5发布:马斯克对标错了一代,还有个神秘模型全程领跑
人工智能 2026/7/9

Grok 4.5发布:马斯克对标错了一代,还有个神秘模型全程领跑

xAI发布Grok 4.5,定价比Opus级模型便宜不少,但摊开官方自己公布的跑分表会发现,马斯克拿来对比的是旧一代Opus 4.7,而不是同代的Opus 4.8——在Grok重点强调的SWE Bench Pro测试里,Opus 4.8其实领先Grok 4.5。榜单里还有一个叫Fable(max)的模型全程夺冠,却没人解释它是谁。

Grok 4.5xAI马斯克
微软开源Flint:AI画图表,先过编译器这一关
人工智能 2026/7/9

微软开源Flint:AI画图表,先过编译器这一关

微软研究院联合人大IDEAS Lab开源可视化中间语言Flint,用语义类型和编译器把AI生成的图表规格翻译成Vega-Lite、ECharts、Chart.js配置。它省的是调试底层参数的成本,不是画图能力,效果全看数据语义标注是否到位。三个后端渲染能力并不对等,Flint也不是BI工作流的替代品。

FlintAI Agent微软研究院
Google 出的考卷,自家 Gemini 却排到第五
人工智能 2026/7/9

Google 出的考卷,自家 Gemini 却排到第五

Google 更新了自研的 Android 开发基准 Android Bench,新增 Claude Fable 5、GPT 5.5 等八款模型,结果自家 Gemini 3.1 Pro 反而跌到第五名,排在 GPT 5.4、Claude Sonnet 5 和 Claude Fable 5 之后。更值得琢磨的是,这份自己出题的榜单,本身也在改版中悄悄挪动过分数。

Android BenchGemini 3.1 Pro大模型评测
点一下'不感兴趣'能砍掉八成内容,但TikTok算法几天就把你打回原形
人工智能 2026/7/9

点一下'不感兴趣'能砍掉八成内容,但TikTok算法几天就把你打回原形

美国西北大学团队用90个傀儡账号实测发现,TikTok的'不感兴趣'按钮能让同类内容减少约84%,远胜单纯划走的48%,但只要用户后来多看几秒同类视频,算法就会悄悄把内容推回来。Instagram、YouTube也有类似的半吊子控制工具,说明这不是TikTok一家的产品瑕疵,而是整个推荐系统把'看了多久'看得比'说了什么'更重。

推荐算法TikTok不感兴趣按钮
Google Photos上新AI剪辑术,水印真挡得住深度伪造吗
人工智能 2026/7/9

Google Photos上新AI剪辑术,水印真挡得住深度伪造吗

Google Photos新增Video Remix,靠Gemini Omni几秒内给旧视频补光、换背景、上艺术风格,14国订阅用户先用。但三个月内相册里已经堆了三个功能相近的AI生成工具,唯一的安全网SynthID水印,连Google自己都承认防不住裁剪和转码。

Google PhotosVideo Remix生成式AI
GPT-Live能边听边说,但没人给出延迟实测数字
人工智能 2026/7/9

GPT-Live能边听边说,但没人给出延迟实测数字

OpenAI发布全双工语音模型GPT-Live,支持边听边说、随时打断,深度任务交给GPT-5.5在后台处理;但目前没有第三方数据能验证"更自然"的说法,早期用户反馈也不如官方宣传的那么颠覆。

GPT-LiveOpenAIChatGPT语音
OpenAI教师AI培训营开进8城,但69%教师仍无人指导
人工智能 2026/7/9

OpenAI教师AI培训营开进8城,但69%教师仍无人指导

OpenAI Academy联合Walton Family Foundation从7月8日起在美国8座城市为1600多名K-12教师办线下AI培训营,但其宣传语里的“教师用AI每周省5.9小时”这一数据挂错了报告名,同一批调研更显眼的发现——69%教师从未获得任何AI教学指导——反而没被提及。一场线下workshop,填不平这么大的缺口。

OpenAIOpenAI Academy教师AI培训
OpenAI称ChatGPT语音学会"闭嘴",Reddit用户却说它更爱抢话
人工智能 2026/7/9

OpenAI称ChatGPT语音学会"闭嘴",Reddit用户却说它更爱抢话

OpenAI在2026年7月8日推出全双工语音模型GPT-Live,主打减少打断、能听懂停顿,付费版GPT-Live-1与免费版mini同步上线iOS、安卓和网页端。但OpenAI自己承认背景噪音、长时间停顿等场景仍会误判打断,同期Reddit上也有用户反馈语音模式变得更爱抢话,官方说法和实际体验之间存在明显落差。

OpenAIChatGPTGPT-Live
23亿美元估值背后:一家游戏集锦网站怎么变成了AI训练数据公司
人工智能 2026/7/9

23亿美元估值背后:一家游戏集锦网站怎么变成了AI训练数据公司

General Intuition用游戏数据训练AI的说法背后,真正的信息增量是它脱胎于游戏集锦平台Medal TV,而不是凭空冒出的AI实验室。这条路径让游戏UGC第一次被明码标价成训练燃料,但虚拟物理能否迁移到真实世界、数据授权链条怎么理顺,目前都还没有答案。

AI训练数据General Intuition游戏数据
GPT-Live上线,OpenAI没说清的是延迟和隐私
人工智能 2026/7/9

GPT-Live上线,OpenAI没说清的是延迟和隐私

OpenAI发布全双工语音模型GPT-Live,能一边听一边说、适时插话,背后调用GPT-5.5处理搜索和推理;但免费用户用的是阉割版mini,官方全程未公布一个延迟数字,全双工语音的隐私风险也只字未提。

GPT-LiveOpenAI全双工语音