人工智能资讯 第17页

聚合当前分类下的最新内容,按时间顺序查看第 17 页精选文章。

3.1B模型跑分全面开花,但"边缘最强"目前只有厂商自己说了算
人工智能 2026/8/13

3.1B模型跑分全面开花,但"边缘最强"目前只有厂商自己说了算

Liquid AI发布3.1B参数的边缘视觉语言模型LFM2.5-VL-3B,在定位、多图推理等能力上较前代大幅跃升,但官方"同尺寸最强"的说法在多项复杂任务上被更大参数模型反超,且目前没有任何独立测评验证过其宣称的边缘设备真实速度和内存占用。

LFM2.5-VL-3BLiquid AI视觉语言模型
手语翻译进了Gboard,但Google只教会它一种语言
人工智能 2026/8/12

手语翻译进了Gboard,但Google只教会它一种语言

Google DeepMind 发布多语种手语翻译模型 SL2T,率先在 Pixel 11 的 Gboard 和 Live Transcribe 里落地美国手语转英语功能。训练数据覆盖 50 多种手语,但首发只放出一种语言、一款设备,普惠程度仍受平台边界卡着。

手语翻译SL2TGoogle DeepMind
能碰黎曼猜想却写不完一章书,AI卡在哪
人工智能 2026/8/12

能碰黎曼猜想却写不完一章书,AI卡在哪

AI研究者Nathan Lambert写完RLHF教科书后发现,LLM能排版、画图、校对,却写不好一整章技术内容,写作能力标杆至今仍是较老的GPT-4.5和Kimi K2。他的判断是:连组织已知科学知识都做不好,谈自主解决开放性科学问题还太早。

大语言模型长篇技术写作人类反馈强化学习
8.3倍的AI鸿沟,尺子握在OpenAI自己手里
人工智能 2026/8/12

8.3倍的AI鸿沟,尺子握在OpenAI自己手里

OpenAI发布两份企业AI报告,称头部企业人均AI产出是普通企业的8.3倍,半年前这个差距只有2.6倍,Codex已占企业合计token产出的64%。但这套差距完全由OpenAI自家遥测数据定义,token量本身能否代表业务价值、能否排除权限治理和样本偏差,都还没人验证过。

企业AIOpenAICodex
从一只狗到一家公司:Gamgee的mRNA疫苗证据只有一个病例
人工智能 2026/8/12

从一只狗到一家公司:Gamgee的mRNA疫苗证据只有一个病例

Gamgee由创始人给爱犬Rosie定制mRNA癌症疫苗的经历发展而来,已获Y Combinator支持,在澳大利亚招募首批犬类临床试验对象。公司唯一的疗效依据仍是Rosie这一个病例,且她当时同时接受另一种疗法,肿瘤缩小说不清是不是疫苗的功劳。官网写的75%缩小、四周交付都只对应这一个病例,价格、入组标准、伦理审批均未披露。

个性化mRNA癌症疫苗Gamgee犬类临床试验
OpenAI宣称解出十大数学难题,高尔斯给出一个更冷静的判断
人工智能 2026/8/12

OpenAI宣称解出十大数学难题,高尔斯给出一个更冷静的判断

2026年8月,OpenAI宣布其系统解决十个数学与理论计算机科学难题,包括非-sofic群构造和多色拉姆齐数增长证明,但这些成果尚未见到数学界完成同行评审或独立复核的公开记录。剑桥数学家高尔斯指出,这些成果大多是反例或构造型结果,不能据此断定LLM已全面超越人类数学家。他认为真正的限制在于问题的推理结构,而不是命题能否被改写成寻找反例的逻辑外壳。

OpenAI大语言模型AI数学推理
500种新材料,AI只造出了1个
人工智能 2026/8/12

500种新材料,AI只造出了1个

YC初创公司Discovered Materials用一个长周期基准测试了7个前沿模型的材料发现能力,结果它们算出了500多种理论上合格的新材料,但只有1种被判定有可行的实验合成路线。这个反差比数字本身更值得琢磨。

材料发现Discovered MaterialsMaterial Discovery Bench
11个卡住的Agent标签页,揭穿了AI'越用越快'的错觉
人工智能 2026/8/12

11个卡住的Agent标签页,揭穿了AI'越用越快'的错觉

科技博主Brent Fitzgerald休假归来,发现电脑里堆着11个卡在半途的Claude agent,由此反思自己长期依赖AI的习惯。METR的受控实验数据显示,这种'AI必然提效'的默认叙事本身就站不住脚:经验开发者用AI反而慢19%,却自认为快了20%,落差高达39个百分点。

AI Agent开发者生产力人工智能提效错觉
llama.cpp 换了官网,命令却对不上文档
人工智能 2026/8/12

llama.cpp 换了官网,命令却对不上文档

llama.cpp 上线新官方主页 llama.app,主打与本地coding agent Pi 的一键集成和跨全硬件的统一二进制,但主页命令`llama serve`与GitHub官方文档的`llama-server`对不上号。这更像一次尚未完全理顺的门户化动作,也暗示项目想从消费级本地推理工具,往企业和数据中心场景延伸。

llama.cpp本地推理llama.app
Saber否认AI替代编剧,但声明里那句“必然”才是破绽
人工智能 2026/8/12

Saber否认AI替代编剧,但声明里那句“必然”才是破绽

《Rideshare “Stimulator”》主笔Stella Sacco指控被ChatGPT替代,Saber Interactive CEO Matthew Karch否认,称故事“完全由真人撰写”,只有一个“实验性免费模式”因乘客无限而必须用AI。这两句话看似矛盾却能同时成立,问题出在Steam生成式AI披露政策本身留出的空隙,而不是谁在说谎。

生成式人工智能AI替代编剧Steam生成式AI披露政策
AI改写文字有12种“走样”方式,只有一种没人管得住
人工智能 2026/8/12

AI改写文字有12种“走样”方式,只有一种没人管得住

工程师Sophie Alpert提出“自然语言不存在无损转换”,要求团队为AI辅助改写的每句话负责,Simon Willison转发后引发讨论。学界确有可分类、可测量的“语义漂移”研究支撑这一直觉,但把它当绝对命题站不住脚,真正的漏洞是语用与立场层面的漂移几乎无法靠指令压制,Alpert的政策实质是把这部分风险转嫁给了人类审阅者。

AI辅助写作语义漂移自然语言转换
腾讯WorldClaw:一句话生成3D世界,但验证仍是空白
人工智能 2026/8/12

腾讯WorldClaw:一句话生成3D世界,但验证仍是空白

腾讯Hunyuan3D团队发布WorldClaw,宣称能用一段文字生成全局连贯、局部精细且每个物体可独立编辑的3D开放世界。但截至目前,围绕这个项目没有任何独立论文验证、代码开源、基准数据或第三方实测,所有效果展示都只来自官方一方陈述。

WorldClaw腾讯Hunyuan3D
Gemini用户达10亿:Google赢在分发,下一关是留存
人工智能 2026/8/12

Gemini用户达10亿:Google赢在分发,下一关是留存

Gemini用户规模据报已达10亿,并成为Google增长最快的产品。这个数字证明Google的分发能力正在兑现,但统计口径仍需厘清;若模型更新放慢,真正决定胜负的将是留存、付费和使用深度。

GeminiGoogle月活跃用户
压缩即预测:数学说得通,工程过不去
人工智能 2026/8/12

压缩即预测:数学说得通,工程过不去

ngrok一篇技术博客论证压缩器和语言模型本质上在做同一件事:预测下一个符号的概率分布,猜得越准编码越短,这个类比能追溯到Shannon 1948年的信息论。学界也真做过LLM当压缩器的系统评测,账面压缩比确实碾压gzip等传统工具,但模型权重计入成本、训练数据污染、算力和延迟代价这几笔账,让这套“更聪明的压缩器”几乎没法真正落地。

数据压缩语言模型概率预测
ChatGPT和Gemini都破10亿用户,但一个算周活一个算月活
人工智能 2026/8/12

ChatGPT和Gemini都破10亿用户,但一个算周活一个算月活

OpenAI和Google同一周官宣ChatGPT、Gemini都到了10亿用户,但两家统计的其实不是同一个指标——一个是周活跃用户,一个是月活跃用户,天然不可直接比大小。真正值得追问的是,两家公司愿不愿意把口径拆得更透明。

ChatGPTGemini活跃用户统计
NVIDIA新模型称快4倍,野心却藏在路由层里
人工智能 2026/8/12

NVIDIA新模型称快4倍,野心却藏在路由层里

NVIDIA发布300亿参数开源模型Nemotron 3.5 Lightning和路由工具NeMo Switchyard,宣称速度快4倍、任务完成快30%,但这些数字全部来自自建跑分,尚无第三方复测。真正值得盯的不是模型,而是Switchyard想卡住的那个决定'请求该给谁处理'的路由层。

NVIDIANemotron 3.5 LightningNeMo Switchyard
Gemini App用户破10亿:追平的是规模,胜负还要看留存
人工智能 2026/8/12

Gemini App用户破10亿:追平的是规模,胜负还要看留存

Google Gemini App用户规模已达10亿,报道将其与6月达到10亿月活的ChatGPT并列。这个里程碑说明Google已经补上消费级AI的用户规模,但统计范围、使用频率和付费转化仍不清楚。对用户和企业采购者而言,10亿更适合判断产品是否进入主流,不能直接用来判断谁已经胜出。

Gemini AppChatGPT月活跃用户
ChatGPT终于登陆 Linux:晚了一个月,真正要补的是开发者入口
人工智能 2026/8/12

ChatGPT终于登陆 Linux:晚了一个月,真正要补的是开发者入口

OpenAI终于为 Linux 带来专用 ChatGPT 桌面应用,但在发布节奏上落后 Anthropic 约一个月。对 Linux 用户来说,这补上了入口,却还没有自动解决发行版兼容、权限审查和企业部署等现实问题;真正的竞争,取决于它能否把“能安装”做成“值得长期使用”。

ChatGPTLinuxOpenAI
Google说Go是AI编程的理想语言,但这个结论有边界
人工智能 2026/8/12

Google说Go是AI编程的理想语言,但这个结论有边界

Google官方博客称Go是AI辅助软件工程的理想语言,理由是其工具链能给AI agent提供一条自动化验证闭环。但这套论证只在后端和基础设施场景站得住,且发布方本身就是Go的维护者,结论需要打折看待。

AI辅助软件工程GoAI agent
黎曼猜想还没被证明,AI已经敢自己跑一天半了
人工智能 2026/8/12

黎曼猜想还没被证明,AI已经敢自己跑一天半了

Anthropic用一句提示放手一天半,让未发布模型协调60个子代理测试650个思路,把黎曼zeta函数的下界又往前推了一截——但这不是证明黎曼猜想本身,确认它的也只是内部两名数学家,外部同行评议还没出现。速度赢了,信任还没跟上。

AnthropicAI自主科研黎曼猜想
macOS虚拟机推理提速16倍,但这不是GPU直通,是让Metal学会撒谎
人工智能 2026/8/11

macOS虚拟机推理提速16倍,但这不是GPU直通,是让Metal学会撒谎

trycua发布研究性垫片,让macOS虚拟机里的llama.cpp通过篡改Metal能力查询,跑出接近裸机的推理速度,TinyLlama和Gemma 4 12B分别提速最高16.36倍和14.54倍。但这套机制本质是让guest对自己的Metal运行时撒谎,不是Apple没有的物理GPU直通,正确性验证和独立复现都还是空白。

大模型推理加速macOS虚拟机Metal