我的网站最新发布:众泰“亡者归来” T300车型即将复产:5万元交个朋友 定位大型SUV/将与腾势N9车型组成双子星 腾势N8L路试谍照曝光 外媒:阿塞拜疆与亚美尼亚已达成停火协议_乌方:乌军已突破至乌俄边境地区_阿塞拜疆和亚美尼亚边境发生冲突 政策出现重要“微调“线索 诺奖季,想起京都大学 Strong film lineup boosts China's summer box office

时间都去哪了

彭博社:软银的子公司将开放非智能手机市场,并在五年内准备首次公开募股。_我的网站

秘密花园

一 |     如果你从去年就开始用 Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症。简介:彭博社网站本周表示,软银收购的芯片设计公司ARM除了智能手机之外,还在探索其他业务,为五年内的IPO打下基础。         这是最近网友对 Gemini 的一句调侃。

二 | 软银首席执行官孙正义希望此次收购将产生巨大回报。全文如下:最近,芯片设计公司ARM的扩张速度如此之快,以至于联合创始人Mike Muller在使用办公室时必须提前预订。         按理说,一家公司发新模型,通常是来打脸这种调侃的。”我的办公室已经变成了一个会议室,所以我必须提前预订,”穆勒,公司的首席技术官,在英国剑桥的公司总部接受采访时说。可就在刚刚,Google 一口气发了三个新模型之后,网友非但没收回这句话,反而笑得更大声了。多少有种他们都不看好你,可偏偏你最不争气的即视感。

三 | 我们的办公空间已经用光了。         三个模型分别是 3.6 Flash、3.5 Flash-Lite,还有一个专搞网络安全的 3.5 Flash Cyber。官方博客的措辞也相当眼熟,「更高效」「更聪明」「为大规模 AI agent 而生」,一句不落。”2016年,日本软银集团收购了ARM。随后,ARM的员工数量增加了约2000人,总计近6000人。         只不过,实际体感却冰火两重天。这导致现有办公空间严重不足。在ARM总部,员工在六栋低层办公楼工作。         主角登场,3.6 Flash 到底强在哪          先说头牌,3.6 Flash。剑桥公园总部新大楼外观ARM将很快进入剑桥公园新办公大楼。这幢办公楼耗资6100万美元。官方给的定位就俩字——「主力」(workhorse),干活模型。该建筑有一个巨大的中庭,长180米,有“悬空楼梯”,建筑内铺设的网络长达1000多公里。

四 |          3.5 Flash 是今年 5 月 I/O 大会上发的,这次算是小版本迭代。         最大的卖点是省 token。

五 | 虽然新办公楼的建设是在收购软银之前开始的,但总部更能反映ARM当前的雄心壮志和辉煌。

六 |          按 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 少用 17% 的输出 token,在 DeepSWE(Datacurve 出的基准)这类场景上甚至能省到 65%。”这是非常低调的,”穆勒开玩笑说。

七 | 官方还说它跑多步任务时,推理步数和工具调用都更少。也就是说,干同样的活,废话更少,绕路更少,账单更薄。         价格也确实降了。输入 1.5 美元/百万 token,输出 7.5 美元/百万 token——注意,上一代 3.5 Flash 的输出是 9 美元,这波直接砍到 7.5。这座建筑物又漂亮又大。

八 | 武器成本上升,利润下降。又快又省,单个 agent 任务的成本就压下来了。

九 | ARM成立于1990年。         基准测试上,官方摆出了一整排数据。         代码能力是重点。在软银320亿美元收购之前,它已经成为英国最大的上市公司。DeepSWE 从 37% 提升到 49%,官方的说法是多余的代码改动更少、执行循环也更短,生成的代码更贴近生产环境的要求。机器学习研究方向的 MLE Bench 提升更明显,从 49.7% 拉到了 63.9%。         计算机操作(computer use)能力也有长进,OSWorld-Verified 从 78.4% 升到 83%。ARM的芯片设计被授权给世界上最大的技术公司。并且,「计算机操作」(computer use)也成了Gemini API 和企业版的内置工具,主打一个开箱即用。         知识工作方面,GDPval-AA v2 从 1349 涨到 1421。因此,世界上几乎所有的智能手机和平板电脑都使用ARM芯片。Hebbia、Harvey 等客户反馈,它在文档解析、图表数据分析、报告起草这类多模态任务上表现尤其突出。目前,在软银首席执行官孙正义的领导下,由于软银雄心勃勃的目标,ARM的英国高管开始受到媒体的密切关注。在各种会议上,孙正毅要求ARM高管快速介绍公司目前的运营细节,然后跳到长期计划中。

十 | 他坚持认为,ARM必须每月更新其10年业务计划,以确保其对未来的关注。Figma、JetBrains 也都出面背书了一番。         哦对了,还有个不起眼但挺实在的更新:知识截止日期终于从 2025 年 1 月推进到了 2026 年 3 月。老黄历总算翻篇了。         安全这块,官方说 3.6 Flash 上了升级版的 Frontier Safety 防护,重点盯着 CBRN(化学、生物、放射性、核)和网络攻击这两类滥用,抗越狱能力更强了,同时又尽量不误伤正常需求、少乱拒绝。

十一 |          ·以小博大,便宜大碗的 3.5 Flash-Lite 也能更换推理档位了          第二个是 3.5 Flash-Lite,定位比 3.6 Flash 还低一档,主打「快」和「便宜」,专治高吞吐、低延迟的任务,比如 agent 搜索、文档处理。         它是 3.5 系列里最快的,按 Artificial Analysis 的测量是每秒吐 350 个 token。价格更是白菜——输入 0.3 美元、输出 2.5 美元每百万 token。官方说质量比 3 月发的 3.1 Flash-Lite 好一大截。ARM首席执行官Simon Segars表示,这意味着他的工作是“疯狂投资”,将ARM推向高端计算市场,成为无人驾驶汽车技术的核心。根据孙正义的设想,这些项目很快就会带来回报,然后ARM将缩减开支,并在五年内准备重新上市。

十二 | ARM的新股东也带来了不同的客户群。最近,Seggs向孙正义展示了一款基于ARM芯片的联想笔记本电脑。

十三 |          有个设计挺灵活:它支持调「推理档位」。低配活儿就开最低档,图个快和省;碰上要多步拆解的子任务,就把思考档位往上拨。当天晚些时候,他被要求留下来介绍微软创始人比尔盖茨。电脑操作这次也做成了内置工具。

十四 |          跟前代比,提升相当明显:代码和 agent 任务的 Terminal-Bench 2.1,从 31% 干到 54%;长上下文的 GDM-MRCR v2,从 60.1% 提到 72.2%;真实任务执行的 GDPval-AA v2,更是从 642 飙到 1140。Seggs先生和他的团队处于技术行业经理们梦寐以求的位置:首先投资于增长,然后专注于盈利能力。然而,这次收购也让他们走出了自己的舒适区。ARM技术在半导体行业无处不在,但Sun希望ARM能够进入软件和服务领域。         最有意思的是,这个「小弟」在不少 agent 和代码任务上,居然反超了辈分更高的 3 Flash。据西格斯说,当太阳第一次与ARM谈判时,他对一个“科学项目”很着迷。         比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。

十五 | 孙收购ARM的一个原因是,他相信,在主导智能手机市场的设计的帮助下,芯片设计师可以在物联网芯片市场上获得同样的市场影响力。以小博大,属实有点东西——等于说跑 3 Flash 的活儿,现在有了个更快更强的平替。物联网技术包括互联的家用产品和工厂设备。         官方还举了几个用法:从海量电商数据里抽产品特征、给 3.6 Flash 当副手一口气生成 25 个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。这一相互关联的未来似乎并没有孙正义和许多其他未来学家所希望的那么快。Ashler、Palo Alto Networks、Ramp 这几家客户也来夸了它「速度、智能、成本三合一」。一个原因是所有这些互联设备都带来了巨大的管理挑战:必须确保安全性,及时更新软件,保持网络状态。         最后一个 3.5 Flash Cyber,画风突变,专门用来找和修代码里的安全漏洞。技术实施可能很复杂,而且成本高昂。

十六 | 另一个问题是,ARM在物联网服务领域没有足够的专业积累,实际使用ARM设计的终端用户之间总是存在一定的距离。

十七 | 所以目前,在孙正义的鼓励下,ARM正在拓展物联网服务部门。         Google 的逻辑挺有意思:现在 AI 找漏洞的速度,已经比现有系统修漏洞的速度快了。

十八 | 既然漏洞越堆越多,那干脆用便宜高效的 Flash 来批量补锅。         这个模型是在 3.5 Flash 基础上微调出来的,搭配自家的 CodeMender 工具用。CodeMender 里跑的是好几个 Flash Cyber agent,协同工作、最后汇总成一份报告。去年8月,ARM以6亿美元收购了美国数据分析初创公司Treasure Data,这是过去14年来最大的一次收购。

十九 | 今年6月,该公司还瞄准了位于格拉斯哥的stream technologies公司。公司致力于优化物联网设备网络连接。         在业内有名的 CyberGym 基准上,官方称它摸到了第一梯队的水平,还比更大的模型更省 token。

|          不过这模型我们暂时也用不上。SanfordBernstein的分析师ChrisLane说:“在10到15年后的世界上,可能有1万亿台设备连接到互联网上。即使每个设备一个月只生产几美分,那将是一个巨大的数字。现在太早了,但这是个好主意。最终,Seggs可能需要削减开支,并向公开市场投资者解释为什么ARM比软银的收购价格更有价值。赛格斯说,软银计划在五年内上市。

| ARM的机会窗口可能很快就会关闭。         考虑到「找漏洞」这种能力是把双刃剑,浓眉大眼的 Google 也学 Anthropic 玩起了安全叙事。

| 把它锁得死死的——只对「可信合作伙伴」限量开放,走内测。在科技产业最繁荣的时期,软银设立了一个愿景基金。ARM本身被认为芯片行业的繁荣是可持续的这一信念所鼓舞。目的是给一线防守方争取时间,赶在漏洞被人利用前先修掉,同时防着有人拿它去干坏事。         说好的 3.5 Pro 呢?如来          看到这儿你可能会问:发了一堆 Flash,那真正的旗舰 3.5 Pro 去哪了?          官方口径是「正在和合作伙伴测试,准备好就上」。

| 但这套说辞背后的故事,可能没那么体面。

| 新的行业正在排队为他们的产品和业务增加数字和智能功能。         据彭博社等媒体报道,3.5 Pro 的代码生成能力一直没达到内部预期。

| Google 6 月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。然而,到2018年底,大型科技公司和芯片行业的受欢迎程度有所下降。投资者担心,贸易纠纷、无人驾驶汽车等新兴行业增速低于预期,以及库存过剩等旧问题的再度出现,已开始给半导体行业带来压力。行业基准费城证券交易所半导体指数(Philadelphia Stock Exchange Semiconductor Index)在连续两年增长超过36%后,在2018年下跌7.8%。ARM已经知道,在单一领域的成功并不能让公司获得免费通行证。在过去的十年里,英特尔一直希望打破英特尔在计算机技术上的统治地位,但它只找到了一个小小的立足点。在过去的10年里,英特尔已经占据了服务器市场的90%以上。手臂多次看到“假黎明”。一些制造商尝试使用ARM处理器,但后来选择放弃,因此ARM在市场上没有建立起有意义的份额。更有传闻说,Google 干脆推翻了原来的训练方案,从零开始重训。2018年,ARM获得了大幅提升。早就有传言称,作为英特尔最大的客户之一,亚马逊宣布将在其服务器网络中采用基于ARM技术的自主设计芯片。塞格斯的大规模招聘也导致了成本的急剧上升。利润正在消耗。ARM在最近一个季度的成本为3.27亿英镑,比去年同期增长了33%。无论一次性项目如何,ARM都能赚1800万英镑,仅为一年前的四分之一左右。         而 Google AI 宣传委员 Logan Kilpatrick 更是索性在舆论上直接跳过 3.5 Pro,将预告的重点放在了Gemini 4,声称他们已经启动了史上最雄心勃勃的 Gemini 4 预训练,还放话说进展让人兴奋。

|          听着虽然挺提振人心,但把它放在「旗舰跳票」的背景下看,多少有点转移视线、画饼续命的味道了。

|          除了这些内幕,光看今天刚刚发布的 Flash 模型本身,网友们也并不全然买账。

|          第三方评测机构 Artificial Analysis 表示:两个新模型确实把单任务耗时砍半、token 效率也提升了,Flash-Lite 的智能指数涨了 11 分——但 3.6 Flash 的智能水平,相比 3.5 Flash 基本原地踏步。目前,ARM股东对此并不担心。然而,由于软银25%的股份掌握在由其他投资者出资的愿景基金手中,因此,ARM无法在不考虑回报的情况下疯狂投资未来。         价格没有便宜到足以忽略能力差距,能力也没有高到能够解释它的成本。

| 塞格斯还知道,人们对ARM的期望很高,孙先生希望得到的回报远远超过他为收购ARM而花费的320亿美元。他说:“如果我们想在首次公开发行(IPO)中取得成功,并得到孙正义预期的估值,那么显然我们需要证明很多问题。         X 网友吐槽道:3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一样的分,还不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 这一票对手,直呼简直烂透了(阴阳怪气 doge)。我的工作是确保我们利用这段没有上市的时间进行疯狂的投资,再投资我们所有的利润。         吐槽的还不止一个。(张帆)。         网友 Angel 则直接从性价比入手:Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 还高,可智能程度反而更低。又贵又笨,这组合属实有点尴尬——毕竟 Flash 系列立身的根本就是「性价比」,结果被人当场指出性价比不如对手,等于自砸招牌。         作为对比,OpenAI 的 Tibo 刚刚也发话了:由于周活跃用户达到 1000 万,新的一天,Codex 和 ChatGPT Work 的付费用户迎来新一轮额度重置,尽情享用。         这对比,这落差,还有人记得大明湖畔的 Google Gemini 3?          实测派也来补刀。网友 Balder 更是直接开团:          这三个模型性能全比之前的 3.5 Flash 差。

| 他甩出自己的测试吐槽,说问题包括但不限于——基础解码就有毛病、中文选词经常很离谱;生成的图片视频质量极差、跟指令对不上还限额严重;经常记忆混乱、调用完全错误的工具。

|          而且他还上了个阴谋论,认为 Google 之所以这么搞,是为了把算力腾出来卖给 Anthropic,还阴阳了一句这就是皮查伊想要的「Cloud First」。         此外,X 网友 Conor Dart 用 Google 自家的 Antigravity 跑了个 AI 生成游戏的测试,结果没有出乎意料,木头纹理更差了,大理石看着差不多但还是不能用。他直言这又是一次翻车,表示自己还是等 Gemini 3.5/3.6 Pro 吧。         简言之,你别问新模型强不强,你就说 Flash 不 Flash 就完事了。一边是官方更高效、更便宜、更省 token的漂亮账本,一边是大多数网友的当场差评,以及模型背后的旗舰跳票、大牛出走、市值缩水等一连串糟心事。         这很难不让人好奇是不是 Google 这次真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个 Flash 稳住场子?          反正 Gemini 4 的预训练都开跑了。这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。

Current article:http://ukf.dangnichuaitongjuanye.pics/q4m/20260826/635.html

Published on:20:00:42


上一篇:总体平稳 向新向优——透视前7个月国民经济数据 下一篇:奔驰松口2030电动化战略 将延长燃油车销售 燃油车与电动车共存

我的网站相关阅读