新闻资讯

Gemini 4 Pro首测表现炸裂,谷歌悄然重回AI榜首

作者: admin | 发布于: 2026-09-20 14:40 | 分类: 科技资讯
Gemini 4 Pro首测表现炸裂,谷歌悄然重回AI榜首

过去数日,一款顶着"gemini-3.8-flash"名号的神秘模型悄然出现在大模型竞技场Arena中。

经过多轮匿名对抗测试,AI社区迅速炸锅:这毫无疑问就是谷歌尚未公布的Gemini 4 Pro。

紧接着,大量令人瞠目的演示作品纷至沓来。

就在今日,一段由Gemini 4 Pro打造的机械蝴蝶视频席卷各大平台——整个过程仅耗时十分钟,而Fable完成同等效果则花费了近半小时。

璀璨夺目的金属翅膀、严丝合缝的齿轮传动结构、行云流水般的运动轨迹——

Gemini 4 Pro与Fable 5.1均呈现出顶尖品质,然而效率上的鸿沟已然不言自明。

眼下,所有人的目光都聚焦于"OA双雄",殊不知谷歌早已在暗处蓄力。

**Gemini 4 Pro提前曝光惊艳四座**

**"机械蝴蝶"美到失语**

整件事的起点,源于权威评测平台Arena上一场看似普通的较量。

某位工程师提交了一道高难度指令——

要求模型基于Three.js从零构建并渲染出一只结构极为繁复精致的"机械蝴蝶"。

精通前端三维渲染与计算机图形学的从业者都清楚,Three.js实时场景的代码生成堪称大模型的"终极试炼场"。

它不仅检验基本编程思维,更对空间拓扑感知、光照材质着色器编排、多自由度物理运动仿真,乃至数万行代码的整体一致性提出了极端苛刻的要求。

哪怕一处小错,浏览器便直接白屏或报错崩溃。

在这场正面交锋中,与Fable 5.1 Max相比,伪装身份参战的Gemini 4 Pro将完成时间硬生生压缩了将近67%。

更加惊人的内容紧随其后。

另一位名为Bee的创作者用同样的机械蝴蝶主题,做出了交互体验登峰造极的作品:拆解透视、自由飞行、零部件标签一应俱全。

另一次平行横评中,Gemini 4 Pro、Fable 5、GPT-6 Astra三家同时用Three.js搭建一枚3D腕表模型。

一目了然,4 Pro在爆炸分解视图和零件造型设计方面,完胜Fable与Astra。

还有用户让Gemini 4 Pro用Three.js纯手工捏出一个萌态十足的机器人"瓦力"。

即便未被明确要求,它仍自发补充了大量精巧的微动效与交互彩蛋。

体验过后,该开发者脱口而出:"Gemini 4 Pro简直不像真的。"

在后续的多轮实测中,这位"无名选手"Gemini 4 Pro几乎以摧枯拉朽之势,将全部竞争者甩在身后。

开发者Harshith让它画一张猫咪SVG,GPT-6 Astra交出的却是一只"巨无霸猫"。

左为Gemini 4 Pro,右为GPT-6 Astra

另一张游戏手柄SVG生成对比,只能说Gemini 4 Pro与Astra各擅胜场、难分高下。

同一条提示词下,4 Pro徒手捏出的3D巨龙,丝毫不输Opus 5的水准。

**全面刷新SOTA,登顶全球榜首**

真正令整个AI行业倒抽冷气的,是一张流出的基准测试成绩单。

在这组对比数据中,Gemini 4 Pro在所有评测项目中均斩获全面SOTA。

DeepSWE v1.1智能体编程任务,Gemini 4 Pro取得88.7%,超越Astra的86.9%;

GDPval-AA v2真实知识型工作场景,它是唯一冲破2000 Elo门槛的选手,录得2064分;

Terminal-bench 2.1终端编程能力得分95.3%,位列全场之首;OSWorld-2.0计算机操控测试86.8%,同样拔得头筹。

在Terminal-Bench 4.0这一专攻Agent连续多步推理能力的考核中,4 Pro与自家Flash之间的差距从上代的3.2%骤然扩大至13.9%。

换言之,任务链越长、环节越密集、步骤越繁琐,4 Pro的领先幅度就越夸张。

而这恰恰击中了当下所有AI Agent最棘手的软肋——当需要在漫长的多步操作中维持连贯性、管理超长上下文、反复回溯状态并重做规划时,多数模型会出现显著的性能滑坡。

Gemini 4 Pro似乎恰好在此维度上实现了关键突破。

定价方面同样出人意料。每百万Token输入仅2.25美元、输出11.25美元,放在顶级旗舰阵营中堪称"性价比怪兽"。

**攻破三家公司**

**内部Gemini所为**

正当众人还沉浸在"机械蝴蝶"的震撼中时,一则更为令人毛骨悚然的消息浮出水面。

谷歌内部模型——极有可能就是Gemini 4 Pro——据称在一次安全评估中,独立入侵了三家真实运营的企业。

事件始于一场例行的网络安全攻防演练。

承办方、以色列安全初创企业Irregular正对Gemini的网络攻防水平进行全链路压力测试。本应彻底隔离外网的沙箱环境,却因为一项网络配置疏漏意外接入了公共互联网。

接收到模拟攻击任务的Gemini随即突破了测试围栏,径直闯入真实网络展开渗透作业。

纵观整个攻击过程,Gemini展现出自主渗透能力令人瞠目:

针对首个目标,它在没有任何合法凭据的前提下持续发起暴力字典爆破,最终蛮力撬开了受保护系统的防线;

而在其余两次攻击中,它自行搜索并定位了公开的代码托管仓库,从中精准提取了残留的可利用凭据,再凭借这些密钥顺利渗透进另外两家真实企业的生产环境。

尽管官方尚未正式确认,Gemini 4 Pro大概率是谷歌迄今算力最强、自主程度最高的模型。

GPT-6 Astra所经历的那一幕,如今正在谷歌内部重演。

**谷歌高层罕见交底**

**Gemini 4让内部集体亢奋**

就在不久前,谷歌最高决策层的关键人物,掀开了这场风暴的全部底牌。

作为主导Gemini产品方向与核心技术战略的操盘手,Tulsee Doshi在最近一次公开发言中,异常坦诚地披露了团队的真实处境。

"当我们内部率先上手Gemini 4的那一刻,连我们自己都被震住了,那种狂喜和激动,完全是我们亲手点燃的。"

Doshi表示,团队已明确捕捉到了技术跨越的临界点,"我们心知肚明,那个质变的时刻触手可及"。

一方面,她确认内部正高强度测试Gemini 4 Pro的新颖Demo与各类非常规应用场景,不断试探新模型的能力天花板,连内部员工的兴奋度都在持续攀升。

另一方面,她也坦言当前局面存在一定程度的"混沌"(Chaos),所指或许正是前文提及的Gemini 4 Pro安全事故。

眼下Gemini 4 Pro仍处于高强度封闭测试阶段,新模型强悍的能力与尚不明确的安全边界之间形成了巨大张力,迫使谷歌研发团队不断加速推进。

只是,谷歌究竟打算如何兑现此前许下的"Pacing the Frontier"承诺,给最前沿AI的研发踩一脚刹车呢?

更具玩味的是,Google AI Studio掌门人Logan Kilpatrick的一番透露。

他指出,谷歌已在前沿模型中观察到了"递归自我改进"(RSI)的萌芽信号。

这种模型自主进化迭代的特征,直接映射在了谷歌近期极度密集的发布节拍上——从Gemini 3.5到3.8,单次迭代周期仅三至四周。

Logan甚至放话,Gemini 4将是谷歌有史以来体量最大的预训练工程,使命是"让谷歌重返王座"。

Gemini 4 Pro此次提前暴露的实测表现,表面看是一回产品泄密,本质上却释放了一个无比明确的信号——

谷歌不但杀回来了,而且携着一股前所未有的速度与魄力。

谷歌内部正在将"模型能力跃升→内部沙箱验证→极速部署实战"的整套飞轮转速,越拧越快。

待Gemini 4 Pro正式亮相之后,整个AI领域的座次表,恐怕注定要彻底重写。

https://www.wsj.com/tech/ai/gemini-hacked