omni跑步 谷歌Gemini Omni实测体验:表现平平,综合评分仅为NPC及格线
2026-09-22 10:11:09发布 浏览179次 信息编号:222700
平台友情提醒:凡是以各种理由向你收取费用,均有骗子嫌疑,请提高警惕,不要轻易支付。
omni跑步 谷歌Gemini Omni实测体验:表现平平,综合评分仅为NPC及格线
关于 Omni 的信息已经泄露得满世界都是了, 而且这种情况持续了小半个月之久, 这部设备终于在今天凌晨举行的谷歌 I/O 2026 大会上正式亮相。
它和传闻里说的只用来做视频生成的模型不一样, 也不是跟着 Veo 3 的名字叫“Veo 4”, 谷歌的负责人亲自上台去宣布了。
我们现在正迈出下一个重要的一步, 这步叫做Omni, 这是一个全新的模型, 这个全新模型可以从任何输入创建内容。
说白了, Omni就是个真正的全能型大模型, 它能接受各种各样形式的输入, 然后生成各种各样的内容, 视频生成仅仅是它能力里面的一小部分而已。
现在 Omni 这个应用, 已经把全部的谷歌产品, 全都同步给上线了。买的是 AI Plus 这个等级的人, 还有买的是 Pro 这个等级的人, 以及买的是 Ultra 这个等级的人, 这些人呢, 都能通过那个叫 Flow 的、由谷歌搞出来的 AI 视频创作平台, 去使用这些功能。
<“AI新榜”>在第一时间就订阅了级别最高的谷歌Ultra会员服务, 并且对Omni进行了一手实测。
我先来给你个结论哈, 这个结果确实是挺拉胯的。
实测前后一致性:
基本上保持着非常到位的状态。
这次Omni重点强调了一个亮点, 这个亮点是通过自然语言对视频进行微调, 并且在经历了这样的多次编辑之后, 视频内容依然能够保持前后一致, 没有出现不一致的情况。
在官方发布的案例里, 原本的短视频拍的是一个拉小提琴的人在屋子里表演。他们把背景换了, 切了角度的镜头, 甚至直接把演奏的人和小提琴都删掉。结果呢, 演奏人的表情、肢体动作、灯光和阴影的效果、手上细微的运弓姿势, 加上那首曲子, 全都和新换的环境严丝合缝地对上了。
不管是精细编辑所达到的效果, 还是画面主体所保持的一致性效果, 从整体来看, 显得非常惊艳。
将手指左右滑动即可查看更多内容。
于是呢, 在开展的这个实测工作之中方面, 咱们就先搞出一个那个环境还有那种气氛方面的一个替换。
先输入提示词: 采用俯拍视角来表现两辆汽车在十字路口发生碰撞的场景, 其中有一辆蓝色的跑车, 总体气氛显得非常惊险并且充满刺激感。
再进行一次精细的编辑和微调, 把背景换成夕阳西下的金色时刻, 同时将那辆蓝色的车改成红色的车, 当两辆车发生相撞的时候, 会喷射出彩带和气球, 使得整个氛围显得轻松且带有梦幻色彩。
我们可以看到, 车辆的这种颜色情况还有光线环境这些条件, 确实是在这一刻实时发生了改变, 并且视频所具备的这种整体上的结构状态以及动态表现方面, 基本上也持续保持了连贯性, 完全没有出现那种像是画面被撕裂开来的情况, 或者是失真的现象。
但是存在一个十分微妙的情况, 那就是关于名为“撞车”的这种在一瞬间就发生完成的动作现象, Omni这个对象对它进行理解的时候表现得相当差劲。
两条视频里面呈现出的两辆车, 都似乎是在“故意”, 朝着相对的方向行驶过去, 乃至就是在发生碰撞的那个瞬间位置, 也是特意地压慢了运行的速度, 并且还调整了一番朝向的角度。
人们可以说, 就好像有一双看不见的手, 也就是那个叫作 Omni 的东西, 在暗中操控着两辆车, 让它们去完成用户提出的那些指令。
其次, 大家来检查一下 Omni 这个东西能不能在动起来的时候保持一致。
标准是这样的, 就是同一个角色的画面在不同视角切换的时候, 它的脸部长相、身上的衣服、手里拿的道具, 再加上头发的样式, 这些都理应是保持不变的稳定的状态。这种稳定应该是实实在在的, 不会出现比如说像是同一件衣服换了个角度来看颜色的颜色都发生变化了的那个错误bug情况。
画面首先是一个中景推轨镜头, 可以看到一位穿着红色连衣裙的女舞者在老火车站里面跳现代舞, 当这个女舞者做出一个跳跃动作之后, 镜头切换为广角固定镜头, 继续延续同一个舞蹈动作, 保持红裙子与火车站背景完全一致。
这条视频的完成度表现还是相当让人满意的, 因为舞者的动作看起来连贯自然, 而且她身上穿着的那条丝质红色长裙所呈现出的物理效果也非常真实, 此外, 镜头从最初的中景切换到之后的广角固定镜头这一个过程, 同样显得也比较丝滑流畅。
Omni软件还自动添加了一小段背景音, 尽管那段声音谈不上有多么富有艺术感, 不过大体上还算是能够契合跳舞的那个气氛。
再次进行微调处理的环节, 其操作要求是在处理过程中剔除原有的背景音乐元素, 仅将环境声音予以保留, 例如像是与舞蹈动作同步的脚步声以及裙摆相互摩挲所发出的声音等等。
这次出现了些许状况, 在视频的初始部分能够清晰捕捉到衣摆摩擦产生的细微声响以及足部触地的动静, 然而进入后续阶段后, 此前出现的背景旋律竟然毫无缘由地再次重现。
接下来, 再测试其对于复杂人物关系和位置的理解能力。
所谓的标准情况是, 需要去关注那些外貌以及穿着打扮都各不相同的角色在发生互动的时候, 他们的各自的这些特征是不会出现紊乱的情形, 哪怕视角发生了变化也是这样。
这是一个过肩镜头, 画面里有四五位外貌和打扮都不一样的科学家正在实验室里讨论全息投影, 镜头会慢慢地旋转, 需要注意让所有人的长相和衣服都保持原样不发生改变。
可能就是为了能够完美地符合那个“四位或五位, 每个人的外貌以及打扮都相互区别的科学人员”的描述要求。所以 Omni 这款工具也非常周到地安排出了这四位科学家。他们之中既有男性也有女性, 涵盖了老中青幼各个年龄段, 同时也包括了世界上不同种族的人群。
从那些不停旋转拍摄的画面镜头来看。这几位人物在外貌特征方面、服装款式方面、说话声音方面, 还有他们彼此之间相对站立的位置关系上。整体上都保持着基本一致的效果。
不过, 非常可惜的一点是, 当视频播放到了后半部分的时候, 突然之间出现了一次镜头切换的情况, 而这次的切换显得是非常的僵硬和生硬。
精细控制?还得再练
这次官方把编辑和微调当作最重点的案例亮点放在了前面, 而且这个点也进行了宣传。
废话就不多说了, 咱们直接拿起最近在韩语网络里超级火的由人工智能制作出的棒球观看视频, 再把这一张来自谷歌官方网站作为示范的动画风格美女图片丢给Omni这个工具, 要求它动手把原来视频里面的人物部分换掉。
最终所得出的那个结果, 整体而言只能被评价为大致上还可以, 并没有达到特别令人满意的那种高度。
把Omni替换上去的人物呢, 他只是那种在相对位置方面跟那个原来的视频保持了一致, 但是对于那种会咬嘴唇的, 还有眼神会躲来躲去的, 或者是发现了有人正在拍他之后抿着嘴巴笑一下的这种细微的这个表情特征, 几乎就完全没有表达出来了。
这种在细节生成上的不如意, 并不是只出现在一个人的身上, 而是普遍存在的现象, 并非属于个例。
咱们是通过发出提示词, 最终生成出了一段视频画面。在这段视频里头, 呈现的是一位上了年纪的男人。场景是在光线比较昏暗的屋子里头。他正站在镜子前边儿, 语气很轻柔地说道: “我晓得这事情是你干的, 你赶快别装傻充愣了。”。
原视频的表现还是很不错的, 可是男人的中文口音略微有点让人感觉到奇怪, 他的口型与每一个字基本上都是精确地进行相对应的, 至于说是不是展现出了人性化的一些情绪, 这真的是一个让不同的人有各自不同看法的事情。
但是后来, 当我们需要去改动那个男角色的对话的时候, Omni里面的电子大脑不知道是因为什么就出现了过热的情况, 导致系统崩溃了。
在光线昏暗的房间里, 有个中年男性站在那里, 他正盯着镜子看, 用很轻的声音讲话, 内容大概是说那个叫做五一二零的日子又出现了, 并祝大家节日快乐。
在刚开始的时候, 人们对于所谓的修改台词这样的说法是完全没有办法去理解的, 于是就把新的台词当作字幕直接地放在了视频的下方区域;接着又出现了同时说原来的台词和新的台词的情况的;到了最后的阶段, 干脆就直接开始胡说八道了。
画面的光线确实变得比较明亮了, 人物的面部表情也转变成了微笑的姿态。只不过有一个男人满脸堆笑着说了一句话, 他说他知道是谁做的, 让对方别装了。与此同时, 背景音乐依然保留着之前那种阴森森的味道, 这让人感到非常怪异, 甚至比原来的版本还要让人觉得毛骨悚然, 真的是好诡异啊。
只能这样说, 关于精细控制这一部分, Omni方面还需要进行进一步的磨练。
在世界知识的理解方面, 物理学的成绩比较好, 世界史的成绩也不错, 不过还是存在一些缺陷。
最后呢, 就是关于这个世界的理解的问题。
官方那边给出来的说法是, Omni是基于所谓的旗舰大模型来搞的。它对于引力、动能和流体力学这一类物理规则的理解方面, 以及对于世界历史、科学和数学这一类的理解方面, 这些都进一步得到了提高。
咱们就不多啰嗦了, 直接把提示词亮出来吧, 具体的提示词内容要求是: 生成一条在连锁反应轨道上快速滚动的弹珠。
这个效果还是比较让人惊叹的, Omni自己设计了一套比较复杂的连锁轨道, 在这个过程中涉及到重力、弹力和离心力等多种物理规则, 看起来都非常相当真实。
但是呢,在后面的那部分视频画面里, 有一个错误的情况发生了, 就是原本一个很小的小球, 它突然一下变成了两团小球的样子。
再来一个, 一个球沿着U形轨道内壁来回滚动, 最终停在轨道最低点。
这个效果的情况是存在一点奇怪的。
虽然那个小球确实是在U形的管子中反复地滚动, 最后是停在了最低的位置上, 但是心里面老是觉得不对头, 感觉这个重力的环境好像并不是在地球上存在的一样, 小球漂浮得轻飘飘的, 甚至连模型都有点穿模的嫌疑。
到最后呢, 我又发出了一条相当简明且有力量感的提示词, 这条提示词的意思是去生成一段视频, 视频的内容是关于李世民和他那位兄长之间发生的“玄武门对掏”这样一个事件。
呃……尽管背后的“玄武门”这几个汉字存在些许瑕疵, 且两位唐代人物所使用的中文也仿佛带着几分地方口音, 不过还是能够理解所谓的“玄武门对掏”这一中文网络流行梗的含义, 该梗使得李世民与李元吉这两位兄长与弟弟上演了一场充满剑拔弩张气氛的会面对话。
从这么一种情况来看, 可以看到的是, 这个关于Omni的世界历史的修治情况居然还是显得相当不错的。
在实际测完之后, 心里的感受就是这样: 安安静静地等着版本号到2.1。
在本次盛会召开之前关于Omni的消息就已经流传了非常久。
时间追溯到最早的五月月初的时候, 有一位用户在他的视频生成页面那里, 发现了一行不怎么起眼的小字儿, 那写的是by Omni, 这个消息一出来就立马引起了很大的反响。
目前为止, 在全球范围内的技术专业人士群体中,大家正在热烈地探讨和分析一个问题, 那就是这个名为 Omni 的事物究竟属于什么样的存在类别, 到底是去年在谷歌举行的 I/O 2025 大会上展示的 Veo 3 产品的后续迭代版本 Veo 4, 还是一个具有多种处理模式能力的全新型大人工智能模型?
这也正是为什么在前期流传的众多消息里面, 出现的情况是时而提到 Omni, 时而又变成 Veo 4。
结果是在5月11日这一天, 有一条关于教授在黑板上推导公式的视频出现在了X平台上。这个视频叫做Omni的内测宣传片。它在网上迅速传播开来。在短短几天的时间里。这条视频的浏览量就已经超过了240万次。
这个视频的镜头在短短10秒之内连续切换了好几次, 画面里有教授的背影,也有他的侧脸, 还有用粉笔写公式时的特写镜头, 伴随着粉笔在黑板上发出的沙沙声响, 再加上黑板上那些完全正确的公式呈现出来,这种做法一下子就把大家的期待值拉升到了一个全新的高度。
当时的爆料内容是 Omni 已经做到了镜头语言和剪辑这些深度技能的内化, 它具备多视角镜头切换功能以及自带的原生 BGM 特效, 用户可以直接用它生成一条完整的成片画面。
然而当时刻发展到如今这个节点, 那个叫做Omni的玩意儿总算是千呼万唤始出来, 可是它所显现出来的最终成效却是评价高低不一。
看来, 还是需要对版本2.1的发布抱有一定的期待, 尽管目前关于该产品究竟何时能够推出, 依然存在着非常大的疑问和不确定性。
提醒:请联系我时一定说明是从茶后生活网上看到的!
