谷歌发布Gemini Live:对标GPT-4o,让每一个人都有贾维斯
谷歌在今天凌晨的“Made by Google 2024”大会上,正式推出了智能语音助手Gemini Live。说白了,这就是谷歌版GPT-4o语音模式——一个能听懂你说话、看懂你发的图片和视频的多模态助手,功能上跟OpenAI在5月展示的那套东西几乎一模一样。
举个例子,你可以打开Gemini Live,对着它拍一幅《清明上河图》,然后让它讲讲这幅画的历史背景。它开口讲的时候,你甚至可以随意打断它,想插话就插话,完全像是跟朋友聊天。或者你可以授权它访问你的邮箱、地图和通讯录,然后直接说一句“今晚8点,帮我约阿乐去有福气酒楼吃饭”,它就能自动帮你把事儿办了。基本上,就是钢铁侠里贾维斯那个味儿。
不过,OpenAI虽然抢跑了很久,但GPT-4o语音模式至今还在小范围测试,属于起大早赶了个晚集。谷歌这次倒是快刀斩乱麻,直接抢先发布,硬生生在安卓生态里占了个先手。不少用户评价说,这一局谷歌确实领先了一步——当产品性能拉不开差距时,谁先落地、谁就能抢占市场先机。
从大模型到语音助手,看来谷歌的Gemini是要跟OpenAI的ChatGPT死磕到底了。
也有人觉得,Gemini Live一出来,可能会让不少人开始考虑放弃苹果。这个倒不用急,谷歌已经明确表示会在iOS系统上发布,只是时间问题。
现场其实有个小插曲。主持人对着日历拍了一张照片,然后问Gemini Live:“帮我看看我的日历,她今年来旧金山的时候,我有没有空?”你猜怎么着?第一次,没反应;第二次,还是没反应。连续问了三次,到第三次时,主持人汗都快下来了,Gemini Live才终于开口:“我发现她将于2024年11月9日来旧金山。我查看了你的日历,那段时间你没有任何活动。”
话音一落,全场瞬间爆发出惊喜的尖叫声——好吧,那个尖叫声确实有点演播厅老传统味道了,但前两次的沉默,对于台上的主持人来说,世界仿佛都静止了。
不过话说回来,相比于那些提前录好的演示demo,很多人还是更喜欢这种现场真刀真枪的演示。哪怕是失败了两次,那种勇气、真诚和敢于冒险的精神,才是真正值得称赞的地方。
Gemini Live的使用方法也很简单:长按电源键,或者直接对着手机喊“Hey Google”,就能开始对话。除了理解语音、图片和视频之外,它还能生成图片。比如你说“帮我生成一张生日庆祝的图片”,它就能直接出图,并且无缝在谷歌生态的各种应用里使用。
谷歌表示,Gemini Live已经跟自家的邮件、云盘、相册、天气等原生应用完成了集成,未来还会扩展到Keep、Tasks、Utilities这些知名应用,帮你自动完成更多日常任务。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名