半小时教你手搓AI视频通话,还有懒人版代码已开源
GPT-4o的“AI视频通话”功能一鸽再鸽,可网友们早就等得望眼欲穿了。结果,一位名叫Santiago(江湖人称“三哥”)的博主干脆自己动手,用160行Python代码搞了个平替版。
虽然技术路线和电影《Her》不太一样,但从实际效果看,至少给等得心焦的网友提供了个新玩具。

而且这可不是简单的炫技——三哥是真的想把大家教会,花了半个多小时讲解整个操作过程。
说起来,三哥自称是教硬核机器学习的老手,之前也出过不少课程。讲课这事,算得上他的看家本领了。

这次推出的新教程,网友评价相当高:内容扎实,讲解也清晰。更贴心的是,怕你嫌麻烦,三哥直接把
程序代码公开了
还有网友在线催更:有人想要屏幕读取功能,有人想要移动版……看来需求是真不少。
用Python实现AI视频通话
三哥做的视频通话程序名叫Alloy Voice Assistant(简称Alloy)。他在演示中展示了几组对话效果。
先来一道基础题:让Alloy识别
自己戴的眼镜是什么颜色
接下来上难度——
识别棒球帽上的徽章,并分析出所属球队
先看看这顶棒球帽的特写:从左到右分别是(洛杉矶)道奇队、(华盛顿)国民队、(波士顿)红袜队、(休斯顿)太空人队、(芝加哥)小熊队和(堪萨斯城)皇家队。
再来看Alloy的回答……全部正确。
最后一题升级到文字识别——不仅要认出内容,还要理解含义。三哥把一本书举到镜头前,询问
书名和作者
从演示来看,Alloy在识别准确率上确实能打,不过响应速度偏慢。但毕竟不是原生功能,需要在多个API之间跳转,能做到这个程度已经相当可用了。
那么Alloy到底是怎么实现的?三哥带来了37分钟的细致讲解。
37分钟细致讲解,还有开源懒人版
跟着三哥的节奏,先看看需要哪些工具。
视频通话自然离不开
视觉处理模块
多模态大模型
文本处理
因为Alloy本身不支持音频模态,音频处理需要以文本作为中介,这就用到了
语音识别和合成
最关键的是,要把这些模块串起来,得用Python写代码,并调用相应工具的API。
看到这些组件,Alloy的大致工作流程就清楚了:麦克风和摄像头采集视觉和声音信息 → 声音转文本,连同视觉信息通过API送入大模型 → 大模型分析后回传文本 → TTS模块合成语音播放。
具体操作上,先安装依赖库、申请大模型API、创建Python程序加载依赖。
接着编写
WebcamStream类
然后是核心的
Assistant类
两个类定义好后,最后是
主程序
以上就是Alloy搭建的大致流程。如果觉得太麻烦不想动手,三哥还在GitHub上备了“懒人版”——只需根据所选模型调整几行代码、填好API,就能直接跑起来。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名