正在检测 GPU
WHISPER · STREAMING · SPEAKER-AWARE
把每一句话,实时交给正确的说话人。
浏览器采集音频,Go 网关承接实时连接,Python 推理引擎完成语音识别与匿名说话人聚类。临时结果快速出现,最终字幕稳定落定。
默认不录音、不落盘;本次字幕只保留在当前浏览器页面。
LIVE TRANSCRIPT
实时字幕
准备好后,点击“开始字幕”
允许麦克风权限,开始说话。静音不会触发模型推理。
首条临时字幕—从开始会话计时
本次推理—Python 模型耗时
排队等待—有界推理队列
当前链路等待开始WebSocket → gRPC → Whisper
ENGINEERING, NOT A WRAPPER
一条可以解释清楚的实时 AI 链路
- 01浏览器采集
AudioWorklet 将麦克风声音转换为固定 20 ms PCM 帧。
- 02Go 流式网关
管理长连接、会话、背压、协程池和过载保护。
- 03Python 推理
VAD 动态切窗,Faster-Whisper 识别,匿名说话人聚类。
- 04增量回传
Protobuf 双向流返回临时、稳定和最终字幕。