LivingSubtitles
正在检测 GPU

WHISPER · STREAMING · SPEAKER-AWARE

把每一句话,实时交给正确的说话人。

浏览器采集音频,Go 网关承接实时连接,Python 推理引擎完成语音识别与匿名说话人聚类。临时结果快速出现,最终字幕稳定落定。

默认不录音、不落盘;本次字幕只保留在当前浏览器页面。
匿名说话人 · 开启00:00

LIVE TRANSCRIPT

实时字幕

准备好后,点击“开始字幕”

允许麦克风权限,开始说话。静音不会触发模型推理。

首条临时字幕从开始会话计时
本次推理Python 模型耗时
排队等待有界推理队列
当前链路等待开始WebSocket → gRPC → Whisper

ENGINEERING, NOT A WRAPPER

一条可以解释清楚的实时 AI 链路

  1. 01浏览器采集

    AudioWorklet 将麦克风声音转换为固定 20 ms PCM 帧。

  2. 02Go 流式网关

    管理长连接、会话、背压、协程池和过载保护。

  3. 03Python 推理

    VAD 动态切窗,Faster-Whisper 识别,匿名说话人聚类。

  4. 04增量回传

    Protobuf 双向流返回临时、稳定和最终字幕。