工程版本日志 · 2026.07

SenseVoice 与 Whisper 推理基准

GPU 推理快,不代表公网体验快。这个基准把模型计算、服务耗时和完整网络链路分开记录。

InkTyper Engineering2026.07.29
204ms7.22 秒中文短句 CUDA 推理
218ms7.07 秒英文短句 CUDA 推理
272ms64.40 秒中文长句 CUDA 推理
1,246MiBSenseVoice 驻留显存
适用范围受控硬件基准不能直接推导并发容量
证据类型同机 CUDA 推理 + 旧公网对照观察结果、目标值与估算值分开陈述。
当前状态可复现但样本有限本篇记录特定日期的工程状态,不代表永久承诺。

01 · TEST BED

同一硬件、同一音频格式

测试节点为 RTX 3080 20GB,运行 PyTorch 2.6、CUDA 12.4、FunASR 与 faster-whisper。样本统一转换为 16kHz 单声道 WAV,并从生产容器本地接口发起。

02 · SENSEVOICE

中文长音频同时改善速度与完整性

SenseVoice Small 的 7.22 秒中文音频 CUDA 推理为 204ms,64.40 秒长音频为 272ms。三条样本没有出现此前 Whisper 流式拼接中的重复循环。

03 · WHISPER BASELINE

模型计算与公网总耗时差距明显

Whisper Small 的 7.22 秒中文短句 CUDA 推理为 449ms,旧公网总耗时为 3.15 秒;64.40 秒中文长句 CUDA 推理为 2.00 秒,公网总耗时为 5.65 秒。网络与调度不能被模型跑分掩盖。

04 · SCHEDULING

单 GPU 槽优先保证稳定

服务一次只驻留一个模型,切换时释放旧模型显存,最后一次使用 30 分钟后卸载。扩展并发前,需要分别测量排队、GPU 推理和端到端延迟。

证据 · 诊断

现有证据能说明什么,不能说明什么

基准把模型计算与端到端体验分开。SenseVoice 在 RTX 3080 20GB 上处理 7.22 秒与 64.40 秒中文样本的本地 CUDA 时间分别约 204ms 与 272ms;这解释了模型上限,但不包含排队、上传、网关、AI 和粘贴。

统一阅读规则生产观察只描述实际走过的路径;受控基准用于隔离单一组件;目标值在持续分布达标以前始终只是目标。

运维 · 开放工作

失败时如何退化,以及下一道验证门槛

单卡舒适并发取决于分段到达分布和共享推理锁,不能用显存能装下几个模型来回答。上线前要补单用户冷/热启动、2/4/8 并发、队列时间、峰值显存、失败率和端到端 p95;所有结果需绑定模型版本与音频清单。

失败可见性
每次降级都必须记录原因码和阶段计时。最终拿到文字,不能抹掉实时、AI 或粘贴此前失败的事实。
发布证据
request ID、实际模型、节点、排队、上传、ASR、AI 和交付时间必须保存在同一条可追踪链路中,才能完整复盘回归。