返回主页
🚀 快速开始
只需三步即可完成音频转录:
- 上传音频 — 将音频文件拖拽到左侧上传区域,或点击"选择本地文件"按钮浏览选择。支持 MP3、WAV、M4A、FLAC 等常见格式,支持批量上传。
- 配置参数 — 根据需要调整分段时长、并发数和上下文提示词(可选,使用默认值即可快速开始)。
- 开始转录 — 点击"开始智能转录"按钮,系统将实时展示分段处理进度,完成后自动在右侧面板显示全文结果。
📁 音频上传
支持的格式
MP3、WAV、M4A、FLAC、OGG、WMA、AAC 等所有主流音频格式。系统会自动使用 FFmpeg 进行格式转换与分段处理。
上传方式
- 拖拽上传:直接将文件从文件管理器拖入上传区域
- 点击选择:点击"选择本地文件"按钮,在系统对话框中选择文件
- 批量上传:支持同时选择多个文件,依次排队处理
💡 提示:建议单次上传文件不超过 500MB。对于超长音频(2小时以上),系统会智能分段处理,无需手动拆分。
⚙️ 参数配置
| 参数 | 说明 | 推荐值 |
| 分段时长 |
每段音频的最大长度,系统会在静音处自动切分 |
3-5 分钟 |
| 并发请求数 |
同时发起的 API 请求数量,越高速度越快 |
4 路 |
| 上下文提示词 |
输入人名、专业术语等,显著提升特定词汇识别率 |
按需填写 |
⚠️ 注意:WAV 格式文件体积较大,分段时长设置过长(>5分钟)可能导致 502 错误。建议 WAV 文件使用 3 分钟分段,MP3/M4A 可适当增大到 5-8 分钟。
上下文提示词用法
在输入框中用空格分隔填入可能出现的专有名词,例如:
- 人名:张三 李四 王经理
- 专业术语:Kubernetes 微服务 灰度发布
- 混合使用:张三 机器学习 神经网络 GPT
⚡ 转录过程
点击"开始智能转录"后,系统自动执行以下流水线:
- 静音检测 — 分析音频波形,定位自然停顿点作为切分位置
- 智能分段 — 根据静音点和设定时长将长音频切分为多个片段,片段间保留 2 秒重叠缓冲区避免丢字
- 并行转录 — 多路同时调用 ASR 引擎,每个分段独立处理,实时回显结果
- 合并输出 — 所有分段完成后,自动拼接为完整文本并存档
主面板中间区域会实时展示每个分段的处理状态:排队中(灰色)、处理中(蓝色脉冲)、完成(绿色)、失败(红色,自动重试最多 3 次)。
📄 结果查看与导出
全文阅读
切换到"全文"标签页,阅读完整转录文本,支持全文搜索高亮
时间轴分段
切换到"分段"标签页,查看每段文本对应的时间戳信息
下载导出
支持导出为 TXT 纯文本或 JSON(含时间戳)格式
搜索与高亮
在顶部搜索框中输入关键词,匹配内容会以高亮显示。支持正则表达式搜索,按 Enter 键可在多个匹配结果间跳转定位。
📚 历史记录
所有转录结果自动保存在右侧历史面板中:
- 加载历史:点击任意历史记录可重新加载查看完整转录内容
- 搜索过滤:在搜索框中输入关键词快速筛选历史记录
- 删除记录:悬浮在记录上显示删除按钮,点击确认后永久删除
- 分页浏览:记录较多时支持翻页浏览
❓ 常见问题
转录出现 502 错误?
通常是单个分段体积过大导致的网关超时。请将分段时长调低至 3 分钟,尤其是 WAV 格式文件。MP3/M4A 等压缩格式可适当放宽。
识别结果中人名/术语不准确?
请在"上下文提示词"中输入相关人名和专业词汇,用空格分隔。模型会优先匹配这些词汇,大幅提升准确率。
上传后长时间无反应?
检查是否有以下情况:
- 文件过大(>500MB)需要较长上传时间,请耐心等待进度条
- 网络不稳定导致上传中断,刷新页面重新上传
- 后台任务队列繁忙,系统会自动排队处理
如何获得最佳识别效果?
- 尽量使用高质量音源(低噪声、近距离拾音)
- 填写上下文提示词,尤其是生僻人名和专业术语
- 对于会议录音,分段时长设为 3 分钟效果最佳
- MP3/M4A 格式相比 WAV 更适合网络传输,推荐使用
⌨️ 快捷操作
| 操作 | 说明 |
| Enter | 搜索结果间向下跳转 |
| Shift + Enter | 搜索结果间向上跳转 |
| 拖拽文件到上传区 | 快速上传音频文件 |