返回主页

言记 使用指南

长音频智能转录工具 — 从上传到获取结果的完整操作指引

🚀 快速开始

只需三步即可完成音频转录:

  1. 上传音频 — 将音频文件拖拽到左侧上传区域,或点击"选择本地文件"按钮浏览选择。支持 MP3、WAV、M4A、FLAC 等常见格式,支持批量上传。
  2. 配置参数 — 根据需要调整分段时长、并发数和上下文提示词(可选,使用默认值即可快速开始)。
  3. 开始转录 — 点击"开始智能转录"按钮,系统将实时展示分段处理进度,完成后自动在右侧面板显示全文结果。

📁 音频上传

支持的格式

MP3、WAV、M4A、FLAC、OGG、WMA、AAC 等所有主流音频格式。系统会自动使用 FFmpeg 进行格式转换与分段处理。

上传方式

💡 提示:建议单次上传文件不超过 500MB。对于超长音频(2小时以上),系统会智能分段处理,无需手动拆分。

⚙️ 参数配置

参数说明推荐值
分段时长 每段音频的最大长度,系统会在静音处自动切分 3-5 分钟
并发请求数 同时发起的 API 请求数量,越高速度越快 4 路
上下文提示词 输入人名、专业术语等,显著提升特定词汇识别率 按需填写
⚠️ 注意:WAV 格式文件体积较大,分段时长设置过长(>5分钟)可能导致 502 错误。建议 WAV 文件使用 3 分钟分段,MP3/M4A 可适当增大到 5-8 分钟。

上下文提示词用法

在输入框中用空格分隔填入可能出现的专有名词,例如:

转录过程

点击"开始智能转录"后,系统自动执行以下流水线:

  1. 静音检测 — 分析音频波形,定位自然停顿点作为切分位置
  2. 智能分段 — 根据静音点和设定时长将长音频切分为多个片段,片段间保留 2 秒重叠缓冲区避免丢字
  3. 并行转录 — 多路同时调用 ASR 引擎,每个分段独立处理,实时回显结果
  4. 合并输出 — 所有分段完成后,自动拼接为完整文本并存档

主面板中间区域会实时展示每个分段的处理状态:排队中(灰色)、处理中(蓝色脉冲)、完成(绿色)、失败(红色,自动重试最多 3 次)。

📄 结果查看与导出

全文阅读

切换到"全文"标签页,阅读完整转录文本,支持全文搜索高亮

时间轴分段

切换到"分段"标签页,查看每段文本对应的时间戳信息

一键复制

点击复制按钮将全文内容复制到剪贴板

下载导出

支持导出为 TXT 纯文本或 JSON(含时间戳)格式

搜索与高亮

在顶部搜索框中输入关键词,匹配内容会以高亮显示。支持正则表达式搜索,按 Enter 键可在多个匹配结果间跳转定位。

📚 历史记录

所有转录结果自动保存在右侧历史面板中:

常见问题

转录出现 502 错误?

通常是单个分段体积过大导致的网关超时。请将分段时长调低至 3 分钟,尤其是 WAV 格式文件。MP3/M4A 等压缩格式可适当放宽。

识别结果中人名/术语不准确?

请在"上下文提示词"中输入相关人名和专业词汇,用空格分隔。模型会优先匹配这些词汇,大幅提升准确率。

上传后长时间无反应?

检查是否有以下情况:

如何获得最佳识别效果?

⌨️ 快捷操作

操作说明
Enter搜索结果间向下跳转
Shift + Enter搜索结果间向上跳转
拖拽文件到上传区快速上传音频文件