在会议、访谈、课程和日常工作中,录音和录像越来越容易,但真正困难的往往不是“记录下来”,而是从大量音视频中找到真正有价值的信息。
AudioNotes 是一个开源的本地音视频转文字与智能笔记工具。它试图解决的并不只是“语音转文字”这一件事,而是建立一条从音视频 → 文字稿 → 结构化笔记 → AI 问答的完整工作流。项目源码公开在 GitHub,核心特点是本地优先,尽量让用户的数据留在自己的电脑上。
一、AudioNotes 到底解决什么问题?
传统录音工具的工作方式很简单:录下来,然后把文件保存起来。
问题是,当录音越来越多之后,“保存”本身就变成了新的负担。
例如,一场两小时的会议结束后,你可能需要回答:
- 谁提出了某个方案?
- 最终决定是什么?
- 某个任务由谁负责?
- 截止时间是什么?
- 某个观点是在什么时候提出的?
- 这次会议最重要的结论有哪些?
如果没有文字稿,寻找这些信息往往意味着重新听一遍录音。
AudioNotes 的思路则是先利用本地语音识别模型将音视频转换为文字,再利用本地大语言模型对内容进行整理,最终形成 Markdown 笔记,并允许用户继续针对这份内容进行提问。项目 README 将其定位为适合会议、访谈、课程以及语音备忘录等场景的工具。
因此,它更像是一个“音视频知识库入口”,而不只是一个录音转写器。
二、完整工作流:从声音到知识
AudioNotes 的使用流程可以概括为四个阶段。
1. 获取音视频
用户可以直接上传音频或视频文件,也可以使用浏览器进行录音。
这意味着它既适合处理已经存在的素材,也适合在会议、访谈等场景中直接使用。
2. 本地语音识别
AudioNotes 默认使用 FunAudioLLM/Fun-ASR-Nano-2512 进行语音识别。
相比单纯把文件上传到在线转录服务,本地识别的最大价值是:音视频内容可以留在用户自己的设备中。
当然,本地识别并不意味着结果一定完美。录音质量、环境噪声、口音以及多人同时说话,都可能影响最终文字稿,因此对于合同、会议决议等重要内容,仍然应该回听原始音频进行确认。
3. AI 自动整理
得到原始文字稿之后,AudioNotes 再利用 Ollama 运行的本地大语言模型进行笔记整理。
项目默认使用 qwen3.5:2b,目标是在普通电脑的资源条件下,在中文处理质量和资源消耗之间取得平衡。
这一步非常关键。
因为一份完整的会议转录可能包含大量口语化表达、重复内容和无关信息,而结构化笔记真正需要的是:
结论、观点、任务、时间、人物以及上下文。
因此,AudioNotes 的价值并不只来自 ASR,而来自 ASR 与 LLM 两个环节的组合。
4. 针对内容继续提问
笔记生成后,用户还可以继续与音视频内容进行对话。
例如:
“这次会议最终确定了哪三个方案?”
或者:
“张三负责哪些任务?”
这让音视频从一个需要人工“阅读”的文件,变成了一个可以直接询问的信息源。
三、本地优先,是 AudioNotes 最值得关注的特点
今天的 AI 产品大量依赖云端 API,但音视频往往包含非常敏感的信息。
一场公司内部会议可能包含商业计划;一次用户访谈可能包含个人信息;课程录音可能涉及尚未公开的研究内容。
AudioNotes 的设计理念恰恰是在这里做了不同的选择。
项目 README 明确说明,音视频、文字稿、笔记和对话历史默认保存在本机;语音识别通过 FunASR 在本地完成,大语言模型通过 Ollama 在本地运行,默认不会把音视频内容发送给第三方 AI 接口。Web 页面默认也只允许本机访问。
从架构角度看,这是一种典型的 local-first AI 思路:
数据进入电脑 → 本地完成 ASR → 本地完成 LLM 处理 → 本地保存结果。
这对于隐私敏感场景尤其有吸引力。
当然,“本地运行”并不等于绝对安全。电脑本身的账户、磁盘权限、备份以及网络环境仍然需要做好保护。项目也特别提醒用户,应在可信任的电脑上使用并妥善保护本机数据。
四、Docker 让部署变得相对简单
对于普通用户来说,最大的门槛往往不是使用 AI,而是安装 AI。
AudioNotes 提供了 Docker 方式,可以把主要运行环境封装起来。
官方推荐的基本环境包括 Docker Desktop 和 Ollama,并建议 Docker Desktop 至少分配 12GB 内存;如果处理较长音视频,推荐 16GB,并预留约 10GB 磁盘空间。
基本流程是:
ollama pull qwen3.5:2b
mkdir audionotes
cd audionotes
curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/docker-compose.yml -o docker-compose.yml
curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/.env.example -o .env
docker compose up -d --remove-orphans
启动后访问本机的 15433 端口即可进入 Web 界面。首次进行语音识别时,还需要下载约 2.15GB 的语音模型;下载完成后模型会保存在本机,后续不需要重复下载。
值得注意的是,项目的 Docker 配置并不是简单地把一个 Web 服务跑起来。其 Compose 配置还包括数据持久化、健康检查、自动重启、进程回收以及容器权限收缩等设置。例如,默认只将服务绑定到 127.0.0.1,并通过 cap_drop: ALL 和 no-new-privileges 降低容器被滥用后的风险。
这说明项目在“能运行”之外,也考虑了一些实际部署中的安全与稳定性问题。
五、数据究竟保存在哪里?
本地 AI 工具的另一个关键问题是:我的数据到底去了哪里?
AudioNotes 使用 Docker 时,会把数据映射到创建的 audionotes 文件夹中,其中包括上传文件、模型缓存、日志和对话历史等内容。源码运行模式下,个人数据主要保存在项目的 storage 文件夹中,而 Ollama 的模型则由 Ollama 自己管理。
这带来一个非常实用的优势:数据管理相对直观。
例如,项目建议:
- 备份时复制整个
audionotes文件夹; - 迁移电脑时整体复制该文件夹;
- 不再需要历史数据时,可以停止服务后删除该文件夹。
也就是说,用户不必依赖某个第三方 SaaS 平台来管理自己的历史笔记。
六、它适合哪些人?
AudioNotes 最适合的是那些拥有大量语音或视频资料,同时又希望内容保持本地化的人。
会议记录
这是最直接的应用场景。
会议结束后,不需要花大量时间手工整理录音,可以让 AI 先完成初步转写和结构化整理,再人工确认关键结论。
访谈与采访
采访通常包含大量自然语言和长时间对话。将录音转换为文字之后,查找人物、观点和关键回答会容易很多。
课程与学习
对于长课程录音,文字稿和 AI 问答可以降低回听成本。
例如,与其重新听一小时课程寻找某个概念,不如直接询问:
“老师对这个概念给出了哪些例子?”
个人语音备忘录
灵感、待办事项和临时想法都可以先通过录音保存,再让 AI 帮助整理成更容易阅读的文字。
七、AudioNotes 的优势与局限
如果从产品角度评价,AudioNotes 的优势比较明确。
第一,本地优先。
这是它区别于大量云端 AI 笔记工具的核心竞争力。敏感音视频不必默认上传到第三方 AI 服务。
第二,工作流完整。
它不是只解决“语音转文字”,而是进一步完成笔记整理和内容问答。
第三,开源且可自行部署。
用户可以查看源码、自己部署,并根据需要调整模型和配置。
第四,数据管理比较透明。
上传文件、历史数据和模型缓存都有明确的本地存储位置。
但它也存在明显的门槛。
首先,本地 AI 对硬件资源有要求。项目明确建议至少为 Docker 分配 12GB 内存,长音视频推荐 16GB。
其次,本地模型的速度和效果会受到电脑硬件影响。
再次,虽然本地模型有隐私优势,但它并不能自动保证转写准确率。对于重要内容,人工校对仍然不可省略。
最后,安装 Docker、Ollama、模型以及处理模型缓存,对于完全没有技术背景的用户来说,依然存在一定学习成本。
八、它真正有意思的地方,不是“转写”
如果只把 AudioNotes 看成一个“录音转文字软件”,其实低估了它。
它真正值得关注的地方,是把传统的音视频文件转换成了一个可以被 AI 理解和查询的内容载体。
过去:
录音 → 文件 → 人工回听
现在:
录音 → ASR → 文字稿 → AI 摘要 → 对话式查询
这意味着音视频本身开始成为一种“可交互的数据”。
尤其是在本地模型越来越强、消费级电脑算力不断提高的情况下,这种模式可能会成为传统云端 AI 工具之外的一条重要路线。
九、结语
AudioNotes 是一个很有代表性的本地 AI 应用:它没有试图重新发明一个复杂的 AI 平台,而是把几个已经成熟的技术组件组合起来——FunASR 负责听懂声音,Ollama 负责理解内容,Markdown 负责承载笔记,Web UI 负责交互。
它最值得肯定的地方,是把“隐私”和“AI 能力”放在了同一个产品设计里。
对于经常处理会议、访谈、课程或个人录音的人来说,AudioNotes 提供了一种值得尝试的工作方式:
不再把录音当成需要保存的文件,而是把它当成可以被搜索、总结和询问的个人知识来源。
项目源码与完整部署说明可以在 GitHub 上的 AudioNotes 仓库 查看。本文中的功能与部署信息以项目当前 README 和 Docker Compose 配置为依据。







暂无评论内容