// 01

快速入门

系统要求

在安装 DeepSeno 之前,请确认你的设备满足以下最低配置:

  • 操作系统: macOS 13 (Ventura) 及以上 / Windows 10 及以上
  • 内存: 16 GB RAM(推荐 32 GB,可运行更大的语言模型)
  • 磁盘空间: 至少 10 GB 可用空间(用于存放 AI 模型和录音数据)
  • 网络: 首次安装需要联网下载 AI 模型

下载与安装

  1. 访问 deepseno.enmooy.com/download,根据你的操作系统选择对应的安装包:
    • macOS Apple Silicon: DeepSeno-x.x.x-arm64.dmg
    • macOS Intel: DeepSeno-x.x.x.dmg
    • Windows: DeepSeno Setup x.x.x.exe
  2. macOS 用户双击 .dmg 文件,将 DeepSeno 拖入「应用程序」文件夹;Windows 用户运行安装程序并按提示完成安装。
  3. 首次打开时 macOS 可能提示"无法验证开发者",前往「系统设置 > 隐私与安全性」点击「仍要打开」即可。

关闭与退出

DeepSeno 采用「最小化到系统托盘」的设计,关闭窗口不会退出程序:

  • 点击窗口右上角的关闭按钮(X): 窗口隐藏到系统托盘,程序继续在后台运行(录音、文件监听等任务不中断)。
  • 恢复窗口: 点击系统托盘中的 DeepSeno 图标即可重新显示窗口。macOS 用户也可以点击 Dock 图标恢复。
  • 真正退出: 右键点击系统托盘中的 DeepSeno 图标,选择「退出」。macOS 用户也可以使用 Cmd + Q

首次启动:设置向导

首次运行 DeepSeno 会自动进入设置向导,共分三步:

第一步:欢迎页

向导展示 DeepSeno 的核心能力概览:语音录制与转写、智能对话与知识提取、待办自动追踪、AI 助手与第二大脑。所有数据完全在本地处理,无需上传云端。点击右上角按钮可切换界面语言(中文 / English)。

点击「开始」进入下一步。

第二步:目录配置

你需要配置两个目录:

  • 监听目录: 将音频文件放入此目录后,DeepSeno 会自动检测并加入处理队列。点击「选择」按钮浏览并选定一个文件夹(必填)。
  • 输出目录: 转录结果和导出的 Markdown 文件将保存到此处。系统会自动提供一个默认路径,你也可以更改。

配置完成后点击「下一步」。

第三步:完成设置

向导展示接下来的操作建议,点击「开始使用」即进入主界面。

模型下载

DeepSeno 依赖三个本地 AI 模型才能正常工作。你可以在设置向导完成后进入「模型」页面完成下载,也可以在向导中直接一键安装。

安装 Ollama

Ollama 是运行本地大语言模型的引擎。如果系统未检测到 Ollama,点击「一键安装」按钮即可自动下载并安装。macOS 安装包约 80 MB,Windows 约 1.2 GB。

下载 LLM 模型

DeepSeno 会根据你的硬件自动推荐合适的语言模型:

  • 16 GB 内存: 推荐 qwen3:8b(约 5.2 GB)
  • 32 GB 内存: 推荐 qwen3:14b(约 9.3 GB)
  • 64 GB 及以上: 推荐 qwen3:30b(约 19 GB)

同时还需下载 bge-m3 嵌入模型(约 1.2 GB),用于向量检索。

下载 ASR 语音模型

SenseVoice ONNX 模型(约 263 MB)用于语音识别、语音活动检测和说话人识别。下载时可选择镜像源:

  • CDN 加速: 推荐国内用户使用
  • HF Mirror 镜像: Hugging Face 镜像站
  • GitHub 加速代理: GitHub 代理加速
  • GitHub 直连: 海外网络直接下载

点击「开始下载」按钮,所有模型将依次自动下载,进度条实时显示下载状态。

第一次录音

模型就绪后,你可以开始你的第一次录音体验:

  1. 在左侧导航栏点击「信息源」进入信息源页面。
  2. DeepSeno 支持四种录音场景,每种场景可配置独立的全局快捷键:
    • 口述(Dictation): 仅录制麦克风,适合个人语音备忘
    • 现场会议(Local Meeting): 录制麦克风,适合面对面会议
    • 线上会议(Online Meeting): 同时录制麦克风和系统音频,适合视频会议(需屏幕录制权限)
    • 媒体(Media): 仅录制系统音频,适合播客、视频等媒体内容(需屏幕录制权限)
  3. 按下对应场景的快捷键(可在「设置 > 录音」中自定义)开始录音,状态栏图标会显示录音状态。
  4. 再次按下快捷键停止录音。录音文件自动保存并进入处理队列。
  5. 处理流水线包含 7 个步骤:格式转换(FORMAT)→ 语音识别(ASR)→ 说话人分离(DIAR)→ 文本优化(OPT)→ 信息提取(EXTRACT)→ 向量索引(INDEX)→ 笔记生成(MD),全部自动完成。

你也可以将已有的音频文件拖拽到信息源页面的拖放区域来导入处理,支持 WAV、MP3、M4A、FLAC、OGG、WebM 格式,单文件最大 500 MB。

查看转录结果

录音处理完成后:

  1. 在左侧导航栏点击「内容库」进入内容库页面。
  2. 左侧面板显示所有对话列表,按日期分组(今天、昨天、更早)。点击任意条目查看详情。
  3. 主面板展示完整的转录内容,每段话显示说话人标识、时间戳和情感标签。
  4. 情感标签包括:积极(positive)、消极(negative)、中性(neutral)、兴奋(excited)、沮丧(frustrated)、担忧(concerned)、自信(confident)。
  5. 点击任意文本段落可跳转到对应的音频位置播放,支持 0.5x 到 2x 倍速调节。
  6. 如果录音包含会议内容,系统会自动生成会议纪要,可在「笔记」视图中查看。
  7. 使用 Ctrl/Cmd + K 快捷键可在所有转录文本中全局搜索。

试试智脑搜索

这是 DeepSeno 最核心的功能——基于你所有录音内容的 AI 对话:

  1. 在左侧导航栏点击「智能助手」进入智能助手页面。
  2. 左侧显示会话列表,支持新建、重命名和删除会话,按时间分组(今天、本周、更早)。
  3. 在底部输入框中输入你的问题,例如:
    • "上周的会议讨论了哪些重要决策?"
    • "张总提到的项目截止日期是什么?"
    • "最近一个月我和客户沟通过哪些问题?"
  4. DeepSeno 使用 RAG(检索增强生成)技术回答你的问题:先通过向量搜索(sqlite-vec + BGE-M3)和全文搜索(FTS5)找到相关的录音片段,结合时间衰减(14 天半衰期)和记忆上下文,再由大语言模型生成回答。
  5. 每个回答下方都有来源引用,展示原文片段、说话人、时间戳,点击可跳转到对应的内容库页面播放原始音频。
  6. 你还可以开启 Agent 模式,让 AI 助手在回答问题的同时自动执行操作(如创建待办、更新记忆等)。

移动端伴侣 App

DeepSeno 的 iOS / Android 移动端 App 即将开放(敬请期待),正式上线后将作为桌面端的随身伴侣,让你在外出时也能采集语音、照片和文字,并浏览转录结果与 AI 分析。

移动端的形态、连接方式和功能设计请参考「移动端」页面;与之配套的远程同步能力请参考「公网接入」页面。

价格

当前所有功能全部免费开放:桌面端(macOS / Windows,全部功能)、所有内置与官方插件、以及公网接入能力都无需购买。移动端 App 即将上线,敬请期待。