// 03

信息源

概述

信息源是所有数据进入 DeepSeno 的统一入口,支持音频、视频和文档三种信息类型。

页面顶部提供信息类型标签页切换和筛选:

  • 音频: 录音与音频文件导入(WAV、MP3、M4A、FLAC、OGG、WebM)
  • 视频: 视频文件导入(MP4、MKV、MOV、WebM),自动提取音频并转录
  • 文档: 文档文件导入(PDF、DOCX、TXT、MD),自动提取文本内容
  • 图片: 图片文件导入(JPEG、PNG、HEIC),通过视觉分析提取文字和内容信息

图片格式:

  • JPEG、PNG、HEIC(来自手机拍照或截图)
  • 支持通过拖拽导入或移动端上传
  • 图片会通过视觉分析提取文字和内容信息

每条记录根据来源类型显示不同的图标(麦克风/视频/文件),音频和视频显示时长,文档显示页数。

录音场景

DeepSeno 支持四种录音场景,每种场景对应不同的音频采集方式:

  • 口述(Dictation): 仅录制麦克风音频,适合个人语音备忘、口述笔记
  • 现场会议(Local Meeting): 录制麦克风音频,适合面对面的小组讨论和会议
  • 线上会议(Online Meeting): 同时录制麦克风和系统音频,适合 Zoom、腾讯会议等线上会议场景(需授予屏幕录制权限)
  • 媒体(Media): 仅录制系统音频,适合转写播客、视频课程、YouTube 等媒体内容(需授予屏幕录制权限)

每种场景可在「设置 > 录音」中配置独立的全局快捷键。

快捷键录音

按下对应场景的快捷键即可开始录音,再次按下停止录音。录音完成后文件自动保存并进入处理队列。

场景标签

每条录音记录会自动标记场景类型,以彩色标签显示:

  • 口述: 个人语音备忘
  • 会议: 现场或线上会议
  • 媒体: 播客、视频课程等

支持按场景类型筛选录音列表。媒体场景的内容不会被纳入个人记忆提取和日报周报汇总,避免外部内容污染知识图谱。

图片

DeepSeno 支持图片作为信息源,你可以通过以下方式导入图片:

  • 拖拽导入: 将图片文件拖入信息源页面(支持 JPEG、PNG、HEIC 格式)
  • 移动端拍照: 在移动端 App 中拍摄单张或多张照片上传
  • 文件浏览: 点击「浏览文件」选择图片文件

多张照片会作为一组上传,在来源列表中显示图片图标和数量。图片类录音在详情页中以画廊形式展示。

如果配置了视觉模型(如 Qwen3.5-vision),系统会对图片内容进行智能分析和文本提取。

移动端上传

通过 DeepSeno 移动端 App(iOS / Android)采集的语音、照片、视频和文件,会通过局域网自动上传到桌面端并进入处理队列。移动端上传的内容与桌面端录音享受完全相同的处理流水线。

详细操作请参考「移动端」页面。

微信消息

通过个人微信 ClawBot 插件发送的内容也会自动进入处理流水线:

  • 语音消息: 微信自动转写文字后交给 Agent 处理并回复
  • 图片: 自动下载解密,进入图片分析流水线(LLM 视觉分析 + OCR 文字提取 + 记忆提取)
  • 视频: 自动下载解密,进入视频处理流水线(提取音频 → ASR 转写 → 帧分析)
  • 文件: 自动下载保存,进入文档处理流水线(PDF/Word 文本提取)
  • 文字消息: 由 Agent 智能回复

处理完成后,结果摘要会自动推送回微信。配置方法请参考「通道集成 > 个人微信」页面。

文字消息

通过飞书等渠道或移动端 App 的文字速记功能发送的文字消息也会出现在信息源列表中,显示消息图标和内容预览。文字消息同样经过记忆提取和信息分析,并纳入日报汇总。

拖拽导入

将文件直接拖拽到信息源页面的拖放区域即可导入处理。你也可以在应用的任意页面(内容库、智能助手等)拖放文件,文件将自动加入处理队列。支持音频、视频和文档格式,音频/视频单文件最大 500 MB,文档最大 50 MB。也可以点击「浏览文件」按钮选择文件。

监听目录自动导入

将音频文件放入在设置向导中配置的监听目录,DeepSeno 会自动检测新文件并加入处理队列。可在「设置 > 常规」中开关自动处理功能。

处理流水线

每个音频文件进入队列后会依次经过 7 个处理步骤:

  1. FORMAT(格式转换): 将输入音频转换为统一格式
  2. ASR(语音识别): 使用 SenseVoice 模型将语音转为文本
  3. DIAR(说话人分离): 识别和区分不同说话人
  4. OPT(文本优化): 使用 LLM 优化转录文本,修正错别字和标点
  5. EXTRACT(信息提取): 自动提取待办、决策、联系人等结构化信息
  6. INDEX(向量索引): 将文本片段生成嵌入向量并建立搜索索引
  7. MD(笔记生成): 生成 Markdown 格式的会议纪要

队列管理

处理队列区域以步骤指示器的形式展示当前进度(含图标和百分比),支持以下操作:

  • 暂停/恢复: 暂停整个处理队列或恢复继续处理
  • 重试: 对处理失败的任务重新执行(可重试的错误如 Ollama 超时会自动重试)
  • 取消: 从队列中移除某个任务
  • 重置卡住任务: 批量重置状态异常的任务

录音后行为

在「设置 > 录音」中可配置:

  • 自动粘贴: 录音转写完成后自动将文本粘贴到当前光标位置
  • 连续剪贴板: 持续将新的转录文本追加到剪贴板