跳转到正文
适用版本 0.10.2 更新于

使用 AI 工具

点击左侧 AI 工具。当前有三项工具:AI 生图、音视频转写、文字配音。点击左上角标题或输入框底部的工具名都可以切换,下次进入会停在上次用的工具。右侧是历史记录,点右上角的侧栏按钮可以展开或收起。

这三项工具都可以直接使用,不需要连接 AI 助手。

先分清:哪些在本机运行,哪些走云端

工具本机(离线可用)云端(需要 Key)
AI 生图无生图接口(OpenAI 兼容)或 Google Gemini
音视频转写Qwen3-ASR 本地模型、苹果系统自带识别Gemini 3.5 云端(原始词级)
文字配音VoxCPM2(中文、可克隆)、Kokoro(英文预置音色)OpenAI 兼容 TTS、ElevenLabs、Deepgram、Google Gemini
  • 本地模型第一次使用需要下载,之后完全在 Mac 上运行,素材不离开本机。下载和卸载在设置 → AI 与模型 → 本地模型统一管理。
  • 云端服务需要你自己的 Key,在设置 → AI 与模型 → 云端服务填写。一个 Google Gemini Key 就能用于转写、生图、配音和背景音乐;生图和音乐不在 Gemini 免费额度内,需要先在 Google AI Studio 开通付费。配置方法见设置总览与 API Key。

0.9 起,AI 工具里的“音轨分离”“AI 音乐”和转写的“AI 纠错”已移除。背景音乐可以让你的 AI 助手用 Gemini 生成,字幕纠错交给 AI 助手完成,见交给 AI:模板视频、字幕与文案。

AI 生图

AI 生图页面,底部输入框可选择模型、尺寸和张数
在底部描述画面,选择模型、尺寸和张数后生成。
  1. 切换到 AI 生图。
  2. 在底部输入想要的画面,例如“桌面上一台银色笔记本电脑,柔和侧光,右上角留出标题空间”。
  3. 选择模型、尺寸和张数。
  4. 需要参考图时,点击输入框左侧的 +,或直接拖入、粘贴图片。
  5. 点击发送,等待图片出现在上方图库。
  6. 点击图片查看大图。可以直接拖到 Finder、项目或其它 App,也可以点右上角在 Finder 中打开。

用哪条线路生图: 填了“生图接口”就优先用它;没填时,如果配置了 Gemini Key,自动用 Gemini 生图。两者都没配置时,生成按钮会提示先去设置。

历史里的提示词可以一键回填,图库里的图片也可以拖回输入框当参考图。

音视频转写

音视频转写页面,底部输入框显示 Qwen3-ASR、自动识别语言、单人模式和每行 16 字
底部可以选择识别引擎、语言、说话人模式和每行字数。
  1. 切换到音视频转写。正在看旧结果时,先点右上角新转写。
  2. 点击输入框的 + 选择文件,或直接拖入 MP4、MOV、WAV、MP3 或 FCPXML。
  3. 在底部选择引擎:
    • Qwen3 本地(离线):默认选项,准确度高,第一次需下载模型;
    • 苹果系统自带:不用下载,速度快,适合简单内容;
    • Gemini 3.5 云端:需要 Gemini Key,音频会上传到 Google 处理。
  4. 设置语言(默认自动识别)、单人或多人、每行字数。
  5. 点击发送开始转写。
  6. 点击字幕跳到对应位置播放,校对人名、数字和专有名词。
  7. 点击顶部导出,选择 SRT、VTT、TXT 或 FCPXML。

结果有分行、分段、全文三种视图:分行适合逐条改字幕,分段适合读口述内容,全文适合整理文字稿。顶部时间线可以展开波形和字幕轨。转写历史不限条数,不需要时在右侧逐条删除。

精修方法见精修转写与剪后字幕。

文字配音

文字配音页面,上方是整页稿件,底部可选择模型、克隆模式、声源和生成参数,右上角切换提供方
上方写配音稿,底部写要求和选模型,右上角切换本地或云端提供方。
  1. 切换到文字配音,点击右上角新配音。
  2. 在上方输入要念的完整稿件。
  3. 在底部输入框描述音色、情绪和语速,例如“自然讲解,语速稍慢,数字读清楚”。
  4. 在右上角选择提供方:本地模型、OpenAI 兼容 TTS、ElevenLabs、Deepgram 或 Google Gemini。
  5. 选择模型和音色,点击生成配音。
  6. 在右侧历史里试听。音频可以直接拖到 Finder、剪辑软件或其它 App。

本地配音:VoxCPM2 与 Kokoro

  • VoxCPM2:中文首选,48kHz。三种模式:文字造音色(用一句话描述想要的声音)、参考音克隆(用一段参考音克隆音色)、高保真克隆(参考音加文字稿)。底部“步数”默认 10、“CFG”默认 2.0,一般不需要改。
  • Kokoro:体积很小,50 多种预设音色、10 种语言,适合英文旁白,不支持克隆。

用自己的声音克隆

  1. 选择 VoxCPM2 和“参考音克隆”,点击选择声源打开声源库。
  2. 导入一段参考音,或现场录一段(15~30 秒)。
  3. 试听并保存,选它作为本次声源。
  4. 输入稿件并生成,重点听停顿、发音和音色。

参考音最好是单人、清晰、背景安静。需要时可以勾选提取人声或净化声源,两项默认关闭。右侧历史里的配音也可以存进声源库再用。

云端配音

提供方说明
Google Gemini用 Gemini Key,可选 30 种音色(如 Kore、Puck)
ElevenLabs需要 ElevenLabs Key,可以直接选你账号里的音色
Deepgram需要 Deepgram Key,模型名同时决定声音
OpenAI 兼容 TTS填服务地址(可以是局域网内自己架的服务),模型和音色按服务支持填写

服务地址和 Key 在设置里配置;模型和音色在配音页底部按每次任务选择。

下载模型与处理失败

本地模型没下载时,工具底部会直接显示“未下载 / 下载”,下载中依次显示连接、百分比和速度,失败可以原地重试。

情况怎么处理
生成按钮不能点检查是否输入了内容或选了文件、模型是否下载完成、云端服务是否配置。
模型下载失败原地重试,检查网络和磁盘空间。
找不到导入按钮正在看旧的转写结果,先点“新转写”。
配音读错名字或停顿不对修改稿件或底部要求,重新生成。
提示“今天的额度用完了”Gemini 免费额度当天已用完,第二天再试,或在 Google AI Studio 开通付费。
提示需要开通付费Gemini 生图和音乐不在免费额度内,到 Google AI Studio 开通付费。
其它云端错误看错误文字,核对 Key 和网络;先确认原任务状态,避免重复提交。