AI 工坊与本地模型
AI 工坊把图片、语音和音频加工放在同一个 Mac 工作区。不同工具可能使用本地模型或受 License 控制的服务端能力;开始任务前,界面会显示需要的模型和状态。
七个工具入口
| 工具 | 主要用途 |
|---|---|
| AI 生图 | 文生图、参考图改图、历史任务与本地图库 |
| 模型仓库 | 下载、检查和管理本地模型 |
| 语音合成(TTS) | 将文本合成为语音,使用预设或克隆音色 |
| 语音识别(ASR) | 转写音视频,生成词级时间戳与字幕文件 |
| 音频修复 | 降噪、保留音色修复与音频超分 |
| 音轨分离 | 拆分人声、鼓、贝斯和其它音轨 |
| 音乐生成 | 在本地生成背景音乐素材 |
AI 生图
- 输入提示词并选择画幅或尺寸。
- 按需添加参考图。
- 提交任务后可在历史队列查看进度、失败信息和重试。
- 结果保存到本地图库,可用于封面、图文或编辑器背景。
生图队列与发布队列彼此独立,但会一起显示在全局任务中心,方便查看正在执行或失败的任务。
ASR 转写与说话人标注
ASR 支持导入音频或视频,并根据所选引擎生成文本、分段或词级时间。多人素材可以使用说话人标注,再导出 SRT、VTT 或 TXT。
可用引擎和模型会随版本更新。不要只根据模型名称判断效果;对口音、噪声、多人重叠和专业术语,建议先转写短片段比较结果。
TTS 与声音克隆
你可以选择系统预设音色,或录制 / 导入参考音创建个人音色,再合成口播音频。参考音应干净、无背景音乐,并确保你拥有声音使用授权。
生成后先试听,再导入编辑器。声音克隆不应在未经同意的情况下模仿他人。
音频修复与分离
- 降噪适合处理稳定环境噪声。
- 保音色修复适合改善口播清晰度。
- 音频超分用于改善低质量音源,但不能恢复原本不存在的细节。
- 音轨分离会生成四轨结果,复杂混音可能有残留,需要试听确认。
模型下载与磁盘空间
本地模型通常较大,第一次使用需要下载和初始化。建议:
- 在“模型仓库”确认状态后再开始任务。
- 保持稳定网络和足够空闲磁盘。
- 下载中不要强制退出 App。
- 失败时先在模型仓库重试,再导出诊断包。
项目素材和本地模型不会因为退出冰爪自动上传。若主动选择服务端 AI,所选输入会发送给对应服务完成该次任务,具体边界见数据、隐私与备份。