多模态生成
使用 AI 生成图片、语音和视频,支持多种模型和风格
多模态生成
多模态生成功能让您可以使用 AI 创建图片、语音和视频内容。系统通过 rig-core 统一编排多种模态模型,支持文本生成图片(文生图)、文本生成语音(TTS)和文本生成视频,所有生成的文件自动存入媒体库便于管理。
本功能适用于内容营销素材制作、SEO 配图、短视频脚本生成等场景。
图片生成
通过文字描述生成图片,支持多种风格和尺寸。
操作步骤
- 进入「AI 能力 > 图片生成」页面
- 输入提示词(Prompt),描述想要的图片内容
- 选择图片参数:
- 尺寸(如 1024x1024、1792x1024)
- 风格(写实 / 插画 / 二次元 / 油画等)
- 生成数量
- 点击「生成」,等待模型返回结果
- 生成完成后图片自动保存到媒体库,可下载或直接用于内容
提示词技巧
产品级摄影,一个白色智能音箱放在木桌上,柔和的自然光从左侧打来,
背景虚化,色彩偏暖,4K 画质,商业摄影风格
!TIP 提示词越具体,生成效果越好。建议包含:主体、场景、光线、风格、画质等要素。
语音合成(TTS)
将文本转换为自然流畅的语音,适用于有声内容、视频配音等场景。
操作步骤
- 进入「AI 能力 > 语音合成」页面
- 输入或粘贴要转换的文本
- 选择语音参数:
- 音色(男声 / 女声 / 不同情感风格)
- 语速
- 采样率
- 点击「合成」,生成完成后可在页面试听并下载
应用场景
- SEO 内容有声化:将博客文章转为音频,提升页面停留时长
- 视频配音:为营销视频生成旁白
- 无障碍访问:为视障用户提供语音内容
视频生成
通过文字描述生成短视频,适用于社交媒体内容创作。
操作步骤
- 进入「AI 能力 > 视频生成」页面
- 输入视频描述(场景、动作、风格)
- 选择参数:
- 时长
- 分辨率
- 帧率
- 提交生成任务,等待处理完成
- 生成完成后可在媒体库查看和下载
!NOTE 视频生成耗时较长(通常 1-5 分钟),且消耗的 Token / 配额较多,请合理安排生成任务。
文件存储管理
所有生成的图片、语音、视频文件会自动存入系统媒体库,您可以在「内容管理 > 媒体库」中统一管理。
文件操作
- 查看文件列表:按类型、时间筛选已生成的文件
- 获取文件 URL:复制文件访问链接,用于内容嵌入
- 删除文件:清理不再需要的生成内容,释放存储空间
文件上传
除了 AI 生成的文件,您也可以手动上传本地文件到媒体库:
POST /api/storage/upload
Content-Type: multipart/form-data
file: <二进制文件>
!WARNING 单文件大小限制和总存储配额取决于您的套餐版本,超出配额将无法继续生成或上传。
多模态使用建议
!TIP 生成图片时建议一次生成多张候选,从中挑选最佳效果,比反复调整提示词更高效。
!NOTE 不同供应商对多模态的支持能力不同,请确认所选供应商已开启对应能力类型(image / audio / video)。
API 参考
| 方法 | 路径 | 说明 |
|---|---|---|
| POST | /api/storage/upload | 上传文件 |
| GET | /api/storage/files | 文件列表 |
| DELETE | /api/storage/files/{id} | 删除文件 |
| GET | /api/storage/files/{id}/url | 获取文件 URL |
相关链接
此页有帮助吗?