多模态生成

使用 AI 生成图片、语音和视频,支持多种模型和风格

多模态生成

多模态生成功能让您可以使用 AI 创建图片、语音和视频内容。系统通过 rig-core 统一编排多种模态模型,支持文本生成图片(文生图)、文本生成语音(TTS)和文本生成视频,所有生成的文件自动存入媒体库便于管理。

本功能适用于内容营销素材制作、SEO 配图、短视频脚本生成等场景。

图片生成

通过文字描述生成图片,支持多种风格和尺寸。

操作步骤

  1. 进入「AI 能力 > 图片生成」页面
  2. 输入提示词(Prompt),描述想要的图片内容
  3. 选择图片参数:
    • 尺寸(如 1024x1024、1792x1024)
    • 风格(写实 / 插画 / 二次元 / 油画等)
    • 生成数量
  4. 点击「生成」,等待模型返回结果
  5. 生成完成后图片自动保存到媒体库,可下载或直接用于内容

提示词技巧

产品级摄影,一个白色智能音箱放在木桌上,柔和的自然光从左侧打来,
背景虚化,色彩偏暖,4K 画质,商业摄影风格

!TIP 提示词越具体,生成效果越好。建议包含:主体、场景、光线、风格、画质等要素。

语音合成(TTS)

将文本转换为自然流畅的语音,适用于有声内容、视频配音等场景。

操作步骤

  1. 进入「AI 能力 > 语音合成」页面
  2. 输入或粘贴要转换的文本
  3. 选择语音参数:
    • 音色(男声 / 女声 / 不同情感风格)
    • 语速
    • 采样率
  4. 点击「合成」,生成完成后可在页面试听并下载

应用场景

  • SEO 内容有声化:将博客文章转为音频,提升页面停留时长
  • 视频配音:为营销视频生成旁白
  • 无障碍访问:为视障用户提供语音内容

视频生成

通过文字描述生成短视频,适用于社交媒体内容创作。

操作步骤

  1. 进入「AI 能力 > 视频生成」页面
  2. 输入视频描述(场景、动作、风格)
  3. 选择参数:
    • 时长
    • 分辨率
    • 帧率
  4. 提交生成任务,等待处理完成
  5. 生成完成后可在媒体库查看和下载

!NOTE 视频生成耗时较长(通常 1-5 分钟),且消耗的 Token / 配额较多,请合理安排生成任务。

文件存储管理

所有生成的图片、语音、视频文件会自动存入系统媒体库,您可以在「内容管理 > 媒体库」中统一管理。

文件操作

  • 查看文件列表:按类型、时间筛选已生成的文件
  • 获取文件 URL:复制文件访问链接,用于内容嵌入
  • 删除文件:清理不再需要的生成内容,释放存储空间

文件上传

除了 AI 生成的文件,您也可以手动上传本地文件到媒体库:

POST /api/storage/upload
Content-Type: multipart/form-data

file: <二进制文件>

!WARNING 单文件大小限制和总存储配额取决于您的套餐版本,超出配额将无法继续生成或上传。

多模态使用建议

!TIP 生成图片时建议一次生成多张候选,从中挑选最佳效果,比反复调整提示词更高效。

!NOTE 不同供应商对多模态的支持能力不同,请确认所选供应商已开启对应能力类型(image / audio / video)。

API 参考

方法路径说明
POST/api/storage/upload上传文件
GET/api/storage/files文件列表
DELETE/api/storage/files/{id}删除文件
GET/api/storage/files/{id}/url获取文件 URL

相关链接

此页有帮助吗?

订阅最新资讯

获取 GEO 优化前沿动态与行业洞察