概述
LoRA(Low-Rank Adaptation,低秩适配)是一种微调技术,用一小组示例图像教会 AI 模型一种新的视觉风格。它通过向已有模型注入新的”风格权重”来实现,训练既快又高效。 本指南将带你完成完整的工作流:准备训练图像
挑选并上传能代表你所需风格的高质量图像
提交训练任务
使用你的图像 URL 和配置向
/styles/train 发送 POST 请求监控进度
使用返回的
job_id 跟踪训练任务状态使用你的风格生成图像
将训练好的风格应用于图像生成
准备训练图像
筛选你的数据集
训练图像的质量直接影响结果。不同的训练类型有不同的要求:需要多少张图像?
质量远比数量重要。少量优秀的图像会胜过大量平庸的图像。示例数据集
- 人物训练:一位人物在不同姿势、表情和光照条件下的照片。避免图像中出现其他人。
- 风格训练:一组风格一致的艺术作品集。例如,The Metropolitan Museum of Art Ukiyo-E Dataset 提供了适合训练艺术风格的日本浮世绘。
上传图像
训练之前,先上传图像获取托管 URL。使用/assets 端点:
训练你的风格
基础训练示例
提交你的图像 URL 开始训练:训练类型
type 参数会为你的使用场景设置针对性的智能默认值:
参数
必需参数
string
required
你的自定义风格的描述性名称。示例:
"Ukiyo-E Style"、"Product Photos"array
required
用于训练的图像 URL 数组。加入更多图像可获得更好的结果。
可选参数
string
default:"flux_dev"
用于训练的基础模型:图像模型:
flux_dev- 高质量、通用flux_schnell- BFL 的实时模型qwen- 阿里巴巴的模型z-image- 阿里巴巴的高效图像模型wan22- 仅图像生成
wan- 阿里巴巴的视频模型
string
default:"Default"
训练类别:
Style、Object、Character 或 Defaultstring
用于在提示词中激活此风格的自定义单词。未指定时使用风格名称。
高级参数
高级参数
调整高级参数
先使用type 字段所设置的默认值——它们适用于大多数情况。只有在遇到特定问题时才需要调整:
Learning Rate
Learning Rate
控制模型对训练图像的适应程度。
需要调整的信号:
- 输出看起来与训练图像一模一样 → 降低学习率
- 训练后风格影响很弱 → 稍微提高学习率
训练步数
训练步数
模型在你的图像上训练多久。
需要调整的信号:
- 输出过于僵硬,忽略提示词 → 减少步数
- 风格影响很弱 → 增加步数
- 生成的图像看起来完全和训练数据一样 → 减少步数(过拟合)
响应格式
监控训练进度
训练通常需要 5-15 分钟。轮询 Jobs API 检查状态:任务状态值
任务状态值
训练任务会经历以下状态:
- queued - 在队列中等待
- processing - 正在训练
- completed - 训练成功完成
- failed - 训练遇到错误
- cancelled - 任务被手动取消
使用你训练好的风格
训练完成后,通过styles 参数将你的风格应用于图像生成:
风格强度
strength 参数(0.0-1.0)控制你的风格被应用的强度:
组合多种风格
通过将多种风格添加到styles 数组来应用多种风格:
最佳实践
图像选择
图像选择
- 尽可能使用足够多的高质量图像以获得最佳结果
- 确保所有训练图像的风格保持一致
- 主题保持多样性但风格保持一致
- 避免水印、文字覆盖或伪影
- 使用至少 1024x1024 分辨率的图像
训练配置
训练配置
- 使用
type字段以默认参数开始 - 对于风格:500-1000 步通常足够
- 较低的学习率(0.0001-0.0003)可防止过拟合
- 如果风格不够强,则增加步数
- 如果输出过于僵硬,则减少步数
触发词
触发词
- 如果你打算组合多种风格,使用相同的触发词
- 当你使用某个风格时,触发词会自动注入到提示词中
- 避免常见词语,它们会出现在常规提示词里
- 多词触发词使用下划线:
my_custom_style