Skip to main content

概述

LoRA(Low-Rank Adaptation,低秩适配)是一种微调技术,用一小组示例图像教会 AI 模型一种新的视觉风格。它通过向已有模型注入新的”风格权重”来实现,训练既快又高效。 本指南将带你完成完整的工作流:

准备训练图像

挑选并上传能代表你所需风格的高质量图像

提交训练任务

使用你的图像 URL 和配置向 /styles/train 发送 POST 请求

监控进度

使用返回的 job_id 跟踪训练任务状态

使用你的风格生成图像

将训练好的风格应用于图像生成

准备训练图像

筛选你的数据集

训练图像的质量直接影响结果。不同的训练类型有不同的要求:

需要多少张图像?

质量远比数量重要。少量优秀的图像会胜过大量平庸的图像。
质量 > 数量15 张高质量图像会比 50 张低质量图像产出更好的结果。优先考虑:
  • 高分辨率(最少 1024x1024)
  • 所有图像的风格保持一致
  • 没有水印、文字覆盖或压缩伪影
  • 主题多样但风格保持一致
示例数据集
  • 人物训练:一位人物在不同姿势、表情和光照条件下的照片。避免图像中出现其他人。
  • 风格训练:一组风格一致的艺术作品集。例如,The Metropolitan Museum of Art Ukiyo-E Dataset 提供了适合训练艺术风格的日本浮世绘。

上传图像

训练之前,先上传图像获取托管 URL。使用 /assets 端点:
保存返回的 image_url 值——你将把这些值传递给训练端点。

训练你的风格

基础训练示例

提交你的图像 URL 开始训练:

训练类型

type 参数会为你的使用场景设置针对性的智能默认值:

参数

必需参数

string
required
你的自定义风格的描述性名称。示例: "Ukiyo-E Style""Product Photos"
array
required
用于训练的图像 URL 数组。加入更多图像可获得更好的结果。

可选参数

string
default:"flux_dev"
用于训练的基础模型:图像模型:
  • flux_dev - 高质量、通用
  • flux_schnell - BFL 的实时模型
  • qwen - 阿里巴巴的模型
  • z-image - 阿里巴巴的高效图像模型
  • wan22 - 仅图像生成
视频模型:
  • wan - 阿里巴巴的视频模型
string
default:"Default"
训练类别:StyleObjectCharacterDefault
string
用于在提示词中激活此风格的自定义单词。未指定时使用风格名称。
选择不会出现在常见提示词中的独特触发词。多词触发词使用下划线:ukiyo_style
number
控制训练强度。更高的值训练更快,但可能过拟合。推荐范围: 0.0001 - 0.001
integer
最大训练迭代次数。范围:1-2000
integer
同时处理的图像数量。较大的批次训练更快,但占用更多内存。

调整高级参数

先使用 type 字段所设置的默认值——它们适用于大多数情况。只有在遇到特定问题时才需要调整:
控制模型对训练图像的适应程度。需要调整的信号:
  • 输出看起来与训练图像一模一样 → 降低学习率
  • 训练后风格影响很弱 → 稍微提高学习率
模型在你的图像上训练多久。需要调整的信号:
  • 输出过于僵硬,忽略提示词 → 减少步数
  • 风格影响很弱 → 增加步数
  • 生成的图像看起来完全和训练数据一样 → 减少步数(过拟合)
迭代式调优如果你的第一次训练没有产生想要的结果:
  1. 先调整 max_train_steps(最常见的修正)
  2. 如果单独调整步数无效,再尝试 learning_rate

响应格式


监控训练进度

训练通常需要 5-15 分钟。轮询 Jobs API 检查状态:
训练任务会经历以下状态:
  1. queued - 在队列中等待
  2. processing - 正在训练
  3. completed - 训练成功完成
  4. failed - 训练遇到错误
  5. cancelled - 任务被手动取消

使用你训练好的风格

训练完成后,通过 styles 参数将你的风格应用于图像生成:
应用与 API 之间的风格所有权API 和 Krea 网页应用在你的工作区中作为不同的用户身份运行。风格对创建者而言是私有的,因此:
  • 在应用中训练的风格 通过 API 无法访问,除非共享
  • 通过 API 训练的风格 在应用中无法访问,除非共享
要将风格共享给你的工作区(双向都可以):

风格强度

strength 参数(0.0-1.0)控制你的风格被应用的强度:
0.8 强度开始,然后根据结果调整。较低的值提供更多创作自由;较高的值则强制更严格的风格贴合。

组合多种风格

通过将多种风格添加到 styles 数组来应用多种风格:

最佳实践

  • 尽可能使用足够多的高质量图像以获得最佳结果
  • 确保所有训练图像的风格保持一致
  • 主题保持多样性但风格保持一致
  • 避免水印、文字覆盖或伪影
  • 使用至少 1024x1024 分辨率的图像
  • 使用 type 字段以默认参数开始
  • 对于风格:500-1000 步通常足够
  • 较低的学习率(0.0001-0.0003)可防止过拟合
  • 如果风格不够强,则增加步数
  • 如果输出过于僵硬,则减少步数
  • 如果你打算组合多种风格,使用相同的触发词
  • 当你使用某个风格时,触发词会自动注入到提示词中
  • 避免常见词语,它们会出现在常规提示词里
  • 多词触发词使用下划线:my_custom_style