如今大多数主流图像模型都针对广泛的通用偏好进行了优化。虽然这在吸引大众方面效果显著,但往往无法满足品牌系统、营销活动和可用于生产的设计作品所需的标准。recraft v4 与设计师紧密合作开发,并围绕专业美学和实际创意需求进行调整。因此,recraft v4 为 ai 图像生成带来了真正的视觉品味。
Recraft V4 提供两个版本:V4 和 V4 Pro。两者拥有相同的创意功能和设计理念,能够生成艺术指导下的专业级视觉效果。区别在于分辨率和规模。V4 速度更快、成本更低,而 V4 Pro 则能生成更高分辨率的图像,适用于印刷素材和大规模应用。团队认为 Recraft V4 填补了一个重要的市场空白:它提供的生成式图像更注重专业设计美学,而非迎合大众网络喜好。

Recraft 开发的图像模型能够帮助设计师和营销人员制作高质量的视觉内容。Recraft V4 基于 Nebius 平台从零开始构建,是一个遵循专业设计标准的基础模型,能够生成具有出色视觉效果和品牌级品质的图像。自公司开发出首个专为设计团队打造的文本转图像模型以来,企业用户和消费者已在 Recraft 平台上生成了超过 3.5 亿张图像。
该公司是NVIDIA Blackwell GPU的早期采用者,与Nebius合作,在最新芯片正式上市前对其进行测试。NVIDIA Blackwell架构旨在支持大规模AI训练,为Recraft提供了扩展其基础模型所需的计算能力。
与 Nebius 的合作帮助团队无缝过渡到新架构,并在 Nebius AI Cloud 的 NVIDIA HGX B200 集群上运行训练和推理。
尼比乌斯和雷克拉夫特
Recraft 与 Nebius 有着深厚的合作历史,成功部署了 NVIDIA Ampere、Hopper 和 Blackwell 平台。他们是 Nebius AI 云平台的首批客户之一,也是 Nebius 早期采用 NVIDIA Blackwell GPU 的用户。在成功部署 NVIDIA HGX B200 之后,他们开始在其工作负载上测试 NVIDIA HGX B300 实例。
他们强调通过规模来提升模型质量,构建大型基础模型以创建高质量的视觉内容。“对于图像生成而言,模型越大,质量就越好,”Recraft 的人工智能主管 Pavel Ostyakov 解释道。“我们所说的模型规模,不仅仅是指参数的数量。根据我们的经验,最重要的因素是运算量,或者说模型内部用于生成输出的浮点运算次数(FLOPS)。借助 NVIDIA Blackwell GPU,我们能够显著扩展模型的运算量和参数量——在这种情况下,我们指的是数百亿个参数。”
平稳迁移到最新架构
这种新架构显著提升了训练性能和推理能力,LLM 的训练速度比上一代快四倍。为了支持 Recraft 的模型训练,Nebius 提供了一个配备 NVIDIA Blackwell GPU 的集群,并通过 NVIDIA Quantum-2 InfiniBand 互连。
对于 Recraft 而言,从 NVIDIA Hopper 过渡到 NVIDIA Blackwell 的过程非常顺利。他们基于 PyTorch 的软件栈与NVIDIA 容器兼容,后者提供了开箱即用的预编译库。分布式训练工作负载无需对 GPU 通信软件栈进行任何更改,InfiniBand 网络提供了与前几代 GPU 相同的可靠性能。
Recraft 团队对其训练设置进行了一些定制,以提高新架构上的生产性能,例如重写部分代码,将网络编译方式从使用 TensorRT 切换到torch.compile直接使用。
“如果你的代码很简单,你无需做任何特殊操作就可以切换到新的 GPU,”奥斯蒂亚科夫指出。
工程支持和强大的基础设施
Nebius 基础设施通过优化的软件栈和预防性维护,简化了硬件升级流程。Nebius AI 云平台提供强大的监控服务和详细的日志,显著提升了集群的可观测性,使 Recraft 能够快速识别并解决性能问题。
由于高效的检查点和重启流程,Recraft 工程师的训练中断情况极少。这主要归功于 Nebius 的自动化维护系统和故障检测功能。当 InfiniBand 链路或 GPU 离线时,系统会自动替换节点并从上次检查点重新开始训练,从而最大限度地减少对持续多天训练的干扰。
在向 NVIDIA Blackwell GPU 过渡的过程中,Recraft 还与 Nebius 的内部工程团队进行了合作,依靠他们在硬件升级方面的经验和对这种最新架构的深厚专业知识,帮助解决早期访问测试期间出现的问题。
让我们为您构建同样复杂度的管道。
我们专业的解决方案架构师将仔细审查您的所有具体需求,并为您量身定制解决方案。

Recraft的训练精准策略
最新一代的 GPU 为训练精度提供了新的选择,同时支持 FP8 和 FP4 量化,有可能实现更快的性能。
Recraft 会根据工作负载的具体质量要求选择训练精度格式。他们主要使用 bfloat16 进行模型训练,因为精度对图像生成质量至关重要。然而,他们在模型流程中运行文本编码器组件时采用 FP8 精度——由于这些权重在预训练期间保持冻结状态,较低的精度可以在不影响输出质量的前提下加快样本处理速度。
对于LLM推理工作负载,Recraft采用FP8精度,与其NVIDIA Hopper实现一致。该团队目前正在试验NVIDIA Blackwell的原生4位格式NVFP4,以优化推理速度。
Recraft升级到NVIDIA Blackwell GPU的经验总结
轻松升级到前沿芯片:从 NVIDIA Hopper 迁移到 Blackwell,代码更改极少,开箱即用,支持分布式训练。
扩展图像生成:成功部署 NVIDIA Blackwell GPU 来扩展其模型,验证了该硬件适用于大规模图像生成模型训练。
训练精度优化:在 NVIDIA Blackwell GPU 上部署特定于工作负载的精度格式——大部分训练使用 BF16,FP8 用于加速文本编码器的训练,并尝试使用 NVFP4 以加快推理速度。
可靠的基础设施和现场支持: Nebius AI 云平台通过自动故障检测和检查点恢复功能,最大限度地减少了培训中断。Nebius 的工程师随时待命,解决技术难题,帮助新一代人工智能更快地融入团队。











