视频号
    标题 摘要 内容
    详情

    蚂蚁集团旗下百灵实验室、inclusionAI团队正式开源全新图像生成与编辑大模型LLaDA-Image,同步开放模型权重、完整推理代码及全套训练配方,为全球开发者、科研人员及行业从业者提供高性能、低成本、全开放的视觉AIGC解决方案,进一步降低高质量AI视觉创作的技术门槛。


    当前主流视觉模型普遍存在技术架构割裂问题,生成模型与编辑模型需独立部署、权重分离,不仅增加开发部署成本,还容易出现图像细节丢失、风格不统一、编辑精准度不足等痛点。针对行业痛点,蚂蚁LLaDA-Image创新采用全扩散统一架构,打破传统模型的功能边界,实现单个模型权重同时支撑文生图、指令引导式图像编辑、多参考图细节保留编辑等多重能力,无需额外搭建专属编辑骨干网络,大幅简化视觉AI落地流程。


    据了解,LLaDA-Image核心搭载6B参数扩散Transformer(DiT),搭配基于LLaDA2.0-Mini扩散语言模型构建的冻结视觉语言理解模块,形成“理解+生成”一体化闭环。区别于多数依赖海量图文配对数据训练的模型,该模型采用纯图像预训练优先的训练范式,通过220M海量图像样本构建扎实的视觉生成先验,再结合中期微调优化指令理解能力,让模型对光影、构图、纹理细节的理解更贴合真实视觉逻辑,生成的图像画面质感逼真、光照自然、构图连贯,有效解决传统AI图像常见的畸形细节、光影错乱、边缘模糊等问题。


    在核心能力层面,LLaDA-Image实现两大关键突破。一是功能全统一,真正打通图像生成与编辑场景,支持从零生成全新图像、基于参考图精准修改、局部细节优化、整体风格重塑等多元需求,且编辑过程中可完美保留原图核心特征,兼顾灵活性与精准度。二是效率全方位升级,模型同步推出Turbo极速版本,依托双模态蒸馏技术,可实现2-4步极速推理,相比传统50步推理模型,速度提升数倍,同时保障输出画质不缩水,兼顾专业创作质量与轻量化落地效率。


    相较于行业同类开源模型,LLaDA-Image具备架构简洁、落地性强、全链路开放三大核心优势。模型摒弃冗余复杂的混合架构,全程基于扩散模型搭建统一框架,稳定性更强;完整开放模块边界、训练配方、推理逻辑,无技术黑箱、无商用壁垒,开发者可自由二次开发、定制优化,适配内容创作、电商设计、影视后期、教育绘图、工业视觉优化等多元场景。同时,依托蚂蚁自研的视觉语言对齐技术,模型指令理解精度大幅提升,可精准响应复杂自然语言编辑指令,降低普通用户的使用门槛。