(资料图片仅供参考)
数据显示,生成式视觉的核心是从图像数据中学习分布规律,并在文本提示下生成全新内容。本轮技术演进从GAN转向Diffusion模型,后者通过加噪去噪过程实现更稳定生成,并为Transformer介入打开接口。从2013年至今,生成式视觉历经VAE与GAN奠基、GAN主导高真实感生成、扩散复兴、文生图爆发以及DiT驱动的多模态扩展五个阶段。
一份研报观点认为,Transformer正沿着序列生成、条件编码、骨干替换与多模态扩展四个环节逐步渗透生成式视觉领域。早期DALL·E将文本与图像token统一建模,随后CLIP、Imagen和Stable Diffusion强化了文本理解能力。2023年DiT以Transformer完全替代U-Net骨干,在潜空间图像patch上建模,验证了视觉生成具备与语言模型类似的规模化扩展潜力。研报指出,Transformer正成为视频生成和多模态系统的统一框架,推动内容创作从单图向时空连续与跨模态交互演进。
研报认为,数字AI底座模型发展路径已较为清晰,但难以完成对物理世界的建模闭环。而物理AI能直接作用于真实世界,成为当前AI发展中增量更大的方向。智能驾驶作为最先实现闭环的代表场景,相关技术迭代与商业化进程将带来确定性增长机会,值得重点关注。
营业执照公示信息