Skip to content

AIGC 概览

AIGC 概览

AIGC(AI Generated Content)= 用 AI 生成多模态内容。文本之外的图像、视频、音频、3D 生成。

知识地图

图像生成

  • 扩散模型(Diffusion / DDPM / Stable Diffusion)
  • 文生图(SDXL / Midjourney / DALL-E 3 / Flux)
  • 图生图 / 图像编辑(Inpainting / ControlNet / IP-Adapter)
  • 图像理解(CLIP / BLIP / LLaVA)

视频生成

  • 文生视频(Sora / Veo / Kling / Runway Gen-3)
  • 图生视频(Stable Video Diffusion)
  • 视频编辑与延长

音频生成

  • 语音合成 TTS(ElevenLabs / Bark / CosyVoice)
  • 音乐生成(Suno / Udio / MusicGen)
  • 声音效果(AudioGen / Stable Audio)
  • 语音克隆与情感控制

3D 与多模态

  • 3D 生成(NeRF / Gaussian Splatting / TripoSR)
  • 多模态大模型(GPT-4V / Gemini / Qwen-VL)
  • 具身智能(Embodied AI)

工具与框架

  • ComfyUI / Stable Diffusion WebUI
  • AnimateDiff / SVD
  • Diffusers / Transformers
  • [[AI/向量检索/概览|向量检索]] 在多模态检索中的应用

待补内容

  • 扩散模型原理(正向 / 反向过程 / 噪声调度)
  • LoRA / ControlNet 微调实战
  • 视频生成的时序一致性
  • 音乐生成的结构控制
  • 商用版权与合规

参考资料