AIGC 概览
AIGC 概览
AIGC(AI Generated Content)= 用 AI 生成多模态内容。文本之外的图像、视频、音频、3D 生成。
知识地图
图像生成
- 扩散模型(Diffusion / DDPM / Stable Diffusion)
- 文生图(SDXL / Midjourney / DALL-E 3 / Flux)
- 图生图 / 图像编辑(Inpainting / ControlNet / IP-Adapter)
- 图像理解(CLIP / BLIP / LLaVA)
视频生成
- 文生视频(Sora / Veo / Kling / Runway Gen-3)
- 图生视频(Stable Video Diffusion)
- 视频编辑与延长
音频生成
- 语音合成 TTS(ElevenLabs / Bark / CosyVoice)
- 音乐生成(Suno / Udio / MusicGen)
- 声音效果(AudioGen / Stable Audio)
- 语音克隆与情感控制
3D 与多模态
- 3D 生成(NeRF / Gaussian Splatting / TripoSR)
- 多模态大模型(GPT-4V / Gemini / Qwen-VL)
- 具身智能(Embodied AI)
工具与框架
- ComfyUI / Stable Diffusion WebUI
- AnimateDiff / SVD
- Diffusers / Transformers
- [[AI/向量检索/概览|向量检索]] 在多模态检索中的应用
待补内容
- 扩散模型原理(正向 / 反向过程 / 噪声调度)
- LoRA / ControlNet 微调实战
- 视频生成的时序一致性
- 音乐生成的结构控制
- 商用版权与合规