常见AI算法模型
原创2025年7月2日大约 3 分钟
常见AI算法模型
🔁 一、人机交互基本流程
- 用户输入采集(多模态):语音、图像、文本、视频、手势、眼动等
- 信号感知/识别:如语音转文字、图像识别、手势识别等
- 意图理解与状态管理:自然语言理解、上下文建模、知识推理
- 响应生成:语音合成、文本生成、表情动作驱动等
- 结果反馈与交互迭代
📥 二、输入层相关算法模型
1. 语音识别(ASR)
将语音信号转换为文本
- **CTC 模型:**DeepSpeech、Wav2Vec2、Conformer-CTC
- **Seq2Seq 模型:**Listen-Attend-Spell、RNN-T、Whisper
- **优化算法:**SpecAugment(数据增强)、音频预处理(VAD、MFCC)
2. 图像识别 / 视频理解
- **图像识别:**ResNet、EfficientNet、ViT
- **手势识别 / 动作识别:**OpenPose、I3D、SlowFast
- **面部识别 / 表情识别:**FaceNet、FER+, RetinaFace
3. 文本输入分析(自然语言理解)
- 分词:BERT分词器、SentencePiece
- 关键词提取:TF-IDF、TextRank、BERT Embedding 相似度
- 情感分析:LSTM、BERT+Classifier、ERNIE
🧠 三、意图识别与语言理解
1. 意图识别与槽位抽取
- **意图分类:**TextCNN、BiLSTM + Attention、BERT、ERNIE
- **槽位填充(序列标注):**BiLSTM-CRF、BERT-CRF、mT5-Tagger
- **多任务框架:**JointBERT、Co-MixNet(共享表示层)
2. 上下文建模与对话管理
- **简单拼接式建模:**GPT类直接拼接对话历史
- **记忆网络:**Memory Networks, Transformer-XL, DialoGPT
- **知识图谱 + NLP 结合:**用于意图补全、对话引导(如 ERNIE-Bot)
3. 问答系统(QA)
- **抽取式问答:**BERT + QA Head(如 SQuAD 模型)
- **生成式问答:**T5、BART、ChatGLM、GPT 系列
- **RAG:**检索增强生成,用于知识问答(Dense Passage Retrieval + LLM)
💬 四、响应生成与反馈层
1. 自然语言生成(文本)
- **通用生成:**GPT、ChatGPT、ChatGLM、Baichuan 等
- **特定风格生成:**控制生成长度、语气(Prompt Engineering / 控制代码)
- **对话策略规划:**强化学习(DQN + Reward Model)
2. 语音合成(TTS)
将文本转换为语音:
- **前端模型(音频频谱生成):**Tacotron2、FastSpeech2、VITS
- **后端声码器:**WaveNet、MelGAN、HiFi-GAN
- **定制合成:**Few-shot speaker adaptation、Voice Cloning
3. 视觉输出(虚拟人表情、动作)
- **驱动算法:**表情融合网、ARKit blendshape 驱动;
- **语音驱动表情:**Audio2Face、Audio2Emotion
- **3D 人脸重建 / 驱动:**DECA, EMOCA, FaceFormer
🧩 五、多模态融合模型
在 AI 交互中常涉及语音+文本+图像的联合建模:
| 模态 | 典型模型 | 描述 |
|---|---|---|
| 文本 + 图像 | CLIP、VisualBERT、ViLT | 文图联合对齐与推理 |
| 文本 + 语音 | SpeechBERT、SpeechT5 | 声音与语义统一建模 |
| 全模态 | Flamingo、GPT-4V、MM-ReAct | 统一输入/输出任意模态的通用模型 |
📦 六、工程化模块化构建参考
| 模块 | 算法技术 | 工程建议 |
|---|---|---|
| 语音识别模块 | Whisper, Wav2Vec2 | 支持多语言、嵌入式部署可裁剪模型 |
| 意图识别模块 | BERT, FastText | 提前定义意图意图集 + rule fallback |
| 多轮对话 | DialoGPT, GPT+RAG | 加入上下文窗口管理模块 |
| 生成层 | GPT类 + 控制模板 | 输出控制 + Prompt 编排工具 |
| TTS | FastSpeech2 + HiFi-GAN | 支持情感+个性建模,多说话人合成 |