预训练语言模型(BERT、GPT、RoBERTa、LLaMA 等)核心范式:大规模无标注文本预训练 + 下游任务微调 / 提示学习,极大降低 NLP 任务对标注数据的依赖,覆盖理解类、生成类、行业落地等场景。
一、自然语言理解类(NLU)
侧重对文本语义的分析、判别、抽取
文本分类
场景:情感分析(好评 / 差评)、新闻主题分类、垃圾邮件识别、舆情风险判别、意图识别(聊天机器人用户意图)。
做法:取模型
[CLS]向量接分类头微调,或大模型直接 Prompt 输出类别。
命名实体识别 NER
场景:从文本抽取人名、地名、机构、时间、产品、病历症状、合同主体等实体;用于知识图谱构建、信息抽取。
关系抽取
场景:识别实体之间关系,例如 “张三 - 任职于 - 字节跳动”,构建知识三元组,用于知识库、智能问答。
问答系统(抽取式问答)
场景:机器阅读理解,给定文章 + 问题,从原文截取答案片段,代表任务 SQuAD;用于文档智能检索、客服知识库。
语义相似度计算
场景:句子匹配、重复文本检测、FAQ 问答匹配、检索召回(Sentence‑BERT)、论文查重、内容去重。
自然语言推理
判断两句话蕴含、矛盾、无关;用于智能审核、文本逻辑校验。
二、自然语言生成类(NLG)
侧重模型自主生成通顺文本,以自回归预训练模型 (GPT 系列) 为主
机器翻译
多语言预训练模型(mBERT、mT5)实现多语种互译;文档级翻译,相比传统统计翻译上下文理解更强。
文本摘要
抽取式摘要:从原文挑选关键句子;
生成式摘要:重写生成简短摘要,用于新闻、会议纪要、论文摘要、长报告浓缩。
对话系统
闲聊对话、智能客服、企业数字助手;多轮对话理解上下文,生成回复。
文案生成
广告文案、公众号写作、邮件、报告、剧本、代码注释生成。
改写与润色
文本扩写、缩写、语气改写、语法纠错、中文润色、书面语 / 口语互相转换。
三、检索与知识增强应用
RAG 检索增强生成
预训练大模型结合外部知识库,做文档问答、企业私有知识库问答;解决模型幻觉,让大模型读取本地 PDF、数据库文档作答。
语义检索
将 query、文档编码为向量,向量库做召回;替代传统关键词检索,实现语义搜索,广泛用于企业内部搜索引擎。
四、行业落地应用
1. 金融 NLP
研报摘要抽取、公告信息提取、舆情监控、风险事件识别、智能投顾问答、合同文本审核。
2. 法律 NLP
判决书要素抽取、法条检索、合同审查、案情摘要、法律咨询问答。
3. 医疗 NLP
电子病历结构化,症状、疾病、药品实体抽取;医学文献摘要、问诊辅助。
4. 教育 NLP
作文批改、题目解析、知识点问答、自动出题、主观题评分。
5. 工业与政企
工单文本理解、故障日志分析、政策文档解读、会议纪要生成。
五、低资源场景能力
预训练模型可以通过Prompt 提示学习、少样本 (Few‑shot)、零样本 (Zero‑shot),在标注数据很少甚至没有标注样本时直接做任务,不用大规模微调,大幅降低落地成本。
六、拓展跨模态应用
多模态预训练模型(如 LLaVA 等),文本结合图片,实现图文问答、图片描述生成,属于 NLP 向多模态延伸。