易君召
发布于 2026-08-05 / 作者:易君召 / 0 阅读
0

预训练模型在自然语言处理 (NLP) 中的应用

#AI

预训练语言模型(BERT、GPT、RoBERTa、LLaMA 等)核心范式:大规模无标注文本预训练 + 下游任务微调 / 提示学习,极大降低 NLP 任务对标注数据的依赖,覆盖理解类、生成类、行业落地等场景。

一、自然语言理解类(NLU)

侧重对文本语义的分析、判别、抽取

  1. 文本分类

    • 场景:情感分析(好评 / 差评)、新闻主题分类、垃圾邮件识别、舆情风险判别、意图识别(聊天机器人用户意图)。

    • 做法:取模型[CLS]向量接分类头微调,或大模型直接 Prompt 输出类别。

  2. 命名实体识别 NER

    • 场景:从文本抽取人名、地名、机构、时间、产品、病历症状、合同主体等实体;用于知识图谱构建、信息抽取。

  3. 关系抽取

    • 场景:识别实体之间关系,例如 “张三 - 任职于 - 字节跳动”,构建知识三元组,用于知识库、智能问答。

  4. 问答系统(抽取式问答)

    • 场景:机器阅读理解,给定文章 + 问题,从原文截取答案片段,代表任务 SQuAD;用于文档智能检索、客服知识库。

  5. 语义相似度计算

    • 场景:句子匹配、重复文本检测、FAQ 问答匹配、检索召回(Sentence‑BERT)、论文查重、内容去重。

  6. 自然语言推理

    • 判断两句话蕴含、矛盾、无关;用于智能审核、文本逻辑校验。

二、自然语言生成类(NLG)

侧重模型自主生成通顺文本,以自回归预训练模型 (GPT 系列) 为主

  1. 机器翻译

    • 多语言预训练模型(mBERT、mT5)实现多语种互译;文档级翻译,相比传统统计翻译上下文理解更强。

  2. 文本摘要

    • 抽取式摘要:从原文挑选关键句子;

    • 生成式摘要:重写生成简短摘要,用于新闻、会议纪要、论文摘要、长报告浓缩。

  3. 对话系统

    • 闲聊对话、智能客服、企业数字助手;多轮对话理解上下文,生成回复。

  4. 文案生成

    • 广告文案、公众号写作、邮件、报告、剧本、代码注释生成。

  5. 改写与润色

    • 文本扩写、缩写、语气改写、语法纠错、中文润色、书面语 / 口语互相转换。

三、检索与知识增强应用

  1. RAG 检索增强生成

    预训练大模型结合外部知识库,做文档问答、企业私有知识库问答;解决模型幻觉,让大模型读取本地 PDF、数据库文档作答。

  2. 语义检索

    将 query、文档编码为向量,向量库做召回;替代传统关键词检索,实现语义搜索,广泛用于企业内部搜索引擎。

四、行业落地应用

1. 金融 NLP

  • 研报摘要抽取、公告信息提取、舆情监控、风险事件识别、智能投顾问答、合同文本审核。

2. 法律 NLP

  • 判决书要素抽取、法条检索、合同审查、案情摘要、法律咨询问答。

3. 医疗 NLP

  • 电子病历结构化,症状、疾病、药品实体抽取;医学文献摘要、问诊辅助。

4. 教育 NLP

  • 作文批改、题目解析、知识点问答、自动出题、主观题评分。

5. 工业与政企

  • 工单文本理解、故障日志分析、政策文档解读、会议纪要生成。

五、低资源场景能力

预训练模型可以通过Prompt 提示学习、少样本 (Few‑shot)、零样本 (Zero‑shot),在标注数据很少甚至没有标注样本时直接做任务,不用大规模微调,大幅降低落地成本。

六、拓展跨模态应用

多模态预训练模型(如 LLaVA 等),文本结合图片,实现图文问答、图片描述生成,属于 NLP 向多模态延伸。

简单区分两类预训练模型擅长方向

模型类型

代表模型

擅长任务

编码器 Encoder(双向)

BERT、RoBERTa

理解类:分类、NER、实体抽取、语义匹配

解码器 Decoder(自回归)

GPT、LLaMA

生成类:对话、摘要、写作

编码器‑解码器 Seq2Seq

T5、BART

翻译、生成式摘要、文本改写