
法语命名实体识别模型,推理时间减半
DistilCamemBERT-NER针 对法语命名实体识别进行微调,与CamemBERT相比推理时间缩短一半但能耗保持不变。采用wikiner_fr数据集,综合F1得分达98.18%。在PER、LOC、ORG类别上,性能优于多语种与Flair法语模型,提供高效的文本处理解决方案。
DistilCamemBERT-NER 是一款专为法语命名实体识别(NER)任务而调优的模型。这款模型的基础是 DistilCamemBERT,它受 Jean-Baptiste/camembert-ner 的启发而创建,后者基于 CamemBERT 模型构建。CamemBERT 模型在大规模生产阶段可能会面临推理成本的问题,为了解决这一问题,开发者通过 DistilCamemBERT 将推理时间缩短了一半,但能耗不变。
本项目中使用的数据集为 wikiner_fr,其中包含约 17 万句带有以下五类标签的句子:
模型的整体表现优异,具体数据如下:
| 类别 | 精确度 (%) | 召回率 (%) | F1 值 (%) | 支持(#子词) |
|---|---|---|---|---|
| 整体 | 98.17 | 98.19 | 98.18 | 378,776 |
| 人物 (PER) | 96.78 | 96.87 | 96.82 | 23,754 |
| 地点 (LOC) | 94.05 | 93.59 | 93.82 | 27,196 |
| 组织 (ORG) | 86.05 | 85.92 | 85.98 | 6,526 |
| 杂项 (MISC) | 88.78 | 84.69 | 86.69 | 11,891 |
| 背景 (O) | 99.26 | 99.47 | 99.37 | 309,409 |
该模型的性能与 2 个参照模型进行比较,基于 f1 分数进行评估。所有测量在 AMD Ryzen 5 4500U @ 2.3GHz(6 核)上进行:
| 模型 | 时间 (ms) | 人物 (%) | 地点 (%) | 组织 (%) | 杂项 (%) | 背景 (%) |
|---|---|---|---|---|---|---|
| cmarkea/distilcamembert-base-ner | 43.44 | 96.82 | 93.82 | 85.98 | 86.69 | 99.37 |
| Davlan/bert-base-multilingual-cased-ner-hrl | 87.56 | 79.93 | 72.89 | 61.34 | n/a | 96.04 |
| flair/ner-french | 314.96 | 82.91 | 76.17 | 70.96 | 76.29 | 97.65 |
以下示例代码展示了如何在 Python 中使用:
from transformers import pipeline ner = pipeline( task='ner', model="cmarkea/distilcamembert-base-ner", tokenizer="cmarkea/distilcamembert-base-ner", aggregation_strategy="simple" ) result = ner( "Le Crédit Mutuel Arkéa est une banque Française, elle comprend le CMB " "qui est une banque située en Bretagne et le CMSO qui est une banque " "qui se situe principalement en Aquitaine. C'est sous la présidence de " "Louis Lichou, dans les années 1980 que différentes filiales sont créées " "au sein du CMB et forment les principales filiales du groupe qui " "existent encore aujourd'hui (Federal Finance, Suravenir, Financo, etc.)." ) result
下面的代码展示了如何使用优化后的 ONNX 模型:
from optimum.onnxruntime import ORTModelForTokenClassification from transformers import AutoTokenizer, pipeline HUB_MODEL = "cmarkea/distilcamembert-base-nli" tokenizer = AutoTokenizer.from_pretrained(HUB_MODEL) model = ORTModelForTokenClassification.from_pretrained(HUB_MODEL) onnx_qa = pipeline("token-classification", model=model, tokenizer=tokenizer) # 量化后的 onnx 模型 quantized_model = ORTModelForTokenClassification.from_pretrained( HUB_MODEL, file_name="model_quantized.onnx" )
DistilCamemBERT-NER 是一款高效而强大的模型,它在法语命名实体识别任务中提供了优秀的性能和快速的推理速度,非常适合需要处理大量数据和快速响应的应用场景。


免费创建高清无水印Sora视频
Vora是一个免费创建高清无水印Sora视频的AI工具


最适合小白的AI自动化工作流平台
无需编码,轻松生成可复用、可变现的AI自动化工作流

大模型驱动的Excel数据处理工具
基于大模型交互的表格处理系统,允许用户通过对话方式完成数据整理和可视化分析。系统采用机器学习算法解析用户指令,自动执行排序、公式计算和数据透视等操作,支持多种文件格式导入导出。数据处理响应速度保持在0.8秒以内,支持超过100万行数据的即时分析。


AI辅助编程,代码自动修复
Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。


AI论文写作指导平台
AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。


AI一键生成PPT,就用博思AIPPT!
博思AIPPT,新一代的AI生成PPT平台,支持智能生成PPT、AI美化PPT、文本&链接生成PPT、导入Word/PDF/Markdown文档生成PPT等,内置海量精美PPT模板,涵盖商务、教育、科技等不同风格,同时针对每个页面提供多种版式,一键自适应切换,完美适配各种办公场景。


AI赋能电商视觉革命,一站式智能商拍平台
潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。


企业专属的AI法律顾问
iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。


稳定高效的流量提升解决方案,助力品牌曝光
稳定高效的流量提升解决方案,助力品牌曝光


最新版Sora2模型免费使用,一键生成无水印视频
最新版Sora2模型免费使用,一键生成无水印视频