Stella: 一个强大的中文文本编码模型

RayRay
stella模型中文文本编码长文本处理C-MTEB向量嵌入Github开源项目

stella

Stella模型简介

Stella是一个由SmartLi8开发的通用中文文本编码模型,旨在为各种自然语言处理任务提供高质量的文本表示。目前,Stella有两个版本可供选择:base和large。这两个版本的模型都支持1024的输入长度,这使得Stella在处理长文本时具有显著优势。

模型特点

  1. 长文本支持:Stella模型支持1024的输入长度,这是其最显著的特点之一。在当前大多数模型仅支持512长度的情况下,Stella的长文本处理能力为许多应用场景带来了新的可能性。

  2. 多版本选择:Stella提供base和large两个版本,用户可以根据自己的需求和资源选择合适的模型。

  3. 优秀的性能:在多个评测基准上,Stella展现出了优秀的性能,特别是在长文本处理方面。

  4. 通用性强:Stella经过精心设计和训练,可以适用于多种中文自然语言处理任务。

训练数据与方法

训练数据

Stella的训练数据主要包括以下几个部分:

  1. 开源数据:

    • wudao_base_200GB
    • m3e
    • simclue 特别注意的是,在选择这些开源数据时,开发团队着重挑选了长度大于512的文本,以增强模型的长文本处理能力。
  2. 构造数据: 开发团队在通用语料库上使用大型语言模型(LLM)构造了一批(question, paragraph)和(sentence, paragraph)数据。这种方法可以生成更加多样化和高质量的训练样本。

训练方法

Stella的训练过程采用了多种先进的技术和方法:

  1. 对比学习损失函数:这是一种常用的方法,可以帮助模型学习更好的文本表示。

  2. 带有难负例的对比学习损失函数:开发团队分别基于bm25和vector构造了难负例,这可以进一步提高模型的性能。

  3. EWC (Elastic Weights Consolidation):这是一种防止模型在学习新任务时遗忘旧任务的技术。

  4. cosent loss:这是一种专门为文本表示学习设计的损失函数。

  5. 多迭代器训练:每一种类型的数据使用一个迭代器,分别计算loss进行更新。这种方法可以更好地平衡不同类型数据的贡献。

初始权重

Stella-base-zh和Stella-large-zh分别以piccolo-base-zh和piccolo-large-zh作为基础模型。对于512-1024的position embedding,开发团队使用了层次分解位置编码进行初始化。这种方法可以有效地扩展模型的输入长度,同时保持良好的性能。

Stella模型架构

评测结果

C-MTEB评测

Stella模型在C-MTEB(Chinese Multi-Task Evaluation Benchmark)上表现出色。以下是Stella-large-zh和Stella-base-zh的评测结果:

Model NameModel Size (GB)DimensionSequence LengthAverage (35)
stella-large-zh0.651024102464.54
stella-base-zh0.2768102464.16

这些结果显示,Stella模型在各种任务上都表现出色,包括分类、聚类、对重排序、检索和语义相似度等。特别值得注意的是,Stella模型在支持1024序列长度的同时,仍然保持了较小的模型大小,这使得它在实际应用中具有很强的竞争力。

长文本评测

考虑到C-MTEB评测数据主要针对短文本,开发团队特别整理了6份长文本测试集,以更好地评估模型的长文本处理能力。这些测试集包括:

  • CMRC2018(通用百科)
  • CAIL(法律阅读理解)
  • DRCD(繁体百科,已转简体)
  • Military(军工问答)
  • Squad(英文阅读理解,已转中文)
  • Multifieldqa_zh(清华的大模型长文本理解能力评测数据)

在这些长文本测试集上,Stella模型同样表现出色。以下是部分评测结果:

Datasetstella-base-zhstella-large-zh
CMRC201896.0895.56
CAIL34.6237.18
DRCD86.1484.58

这些结果充分展示了Stella模型在处理长文本时的优秀性能。

长文本评测结果

使用方法

Stella模型的使用方法与piccolo模型完全一致,这使得用户可以轻松地将现有的piccolo代码迁移到Stella上。以下是几种常见的使用方式:

使用sentence-transformers库

from sentence_transformers import SentenceTransformer sentences = ["数据1", "数据2"] model = SentenceTransformer('infgrad/stella-base-zh') print(model.max_seq_length) embeddings_1 = model.encode(sentences, normalize_embeddings=True) embeddings_2 = model.encode(sentences, normalize_embeddings=True) similarity = embeddings_1 @ embeddings_2.T print(similarity)

使用transformers库

from transformers import AutoModel, AutoTokenizer from sklearn.preprocessing import normalize model = AutoModel.from_pretrained('infgrad/stella-base-zh') tokenizer = AutoTokenizer.from_pretrained('infgrad/stella-base-zh') sentences = ["数据1", "数据ABCDEFGH"] batch_data = tokenizer( batch_text_or_text_pairs=sentences, padding="longest", return_tensors="pt", max_length=1024, truncation=True, ) attention_mask = batch_data["attention_mask"] model_output = model(**batch_data) last_hidden = model_output.last_hidden_state.masked_fill(~attention_mask[..., None].bool(), 0.0) vectors = last_hidden.sum(dim=1) / attention_mask.sum(dim=1)[..., None] vectors = normalize(vectors, norm="l2", axis=1, ) print(vectors.shape) # 2,768

需要注意的是,在使用Stella模型时,instruction中的冒号应该使用英文冒号,例如"查询: "和"结果: "。

训练细节

为了帮助研究者更好地理解和复现Stella模型,以下是一些关键的训练细节:

  • 硬件:单卡A100-80GB
  • 环境:torch1.13.*; transformers-trainer + deepspeed + gradient-checkpointing
  • 学习率:1e-6
  • batch_size:base模型为1024,额外增加20%的难负例;large模型为768,额外增加20%的难负例
  • 数据量:约100万,其中用LLM构造的数据约有200K。LLM模型大小为13b

这些详细信息可以帮助其他研究者更好地理解Stella模型的训练过程,并可能在此基础上进行进一步的改进和创新。

未来展望

尽管Stella模型已经展现出了优秀的性能,但开发团队仍然认识到有一些需要改进的地方:

  1. 评测的稳定性:在评测过程中发现Clustering任务的结果会有小幅度的波动。虽然这种波动很小(±0.0x),不影响整体评测结论,但团队仍在努力找出原因并提高评测的稳定性。

  2. 更高质量的长文本训练和测试数据:目前的训练数据主要是用13b模型构造的,可能存在一些噪声。测试数据主要来自MRC(Machine Reading Comprehension)数据集,问题类型较为单一。团队计划收集和构造更加多样化、高质量的长文本数据。

  3. OOD(Out-of-Domain)性能:对于一些非常专业或特殊的领域,当前的向量编码模型(包括Stella、OpenAI和Cohere)的效果可能不如传统的BM25算法。提高模型在这些领域的表现是未来的一个重要研究方向。

未来研究方向

结论

Stella模型作为一个强大的中文文本编码工具,在多个评测基准上展现出了优秀的性能,特别是在长文本处理方面。它的出现为中文自然语言处理任务提供了新的可能性。无论是在学术研究还是工业应用中,Stella都有着广阔的应用前景。

开发团队欢迎社区的反馈和贡献,以进一步改进和完善Stella模型。对于有兴趣深入了解或使用Stella的研究者和开发者,可以访问Stella的GitHub仓库获取更多信息和资源。

随着自然语言处理技术的不断发展,我们期待看到Stella模型在更多领域发挥作用,为中文信息处理带来新的突破。

编辑推荐精选

Vora

Vora

免费创建高清无水印Sora视频

Vora是一个免费创建高清无水印Sora视频的AI工具

Refly.AI

Refly.AI

最适合小白的AI自动化工作流平台

无需编码,轻松生成可复用、可变现的AI自动化工作流

酷表ChatExcel

酷表ChatExcel

大模型驱动的Excel数据处理工具

基于大模型交互的表格处理系统,允许用户通过对话方式完成数据整理和可视化分析。系统采用机器学习算法解析用户指令,自动执行排序、公式计算和数据透视等操作,支持多种文件格式导入导出。数据处理响应速度保持在0.8秒以内,支持超过100万行数据的即时分析。

AI工具酷表ChatExcelAI智能客服AI营销产品使用教程
TRAE编程

TRAE编程

AI辅助编程,代码自动修复

Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。

AI工具TraeAI IDE协作生产力转型热门
AIWritePaper论文写作

AIWritePaper论文写作

AI论文写作指导平台

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

AI辅助写作AI工具AI论文工具论文写作智能生成大纲数据安全AI助手热门
博思AIPPT

博思AIPPT

AI一键生成PPT,就用博思AIPPT!

博思AIPPT,新一代的AI生成PPT平台,支持智能生成PPT、AI美化PPT、文本&链接生成PPT、导入Word/PDF/Markdown文档生成PPT等,内置海量精美PPT模板,涵盖商务、教育、科技等不同风格,同时针对每个页面提供多种版式,一键自适应切换,完美适配各种办公场景。

AI办公办公工具AI工具博思AIPPTAI生成PPT智能排版海量精品模板AI创作热门
潮际好麦

潮际好麦

AI赋能电商视觉革命,一站式智能商拍平台

潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。

iTerms

iTerms

企业专属的AI法律顾问

iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。

SimilarWeb流量提升

SimilarWeb流量提升

稳定高效的流量提升解决方案,助力品牌曝光

稳定高效的流量提升解决方案,助力品牌曝光

Sora2视频免费生成

Sora2视频免费生成

最新版Sora2模型免费使用,一键生成无水印视频

最新版Sora2模型免费使用,一键生成无水印视频

下拉加载更多