Text Generation
Transformers
Safetensors
lfm2
liquid
lfm2.5
edge
conversational

LFM2.5-350M-PT-zh_CN

基于 LiquidAI/LFM2.5-230M 进行 Pre-Training 的模型。
数据集 0xDing/wikipedia-cn-20230720-filtered

协议冲突

LFM 1.0 规定年收入小于1000万美元的公司的免费商用,收入大于1000万美元需要向LiquidAI购买商业许可证,而 CC BY-SA 3.0 规定可以商用,因此存在冲突。
该模型优先使用 CC BY-SA 3.0,但并不代表收入大于1000万美元不需要向LiquidAI购买商业许可证。

便秘数据

平台:LLaMA Factory
GPU:NVIDIA Tesla P100 SXM2

便秘参数

微调方法 LoRA
量化等级 4
量化方法 bnb
对话模板 lfm2
训练阶段 Pre-Training
学习率 4.5e-4
训练轮数 1.0
计算类型 pure_bf16
截断长度 1968
批处理大小 7
梯度累积 147
验证集比例 0.05
序列打包 True
额外参数 {"optim": "paged_adamw_8bit"}
LoRA秩 16
LoRA缩放系数 32

便秘结果

输入Token 158,319,896
计算量 144,139,704GF
训练损失 3.7876
训练耗时 12:35:07.48
每秒训练样本数 1.776
每秒训练步数 0.002
验证损失 3.6571
验证困惑度 38.7494
验证耗时 0:16:13.08
每秒验证样本数 4.409
每秒验证步数 0.63

training_loss

Downloads last month
21
Safetensors
Model size
0.2B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Q1ngMang/LFM2.5-230M-PT-zh_CN

Finetuned
(29)
this model

Dataset used to train Q1ngMang/LFM2.5-230M-PT-zh_CN