一、项目介绍

LLaMA-Factory是一个由北京航空航天大学的郑耀威开发的开源框架,作为一个功能强大且高效的大模型微调框架,通过其用户友好的界面和丰富的功能特性,为开发者提供了极大的便利。
二、环境准备
1、环境准备
- Python 3.10.9
- NVIDIA GeForce GTX 1650
- CUDA和cuDNN
2、安装LLaMa-Factory
git clone --depth 1 https://github.com/hiyouga/LLaMA-Factory.git
进入项目目录,安装必要的Python依赖库。可以使用以下命令:
cd LLaMA-Factorypip install -e ".[torch,metrics]"
3、准备模型数据集
3.1 模型准备
这里我们使用 Qwen2-0.5B 模型进行微调,首先下载模型,这里如果无法从Hugging Face上拉取的话,可以从国内模型库魔塔社区拉去,没有速度限制。
#模型下载from modelscope import snapshot_downloadmodel_dir = snapshot_download('qwen/Qwen2-0.5B',cache_dir="model/Qwen")
#截止2025.7.14,github拉取的最新版本的requirements.txt# core depstransformers>=4.49.0,<=4.52.4,!=4.52.0; sys_platform != 'darwin'transformers>=4.49.0,<=4.51.3,!=4.52.0; sys_platform == 'darwin'datasets>=2.16.0,<=3.6.0accelerate>=1.3.0,<=1.7.0peft>=0.14.0,<=0.15.2trl>=0.8.6,<=0.9.6tokenizers>=0.19.0,<=0.21.1# guigradio>=4.38.0,<=5.31.0matplotlib>=3.7.0tyro<0.9.0# opseinopsnumpy<2.0.0pandas>=2.0.0scipy# model and tokenizersentencepiecetiktokenmodelscope>=1.14.0hf-transfer# pythonfireomegaconfpackagingprotobufpyyamlpydantic<=2.10.6# apiuvicornfastapisse-starlette# mediaavlibrosa
3.2 数据集准备
LLaMA-Factory 内置了一些数据集,本次就使用内置的 identity 数据集,用于修改模型的自我意识,数据集格式:
#文件地址 LLaMA-Factory-main\data\identity.json{ "instruction": "Who are you?", "input": "", "output": "I am {{name}} an AI assistant developed by {{author}}. How can I assist you today?" }, { "instruction": "What is your name?", "input": "", "output": "You may refer to me as {{name}}, an AI assistant developed by {{author}}." }, { "instruction": "Do you have a name?", "input": "", "output": "As an AI assistant developed by {{author}}, I got the name {{name}}." },
对于这个数据集进行大量训练后,会修改模型的自我意识,比如修改前:我的名字是通义千问;修改后:我的名字是{{name}}。
三、微调
1、启动webui
启动webui:llamafactory-cli webui,出现如下提示和页面表示启动成功:
(torch3) D:\AIProject\LLaMA-Factory-main>llamafactory-cli webuiRunning on local URL: http://0.0.0.0:7860To create a public link, set `share=True` in `launch()`.

2、选择参数
主要选择:模型、训练数据集、训练参数(此处不多介绍,按照下图选择)

3、训练
点击训练,等待即可,训练结束后会出现训练完毕字样,并且会显示出Loss曲线。
模型训练过程

四、测试
在模型训练完成后,可以通过Evaluate & Predict(通过评估数据集评估性能)、Chat(直接与模型对话)。此处选择后者,更直观的展示模型训练效果。
模型依旧选择基座模型,检查点选择训练完模型保存的地址,点击加载模型,即可开始与模型对话。

五、总结
本文章记录了LLaMA-Factory在本地的部署以及使用,从最后的测试效果发现训练的效果其实并不理想,不过初有成效,初步判断和数据集规模,训练轮数以及参数配置等有关,后期将针对这些方面进行相应的调整,争取达到目标效果。
最后
为什么要学AI大模型
当下,⼈⼯智能市场迎来了爆发期,并逐渐进⼊以⼈⼯通⽤智能(AGI)为主导的新时代。企业纷纷官宣“ AI+ ”战略,为新兴技术⼈才创造丰富的就业机会,⼈才缺⼝将达 400 万!
DeepSeek问世以来,生成式AI和大模型技术爆发式增长,让很多岗位重新成了炙手可热的新星,岗位薪资远超很多后端岗位,在程序员中稳居前列。

与此同时AI与各行各业深度融合,飞速发展,成为炙手可热的新风口,企业非常需要了解AI、懂AI、会用AI的员工,纷纷开出高薪招聘AI大模型相关岗位。

最近很多程序员朋友都已经学习或者准备学习 AI 大模型,后台也经常会有小伙伴咨询学习路线和学习资料,我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频 全系列的学习资料,这些学习资料不仅深入浅出,而且非常实用,让大家系统而高效地掌握AI大模型的各个知识点。
这份完整版的大模型 AI 学习资料已经上传优快云,朋友们如果需要可以微信扫描下方优快云官方认证二维码免费领取【保证100%免费】
AI大模型系统学习路线
在面对AI大模型开发领域的复杂与深入,精准学习显得尤为重要。一份系统的技术路线图,不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点,还能提供一条高效、有序的学习路径。

但知道是一回事,做又是另一回事,初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性,在这基础上,找到高质量的学习资源,不浪费时间、不走弯路,又是重中之重。
AI大模型入门到实战的视频教程+项目包
看视频学习是一种高效、直观、灵活且富有吸引力的学习方式,可以更直观地展示过程,能有效提升学习兴趣和理解力,是现在获取知识的重要途径

光学理论是没用的,要学会跟着一起敲,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战案例来学习。

海量AI大模型必读的经典书籍(PDF)
阅读AI大模型经典书籍可以帮助读者提高技术水平,开拓视野,掌握核心技术,提高解决问题的能力,同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说,阅读经典书籍是非常有必要的。

600+AI大模型报告(实时更新)
这套包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示。

AI大模型面试真题+答案解析
我们学习AI大模型必然是想找到高薪的工作,下面这些面试题都是总结当前最新、最热、最高频的面试题,并且每道题都有详细的答案,面试前刷完这套面试题资料,小小offer,不在话下


这份完整版的大模型 AI 学习资料已经上传优快云,朋友们如果需要可以微信扫描下方优快云官方认证二维码免费领取【保证100%免费】
1640

被折叠的 条评论
为什么被折叠?



