从零微调一个技术社区问答助手:LoRA 与 QLoRA 显存优化心得
全量微调参数量巨大的模型成本高昂,PEFT(参数高效微调)中的 LoRA 和 QLoRA 已经成为个人与中小团队的标配。
- QLoRA:将基座模型量化到 4-bit NormalFloat,配合分页优化器,单张 24G 显卡(如 RTX 4090)就能微调 70B 模型;
- 数据集质量 > 数量:精挑细选的 2000 条高质量问答对,效果远好于 5 万条低质量爬虫抓取数据。
微调的核心不是教模型新知识,而是教它对特定领域的回答语气与格式规范。