从零微调一个技术社区问答助手:LoRA 与 QLoRA 显存优化心得

全量微调参数量巨大的模型成本高昂,PEFT(参数高效微调)中的 LoRA 和 QLoRA 已经成为个人与中小团队的标配。

  • QLoRA:将基座模型量化到 4-bit NormalFloat,配合分页优化器,单张 24G 显卡(如 RTX 4090)就能微调 70B 模型;
  • 数据集质量 > 数量:精挑细选的 2000 条高质量问答对,效果远好于 5 万条低质量爬虫抓取数据。

微调的核心不是教模型新知识,而是教它对特定领域的回答语气与格式规范。

5 回复 283 浏览
编辑于 7 days ago

全部回复

5 条

还没有回复

成为第一个参与讨论的人。

登录后就能参与这个讨论。

环球论坛 Sweep The Globev0.1.0

基于现代化全栈架构构建的技术社区 · 开放、连接与分享

Nuxt 4Spring Boot 3PostgreSQLRedis