BACK TO全部项目

EP.04 / 项目案例档案 / 01

Chatbot Arena Preference Prediction

针对人类偏好预测微调并集成开源大语言模型,在 1,849 支队伍中排名第 67。

QLoRAGemma 2Llama 3.1Multi-GPU

从问题背景、工程方案与关键取舍出发,完整呈现实现过程和可量化结果。

私有仓库 · 可在沟通时提供更多信息

01 / 背景

在 LMSYS Chatbot Arena 竞赛中,预测人类评审更偏好两条聊天机器人回复中的哪一条。

02 / 方法

使用 4-bit QLoRA 微调 Gemma-2-9B 与 Llama-3.1-8B,在有限显存下将 LoRA 适配器插入注意力层。

03 / 工程优化

调节学习率、提示词长度和冻结层以稳定训练,并按长度排序测试样本,减少多 GPU 推理过程中的填充开销。

04 / 模型策略

通过加权集成融合多个互补模型的输出,提升泛化能力与偏好预测准确率。

05 / 结果

获得 Kaggle 银牌,在 1,849 支队伍中排名第 67,进入前 4%。

下一个项目Live-Stream Danmaku System全部项目