BACK TO全部项目
EP.04 / 项目案例档案 / 01
Chatbot Arena Preference Prediction
针对人类偏好预测微调并集成开源大语言模型,在 1,849 支队伍中排名第 67。
从问题背景、工程方案与关键取舍出发,完整呈现实现过程和可量化结果。
私有仓库 · 可在沟通时提供更多信息
01 / 背景
在 LMSYS Chatbot Arena 竞赛中,预测人类评审更偏好两条聊天机器人回复中的哪一条。
02 / 方法
使用 4-bit QLoRA 微调 Gemma-2-9B 与 Llama-3.1-8B,在有限显存下将 LoRA 适配器插入注意力层。
03 / 工程优化
调节学习率、提示词长度和冻结层以稳定训练,并按长度排序测试样本,减少多 GPU 推理过程中的填充开销。
04 / 模型策略
通过加权集成融合多个互补模型的输出,提升泛化能力与偏好预测准确率。
05 / 结果
获得 Kaggle 银牌,在 1,849 支队伍中排名第 67,进入前 4%。