Qwen 3.5 파인튜닝 실전 가이드 — LoRA로 나만의 모델 만들기
Qwen 3.5를 LoRA/QLoRA로 파인튜닝하는 전 과정을 다룹니다. 8GB GPU에서도 가능한 QLoRA 설정부터 Unsloth 최적화, GGUF 변환, Ollama 배포까지.

Qwen 3.5 파인튜닝 실전 가이드 — LoRA로 나만의 모델 만들기
이전 글에서 Qwen 3.5를 로컬에 설치하고 실행하는 방법을 다뤘습니다. 이번에는 한 단계 더 나아가서, 자신만의 데이터로 모델을 파인튜닝하는 방법을 다룹니다.
LoRA/QLoRA를 사용하면 소비자 GPU에서도 Qwen 3.5를 파인튜닝할 수 있습니다. 데이터 준비부터 학습, 평가, 배포까지 전 과정을 단계별로 정리했습니다.
1. 파인튜닝이 필요한 이유
Qwen 3.5는 범용 모델입니다. 대부분의 작업에서 잘 동작하지만, 다음과 같은 경우에는 파인튜닝이 필요합니다:
관련 포스트

TurboQuant vLLM, A100 한 장에서 실측 — 8B 모델에서 프리셋 4개의 용량·속도·정확도
vLLM 0.28, Qwen3-8B bf16, A100 80GB: bf16·fp8·TurboQuant 프리셋 4개의 KV 용량, 배치 처리량, 32K 디코드, needle-in-haystack, GSM8K를 직접 쟀습니다. vLLM 연구가 다루지 않은 8B 크기입니다.

TurboQuant를 실제 KV 텐서 위에서 밑바닥부터 — 3비트의 진짜 비용, 그리고 포크가 논문 레이아웃을 이기는 이유
PolarQuant를 PyTorch 60줄로 구현해 Llama-3.2-1B·Qwen3-8B의 실제 KV에 적용. 3비트는 +10%, k8v4는 +0.2%, QJL은 저비트에서만 유효, 블록-32 레이아웃이 포크 우위의 절반을 설명합니다.

TurboQuant llama.cpp CUDA 포크, A100에서 실측 — turbo4는 q4_0급, turbo3는 긴 컨텍스트에서 무너진다
Qwen3-8B Q4_K_M, A100 한 장, KV 타입 6종: perplexity·프리필·깊이별 디코드·VRAM 실측. turbo4는 q4_0과 품질 동급에 깊은 컨텍스트에선 q8_0보다 2.5배 빠르고, turbo3는 32K에서 PPL이 세 배로 뜁니다.