> EulerForge > 튜토리얼 > 22. Lab: 한국어 금융 Copilot

22. Lab: 한국어 금융 Copilot

난이도: 중급 | GPU: RTX 3090~5090 (VRAM 24GB+) | 소요 시간: 8~16시간

목표

Qwen3.5-4B를 한국어 금융 도메인에 특화시킵니다. 179K 한국어 금융 데이터(Won-Instruct, KorfinQA, Financial MMLU 등 5개 데이터셋 통합)로 Dense LoRA SFT를 수행합니다.

왜 Qwen3.5-4B인가?


사전 준비

데이터

19_data_collection.md섹션 3 (한국어 금융 데이터) 를 실행하여 다음을 준비합니다:

data/finance/finance_ko_sft_179k_raw.jsonl   # 훈련 (~179K rows)
data/finance/finance_ko_sft_1k_raw.jsonl     # 벤치 (1K rows)

데이터 구성

소스 규모 내용
Won-Instruct (KRX) ~100K 한국 금융 instruction 데이터
KorfinQA ~10K 한국 금융 QA
Financial MMLU KO ~2K 금융 지식 평가
FLARE ConvFinQA KO ~2K 대화형 금융 QA
QA_Instruction (6 configs) ~65K 수치 추론/추출/비교 등 다양한 금융 태스크

Config 설명

훈련 프리셋 (configs/presets/qwen3.5_4b_dense_lora_sft.yml)

backbone: qwen3
model_name: Qwen/Qwen3.5-4B

injection:
  strategy: dense_lora
  lora_r: 96               # 큰 r -> 금융 도메인 표현력 확보
  lora_alpha: 96
  lora_dropout: 0.05
  target_keywords: [gate_proj, up_proj, down_proj, o_proj]
  attn_lora:
    enabled: true
    keywords: [q_proj, k_proj, v_proj]

training:
  lr: 8.0e-5
  max_train_steps: 32000    # ~179K / (4*4) = ~2.8 epochs
  batch_size: 4
  grad_accum_steps: 4       # effective batch 16

벤치 프리셋 (configs/bench/finance_copilot.yml)

Judge 모델로 금융 응답 품질을 평가합니다. Baseline은 원본 Qwen3.5-4B (튜닝 전).


실행

��련

nohup eulerforge train \
    --preset configs/presets/qwen3.5_4b_dense_lora_sft.yml \
    --set model_name=Qwen/Qwen3.5-4B \
    --set data.format=raw \
    --set data.task=sft \
    --set data.path=data/finance/finance_ko_sft_179k_raw.jsonl \
    --set data.max_length=1024 \
    --set training.max_train_steps=60000 \
    --set training.batch_size=3 \
    --set training.grad_accum_steps=8 \
    --output-dir outputs/ko_finance_copilot_sft \
    > finance_qwen3.5_4b_dense_lora_sft.out &

훈련 모니터링:

tail -f finance_qwen3.5_4b_dense_lora_sft.out

벤치마크

훈련 완료 후:

nohup eulerforge bench \
    --preset configs/bench/finance_copilot.yml \
    > bench_finance_copilot.out &

벤치마크는 다음을 비교합니다: - Target: 금융 SFT 훈련된 모델 (outputs/ko_finance_copilot_sft/final) - Baseline: 원본 Qwen3.5-4B (튜닝 전) - Judge: Ollama judge 모델 (pointwise 1~10점)


결과 해석

기대 패턴

개선 포인트


관련 문서