Keyboard shortcuts

Press ← or → to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

Trainer flags

typed-lm-trainer has two subcommands: train and quantize. Both accept --device. Values resolve with the precedence CLI flag > TOML key > default.

train

FlagDescriptionDefault
--model-idLocal base checkpoint (directory)Qwen/Qwen2.5-1.5B-Instruct
--datasetDataset file or directoryrequired
--output-directoryDestinationoutput/train
--methodlora, qlora, full or from-scratchlora
--seedDeterministic initialization seed (from-scratch)42
--configuration-fileOptional TOML; explicit CLI flags win—
--tokenizer-filetokenizer.json for from-scratch—
--lora-rank / --lora-alphaLoRA rank and alpha16 / 32
--lora-dropoutAdapter dropout0
--epochsEpochs3
--batch-sizeBatch per step4
--gradient-accumulation-stepsMicro-batches per step1
--learning-ratePeak LR (warmup + cosine)1e-4
--warmup-stepsWarmup steps10
--weight-decayAdamW weight decay0
--maximum-gradient-normGradient-norm clipping1
--max-sequence-lengthMaximum prompt length; longer items skipped1024
--minimum-improvementImprovement that resets patience0
--early-stop-patienceEpochs without improvement before stopping (0 disables)0
--quantizationnone, fp8 or fp4none
--quantization-modepost-training or trainingpost-training
--deviceauto, cpu or cudaauto

Geometry flags (full / from-scratch)

--architecture (llama, qwen2, qwen3, mistral, gemma, gemma2, gemma3), --vocab-size, --hidden-size, --intermediate-size, --num-hidden-layers, --num-attention-heads, --head-dim, --num-key-value-heads, --max-position-embeddings, --rope-theta, --rms-norm-eps, --tie-word-embeddings, --attention-bias, --sliding-window, --sliding-window-pattern, --rope-local-base-frequency, --query-pre-attention-scalar, --logit-softcapping, --attention-logit-softcapping.

quantize

FlagDescriptionDefault
--model-idDense checkpoint directoryrequired
--adapter-directoryOptional adapter to merge before quantizing—
--quantizationnone, fp8 or fp4fp8
--output-directoryDestinationoutput/quantized
--deviceauto, cpu or cudaauto

Examples

# Train a LoRA adapter.
typed-lm-trainer train \
  --model-id /path/to/local/checkpoint \
  --dataset resources/dataset.jsonl \
  --output-directory output/train \
  --method lora --epochs 3 --batch-size 4 --learning-rate 1e-4

# Quantize while merging the adapter.
typed-lm-trainer quantize \
  --model-id /path/to/local/checkpoint \
  --adapter-directory output/train \
  --quantization fp8 --output-directory output/quantized