llm
training_error
ai_generated
true
Training loss diverging: NaN or increasing
ID: llm/fine-tuning-loss-divergence
75%Fix Rate
80%Confidence
3Evidence
2023-01-01First Seen
Version Compatibility
| Version | Status | Introduced | Deprecated | Notes |
|---|---|---|---|---|
| any | active | — | — | — |
Root Cause
Fine-tuning loss not converging or diverging.
genericWorkarounds
-
88% success Reduce learning rate by 10x and use warmup steps
-
90% success Check training data for quality issues: duplicates, noise, format errors
Dead Ends
Common approaches that don't work:
-
Increase learning rate to converge faster
85% fail
Worsens divergence
-
Train for more epochs without investigation
78% fail
Wastes compute, same divergence