AI training-data filtering linked to stronger results after GRPO
A preprint reports higher pass@16 for TailSFT in most language-model tests and higher post-GRPO pass@1 in every matched comparison.
Developing Light ยท https://developinglight.com/editorial/developing-light