Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales
Abstract page for arXiv paper 2608.26125: Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales
arXiv.org