A preprint finds weak links between automated metrics and human ratings, while an LLM judge scores AI-generated and human-generated stories differently.