TensorX
返回文献探索

Paper · arXiv 2607.25857

Shieldstral

Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan

24 upvotesJuly 28, 2026arXiv 预印本
AI 摘要

Shieldstral is a compact multimodal safety classifier that unifies diverse moderation tasks as binary questions to achieve high performance with far fewer parameters.

policy-adaptive multimodal safety classifierbinary question-answeringheterogeneous safety datasetspolicy adaptability

Abstract

We introduce Shieldstral, a 3B-parameter policy-adaptive multimodal safety classifier that matches or outperforms models nearly 7times its size on text safety benchmarks and sets a new state of the art on multimodal safety classification. Shieldstral formulates content moderation as a binary question-answering task. This simple formulation unifies diverse moderation tasks into a single yes/no problem, enabling heterogeneous safety datasets with divergent taxonomies to be consolidated under one training framework. We present the data construction recipe, covering curation and generation of approximately 54.1M samples and a fine-grained evaluation set to evaluate policy adaptability. Together, these enable a small adaptive model to match or outperform much larger models.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号