Multiverse Computing propone entrenar rechazos de IA por subtemas, no por temas completos
Multiverse Computing publicó un paper y post técnico sobre 'boundary-aware self-distillation', un método para entrenar modelos a rechazar solo el subconjunto…
Por qué importaMuestra que optimizar solo la tasa de rechazo de contenido dañino puede producir modelos inútiles por exceso de negativas en casos legítimos…
Impacto bajo
Fiabilidad fuente primaria
Hugging Face
