Модели рассуждений часто попадают в повторяющиеся состояния сбоя, известные как “петли обреченности”, при выполнении сложных задач. Исследователи представили Antidoom, целевой метод обучения, который оптимизирует вывод модели на конкретных токенах для обеспечения связности и устранения непродуктивных циклов.