BullshitBench: як AI-моделі розпізнають хибні та абсурдні запити
Огляд методики BullshitBench для оцінювання здатності моделей штучного інтелекту виявляти хибні та беззмістовні твердження. У центрі уваги — результати ChatGPT, Gemini та Claude, а також проблема галюцинацій і впевнених відповідей на некоректні запити