Видеозаписи / NeVODA / BullshitBench: как AI-модели распознают ложные и абсурдные запросы

BullshitBench: как AI-модели распознают ложные и абсурдные запросы

Длительность: 11мин 11с Тип: Standup Плейлист: 1 из 18 в NeVODA
Обзор методики BullshitBench для оценки способности моделей искусственного интеллекта обнаруживать ложные и бессмысленные утверждения. В центре внимания — результаты ChatGPT, Gemini и Claude, а также проблема галлюцинаций и уверенных ответов на некорректные запросы