Тест упоминают в каждой статье про ИИ и почти всегда пересказывают неточно. Открыли оригинал статьи 1950 года и научную работу 2025 года и собрали, что именно проверяется, какой порог назвал сам Тьюринг и кто его взял.
Фраза «нейросеть прошла тест Тьюринга» гуляет по новостям лет десять, и каждый раз непонятно, что именно произошло и по каким правилам засчитали. Тест Тьюринга это игра в имитацию из статьи 1950 года: судья вслепую общается с человеком и машиной и пытается определить, кто есть кто, а порог успеха автор назвал прямо, семьдесят процентов правильных опознаний за пять минут разговора.
Дальше всё по первоисточникам, открытым 15 сентября 2026 года: оригинальный текст Тьюринга в PDF, научная работа 2025 года с цифрами по четырём системам, описание китайской комнаты Сёрла из философской энциклопедии и страница современного бенчмарка. По порядку: как устроена игра, какой порог задан, кто его взял, что тест не доказывает и почему для вас это не абстракция.
Главное в одну строку
Тест проверяет неотличимость в переписке, а не мышление, и в эксперименте 2025 года GPT-4.5 признавали человеком в 73 процентах случаев, чаще, чем настоящих людей.
Часть 1 · Ответ
Часть 2 · Первоисточник
Из оригинала статьи, PDF открыт 15.09.2026
Работа называется «Computing Machinery and Intelligence», опубликована в журнале Mind, страницы 433 по 460. Первая строка первого раздела: «Я предлагаю рассмотреть вопрос, могут ли машины мыслить». Дальше Тьюринг объясняет, почему не станет определять слова «машина» и «мыслить», и заменяет вопрос игрой, которую называет игрой в имитацию.
Деталь, которую почти всегда теряют в пересказах: в оригинале игра сначала описана без всяких машин. В ней участвуют мужчина, женщина и судья, и задача судьи угадать, кто из двоих кто. Машина появляется на следующем шаге, когда Тьюринг предлагает подставить её на место одного из игроков.
Часть 3 · Правила
Важная тонкость: в трёхстороннем варианте судья сравнивает двоих одновременно, и это заметно строже, чем разговор один на один. Именно трёхсторонний вариант считается стандартным.
Часть 4 · Порог
Прямая цитата из статьи, открыта 15.09.2026
Тьюринг пишет: он полагает, что примерно через пятьдесят лет станет возможно программировать компьютеры с объёмом памяти около десяти в девятой степени так, чтобы они играли в имитацию настолько хорошо, что у среднего судьи будет не более семидесяти процентов шансов на правильное опознание после пяти минут вопросов. Там же он добавляет, что сам вопрос «могут ли машины мыслить» считает слишком бессмысленным для обсуждения.
Отсюда два следствия, о которых обычно забывают. Первое: порог у Тьюринга не пятьдесят процентов, а тридцать процентов ошибок судьи. Второе: он ограничил время пятью минутами, и это принципиально, потому что на длинной дистанции машину ловят заметно чаще.
Часть 5 · Определитель
| Система | Доля | Что это значит |
|---|---|---|
| GPT-4.5 с ролью человека | 73 процента | чаще, чем настоящих людей |
| LLaMa-3.1-405B с той же ролью | 56 процентов | не отличается от людей статистически |
| ELIZA | 23 процента | значимо хуже случайного угадывания |
| GPT-4o без роли | 21 процент | инструкция решает больше, чем модель |
| Порог Тьюринга | 30 процентов ошибок | заявлен в статье 1950 года |
| Длительность разговора | 5 минут | совпадает с условием оригинала |
Часть 6 · Результат
Из научной работы, страница открыта 15.09.2026
Работа «Large Language Models Pass the Turing Test» авторов Кэмерона Джонса и Бенджамина Бергена подана 31 марта 2025 года под номером 2503.23674. В аннотации сказано: проверялись четыре системы в двух рандомизированных предзарегистрированных тестах на независимых выборках, участники вели пятиминутные разговоры одновременно с человеком и с системой. GPT-4.5 при инструкции изображать человека признавали человеком в 73 процентах случаев, значимо чаще, чем настоящих собеседников.
Ключевое условие спрятано в формулировке «при инструкции изображать человека». Та же модель без такой инструкции набрала кратно меньше. То есть тест проходит не модель сама по себе, а модель плюс правильно поставленная роль, и это ровно то, чем занимается промт-инжиниринг. Разбор в гайде про промты.
Часть 7 · Эффект
ELIZA это простая программа, которая переворачивает фразу собеседника в вопрос и не понимает ничего. Её включили как нижнюю границу: если бы судьи принимали за человека даже её, тест не имел бы смысла.
Часть 8 · Возражение
Из философской энциклопедии, статья открыта 15.09.2026
Аргумент китайской комнаты впервые опубликован в статье 1980 года американским философом Джоном Сёрлом. Он предлагает представить себя в комнате, где под дверь просовывают китайские иероглифы, а он по инструкции складывает ответные строки, не понимая ни слова. Снаружи выглядит так, будто в комнате сидит носитель языка. Вывод Сёрла: программа может выглядеть понимающей язык, не понимая его, и потому тест Тьюринга недостаточен.
Спор длится десятилетия и на практике сводится к простому: тест меряет поведение, а не внутреннее состояние. Если вам нужна оценка полезности модели, поведения достаточно. Если нужен ответ про мышление, тест на этот вопрос не отвечает и никогда не отвечал.
Часть 9 · Границы
Часть 10 · Замена
Со страницы бенчмарка, открыта 15.09.2026
На сайте ARC Prize сказано: в 2019 году Франсуа Шолле опубликовал работу «On the Measure of Intelligence», где представил набор задач ARC-AGI для измерения подвижного интеллекта. Идея противоположна тесту Тьюринга: не «убедить судью», а решить задачу, правило которой нужно вывести из пары примеров, и заучивание тут не помогает.
Часть 11 · Практика
История про тест перестала быть кабинетной ровно в тот момент, когда модель стала выдерживать пятиминутный разговор лучше человека.
Памятка
Коротко
Источники
Чего тут нет намеренно: историй про «первую машину, прошедшую тест» из новостных заголовков прошлых лет. Почти все они описывают разговоры один на один без контрольной группы, то есть не тот эксперимент, который описан у Тьюринга.
FAQ
Это проверка, сможет ли человек в переписке отличить машину от человека. Тьюринг предложил заменить неопределённый вопрос «может ли машина мыслить» на измеримый: пусть судья общается вслепую с двумя собеседниками и пробует угадать, кто из них человек.
В статье 1950 года он написал: примерно через пятьдесят лет станет возможно запрограммировать машину так, что у среднего судьи будет не больше семидесяти процентов шансов на правильное определение после пяти минут вопросов. То есть порог это тридцать процентов ошибок за пять минут.
В работе Джонса и Бергена, поданной 31 марта 2025 года, модель GPT-4.5 с инструкцией изображать человека признавали человеком в 73 процентах случаев, то есть чаще, чем настоящих людей. Авторы называют это первым эмпирическим свидетельством прохождения стандартного трёхстороннего теста.
Неотличимость поведения в переписке, а не наличие мышления. Тьюринг сознательно ушёл от спора о сознании и заменил его игрой, у которой есть правила и результат. Всё, что тест измеряет, это способность машины выдержать роль в диалоге.
Главный контраргумент это китайская комната Джона Сёрла из статьи 1980 года: человек в комнате безошибочно манипулирует иероглифами по инструкции и снаружи выглядит знающим китайский, не понимая ни слова. Отсюда вывод, что внешняя убедительность не равна пониманию.
Тест субъективен: его судит человек и результат зависит от судьи, темы и времени разговора. Современные бенчмарки измеряют решение задач с проверяемым ответом и дают число, которое можно сравнивать между моделями. Это разные инструменты под разные вопросы.
Наборы задач на обобщение, где заучивание не помогает. Самый известный это ARC-AGI, предложенный Франсуа Шолле в работе 2019 года про измерение интеллекта. Там модель должна вывести правило из пары примеров, а не вспомнить похожее из обучения.
Склонность людей приписывать программе понимание там, где его нет. Название от простой программы шестидесятых, которая переформулировала фразы собеседника в вопросы. В эксперименте 2025 года ELIZA принимали за человека в 23 процентах случаев, заметно реже случайного угадывания.
Нет. Тест фиксирует, что модель успешно изображает человека в коротком разговоре, и ничего не говорит про понимание, цели или сознание. Практический смысл результата другой: отличить собеседника по манере речи больше нельзя, и опираться на это в проверке личности опасно.
Затем, что распознавание на слух и на глаз перестало работать. Если машина выдерживает пятиминутный разговор лучше человека, то ни голос, ни стиль переписки не доказывают, что на том конце знакомый вам человек. Проверять нужно каналом связи, а не ощущением.
Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.
Посмотреть, что внутриtelegram
Канал с полезными материалами про нейросети
Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.