Термины · Тест Тьюринга

Тест Тьюринга: 7 ответов и кто прошёл его в 2025

Тест упоминают в каждой статье про ИИ и почти всегда пересказывают неточно. Открыли оригинал статьи 1950 года и научную работу 2025 года и собрали, что именно проверяется, какой порог назвал сам Тьюринг и кто его взял.

Кирилл СандаковКирилл СандаковВайбкодер, предприниматель, продюсерОпубликовано 15.09.202611 мин чтения

Фраза «нейросеть прошла тест Тьюринга» гуляет по новостям лет десять, и каждый раз непонятно, что именно произошло и по каким правилам засчитали. Тест Тьюринга это игра в имитацию из статьи 1950 года: судья вслепую общается с человеком и машиной и пытается определить, кто есть кто, а порог успеха автор назвал прямо, семьдесят процентов правильных опознаний за пять минут разговора.

Дальше всё по первоисточникам, открытым 15 сентября 2026 года: оригинальный текст Тьюринга в PDF, научная работа 2025 года с цифрами по четырём системам, описание китайской комнаты Сёрла из философской энциклопедии и страница современного бенчмарка. По порядку: как устроена игра, какой порог задан, кто его взял, что тест не доказывает и почему для вас это не абстракция.

Главное в одну строку

Тест проверяет неотличимость в переписке, а не мышление, и в эксперименте 2025 года GPT-4.5 признавали человеком в 73 процентах случаев, чаще, чем настоящих людей.


Часть 1 · Ответ

Что такое тест Тьюринга, если коротко

  1. Кто придумал. Алан Тьюринг, статья в журнале Mind, 1950 год.
  2. Зачем. Чтобы заменить неразрешимый вопрос «может ли машина мыслить» на измеримый.
  3. Как устроен. Судья переписывается с двумя собеседниками вслепую и угадывает, кто из них человек.
  4. Где порог. Не более семидесяти процентов правильных опознаний за пять минут.
  5. Что он не меряет. Понимание, сознание и наличие целей.

Часть 2 · Первоисточник

Что на самом деле написано в статье 1950 года

Из оригинала статьи, PDF открыт 15.09.2026

Работа называется «Computing Machinery and Intelligence», опубликована в журнале Mind, страницы 433 по 460. Первая строка первого раздела: «Я предлагаю рассмотреть вопрос, могут ли машины мыслить». Дальше Тьюринг объясняет, почему не станет определять слова «машина» и «мыслить», и заменяет вопрос игрой, которую называет игрой в имитацию.

Деталь, которую почти всегда теряют в пересказах: в оригинале игра сначала описана без всяких машин. В ней участвуют мужчина, женщина и судья, и задача судьи угадать, кто из двоих кто. Машина появляется на следующем шаге, когда Тьюринг предлагает подставить её на место одного из игроков.


Часть 3 · Правила

Как устроена игра в имитацию

  1. Трое участников. Двое отвечают, один задаёт вопросы и не видит собеседников.
  2. Только текст. Тьюринг отдельно оговаривает: ответы печатаются, чтобы интонация не подсказывала судье.
  3. Один из отвечающих притворяется. Его цель заставить судью ошибиться.
  4. Второй помогает судье. Его цель наоборот, чтобы опознали правильно.
  5. Итог считается по доле ошибок судьи. Не по впечатлению, а по проценту правильных опознаний.

Важная тонкость: в трёхстороннем варианте судья сравнивает двоих одновременно, и это заметно строже, чем разговор один на один. Именно трёхсторонний вариант считается стандартным.


Часть 4 · Порог

Какой результат Тьюринг считал успехом

Прямая цитата из статьи, открыта 15.09.2026

Тьюринг пишет: он полагает, что примерно через пятьдесят лет станет возможно программировать компьютеры с объёмом памяти около десяти в девятой степени так, чтобы они играли в имитацию настолько хорошо, что у среднего судьи будет не более семидесяти процентов шансов на правильное опознание после пяти минут вопросов. Там же он добавляет, что сам вопрос «могут ли машины мыслить» считает слишком бессмысленным для обсуждения.

Отсюда два следствия, о которых обычно забывают. Первое: порог у Тьюринга не пятьдесят процентов, а тридцать процентов ошибок судьи. Второе: он ограничил время пятью минутами, и это принципиально, потому что на длинной дистанции машину ловят заметно чаще.


Часть 5 · Определитель

Кого и как часто принимали за человека

Результаты эксперимента 2025 года, доля признаний собеседника человеком
СистемаДоляЧто это значит
GPT-4.5 с ролью человека73 процентачаще, чем настоящих людей
LLaMa-3.1-405B с той же ролью56 процентовне отличается от людей статистически
ELIZA23 процентазначимо хуже случайного угадывания
GPT-4o без роли21 процентинструкция решает больше, чем модель
Порог Тьюринга30 процентов ошибокзаявлен в статье 1950 года
Длительность разговора5 минутсовпадает с условием оригинала

Часть 6 · Результат

Кто и при каких условиях прошёл тест

Из научной работы, страница открыта 15.09.2026

Работа «Large Language Models Pass the Turing Test» авторов Кэмерона Джонса и Бенджамина Бергена подана 31 марта 2025 года под номером 2503.23674. В аннотации сказано: проверялись четыре системы в двух рандомизированных предзарегистрированных тестах на независимых выборках, участники вели пятиминутные разговоры одновременно с человеком и с системой. GPT-4.5 при инструкции изображать человека признавали человеком в 73 процентах случаев, значимо чаще, чем настоящих собеседников.

Ключевое условие спрятано в формулировке «при инструкции изображать человека». Та же модель без такой инструкции набрала кратно меньше. То есть тест проходит не модель сама по себе, а модель плюс правильно поставленная роль, и это ровно то, чем занимается промт-инжиниринг. Разбор в гайде про промты.


Часть 7 · Эффект

Почему в эксперименте участвовала программа шестидесятых

ELIZA это простая программа, которая переворачивает фразу собеседника в вопрос и не понимает ничего. Её включили как нижнюю границу: если бы судьи принимали за человека даже её, тест не имел бы смысла.

  • Что показал результат. ELIZA признавали человеком в 23 процентах случаев, то есть реже, чем при случайном выборе.
  • Почему это важно. Значит судьи действительно различали, а не бросали монетку, и цифра 73 процента у современной модели не артефакт эксперимента.
  • Что такое эффект ELIZA. Склонность человека приписывать программе понимание, услышав уместный ответ. Работает и сегодня, особенно когда модель отвечает вежливо и по делу.
  • Как это выглядит в быту. Ощущение, что нейросеть вас понимает, возникает раньше, чем вы успеваете проверить хоть один факт из её ответа.

Часть 8 · Возражение

Китайская комната и почему она до сих пор в силе

Из философской энциклопедии, статья открыта 15.09.2026

Аргумент китайской комнаты впервые опубликован в статье 1980 года американским философом Джоном Сёрлом. Он предлагает представить себя в комнате, где под дверь просовывают китайские иероглифы, а он по инструкции складывает ответные строки, не понимая ни слова. Снаружи выглядит так, будто в комнате сидит носитель языка. Вывод Сёрла: программа может выглядеть понимающей язык, не понимая его, и потому тест Тьюринга недостаточен.

Спор длится десятилетия и на практике сводится к простому: тест меряет поведение, а не внутреннее состояние. Если вам нужна оценка полезности модели, поведения достаточно. Если нужен ответ про мышление, тест на этот вопрос не отвечает и никогда не отвечал.


Часть 9 · Границы

Что прохождение теста не доказывает

  • Не доказывает понимание. Убедительный ответ и понятый вопрос это разные вещи.
  • Не доказывает интеллект вообще. Игра проверяет только разговор, а не решение новых задач.
  • Не отменяет ошибок. Модель, которую приняли за человека, всё так же выдумывает числа и ссылки, разбор в гайде про галлюцинации.
  • Не говорит про цели. У системы нет желаний, и убедительность в диалоге ничего к ним не добавляет.
  • Не равно сильному ИИ. Что такое общий искусственный интеллект и чем он отличается, разобрано в гайде про AGI.

Часть 10 · Замена

Чем измеряют способности моделей сегодня

Со страницы бенчмарка, открыта 15.09.2026

На сайте ARC Prize сказано: в 2019 году Франсуа Шолле опубликовал работу «On the Measure of Intelligence», где представил набор задач ARC-AGI для измерения подвижного интеллекта. Идея противоположна тесту Тьюринга: не «убедить судью», а решить задачу, правило которой нужно вывести из пары примеров, и заучивание тут не помогает.

  • Задачи с проверяемым ответом. Результат это число, а не впечатление судьи.
  • Защита от заучивания. Закрытые наборы задач, которых не было в обучении.
  • Сравнимость. Модели можно поставить рядом и увидеть разницу, чего тест Тьюринга не даёт.
  • Чего не хватает и там. Ни один бенчмарк не измеряет полезность в вашей конкретной работе, это проверяется только на своих задачах.

Часть 11 · Практика

Что из этого следует лично для вас

История про тест перестала быть кабинетной ровно в тот момент, когда модель стала выдерживать пятиминутный разговор лучше человека.

  • Стиль речи больше не доказывает личность. Ни в переписке, ни по телефону.
  • Проверять нужно канал, а не собеседника. Перезвонить самому надёжнее, чем прислушиваться к интонации.
  • Ощущение понимания обманчиво. Это старый эффект ELIZA, просто теперь на совсем другом уровне.
  • Голос и лицо тоже подделывают. Признаки и защита разобраны в гайде про дипфейки.

Памятка

Что стоит запомнить про тест Тьюринга

Коротко

  • Тест предложен в статье 1950 года в журнале Mind.
  • Настоящее название это игра в имитацию.
  • Судья общается вслепую и только текстом.
  • Порог Тьюринга это 70 процентов правильных опознаний за пять минут.
  • В работе 2025 года GPT-4.5 принимали за человека в 73 процентах случаев.
  • Решала не только модель, но и инструкция изображать человека.
  • ELIZA набрала 23 процента, то есть судьи действительно различали.
  • Китайская комната Сёрла 1980 года остаётся главным возражением.
  • Тест меряет поведение, а не понимание.
  • Современная замена это задачи на обобщение вроде ARC-AGI.

Источники

Что проверялось живьём и когда

  • А. М. Тьюринг, «Computing Machinery and Intelligence», Mind, страницы 433 по 460, PDF открыт 15.09.2026: описание игры в имитацию, требование печатать ответы, предсказание про пятьдесят лет, объём памяти десять в девятой степени, не более семидесяти процентов правильных опознаний за пять минут.
  • К. Джонс, Б. Берген, «Large Language Models Pass the Turing Test», arXiv 2503.23674, подана 31.03.2025, страница открыта 15.09.2026: четыре системы, пятиминутные разговоры, доли 73, 56, 23 и 21 процент.
  • Стэнфордская философская энциклопедия, статья про китайскую комнату, открыта 15.09.2026: аргумент опубликован в 1980 году Джоном Сёрлом, вывод о недостаточности теста Тьюринга.
  • ARC Prize, страница про ARC-AGI, открыта 15.09.2026: работа Франсуа Шолле 2019 года «On the Measure of Intelligence» и набор задач на подвижный интеллект.
  • Wordstat, Россия, 15.09.2026: частотность запросов про тест Тьюринга и его прохождение.

Чего тут нет намеренно: историй про «первую машину, прошедшую тест» из новостных заголовков прошлых лет. Почти все они описывают разговоры один на один без контрольной группы, то есть не тот эксперимент, который описан у Тьюринга.


FAQ

Частые вопросы

Что такое тест Тьюринга простыми словами

Это проверка, сможет ли человек в переписке отличить машину от человека. Тьюринг предложил заменить неопределённый вопрос «может ли машина мыслить» на измеримый: пусть судья общается вслепую с двумя собеседниками и пробует угадать, кто из них человек.

Какой порог назвал сам Тьюринг

В статье 1950 года он написал: примерно через пятьдесят лет станет возможно запрограммировать машину так, что у среднего судьи будет не больше семидесяти процентов шансов на правильное определение после пяти минут вопросов. То есть порог это тридцать процентов ошибок за пять минут.

Кто прошёл тест Тьюринга

В работе Джонса и Бергена, поданной 31 марта 2025 года, модель GPT-4.5 с инструкцией изображать человека признавали человеком в 73 процентах случаев, то есть чаще, чем настоящих людей. Авторы называют это первым эмпирическим свидетельством прохождения стандартного трёхстороннего теста.

Что именно проверяет этот тест

Неотличимость поведения в переписке, а не наличие мышления. Тьюринг сознательно ушёл от спора о сознании и заменил его игрой, у которой есть правила и результат. Всё, что тест измеряет, это способность машины выдержать роль в диалоге.

Почему тест Тьюринга критикуют

Главный контраргумент это китайская комната Джона Сёрла из статьи 1980 года: человек в комнате безошибочно манипулирует иероглифами по инструкции и снаружи выглядит знающим китайский, не понимая ни слова. Отсюда вывод, что внешняя убедительность не равна пониманию.

Чем тест Тьюринга отличается от бенчмарков

Тест субъективен: его судит человек и результат зависит от судьи, темы и времени разговора. Современные бенчмарки измеряют решение задач с проверяемым ответом и дают число, которое можно сравнивать между моделями. Это разные инструменты под разные вопросы.

Что пришло на смену тесту Тьюринга

Наборы задач на обобщение, где заучивание не помогает. Самый известный это ARC-AGI, предложенный Франсуа Шолле в работе 2019 года про измерение интеллекта. Там модель должна вывести правило из пары примеров, а не вспомнить похожее из обучения.

Что такое эффект ELIZA

Склонность людей приписывать программе понимание там, где его нет. Название от простой программы шестидесятых, которая переформулировала фразы собеседника в вопросы. В эксперименте 2025 года ELIZA принимали за человека в 23 процентах случаев, заметно реже случайного угадывания.

Значит ли прохождение теста, что ИИ разумен

Нет. Тест фиксирует, что модель успешно изображает человека в коротком разговоре, и ничего не говорит про понимание, цели или сознание. Практический смысл результата другой: отличить собеседника по манере речи больше нельзя, и опираться на это в проверке личности опасно.

Зачем это знать обычному пользователю

Затем, что распознавание на слух и на глаз перестало работать. Если машина выдерживает пятиминутный разговор лучше человека, то ни голос, ни стиль переписки не доказывают, что на том конце знакомый вам человек. Проверять нужно каналом связи, а не ощущением.


Читать дальше

ИИ-офис
Собери свой ИИ-офис и перестань делать руками то, что делает нейросеть

Платформа и сообщество, где я по шагам показываю, как поставить ИИ на рутину: контент, код, продажи, аналитика. Заходи и забирай рабочие связки, которыми пользуюсь сам.

Посмотреть, что внутри

telegram

Канал с полезными материалами про нейросети

Разборы, новые инструменты и приёмы по ИИ — то, чем пользуюсь сам, без воды. Подпишись, чтобы не потерять.

Перейти в канал
Кирилл Сандаков

Об авторе

Кирилл Сандаков

Вайбкодер, предприниматель, продюсер

Завайбкодил контент-ферму на США в Instagram (более 300 тыс. подписчиков, среди читателей Дональд Трамп Младший), создатель платформы и сообщества ИИ-офис, автор блога о нейросетях «Выжимаем из ИИ Максимум».

Все статьи автора