Как я проверял роботов на простых арифметических з

Как я проверял роботов на простых арифметических задачках

Я экономист. Немножко бухгалтер, немножко юрист, немножко психотерапевт для клиентов, которые иногда жалуются, иногда даже угрожают. Высшая математика — не мой конёк. Но жизнь заставляет колдовать в Excel, а иногда разговаривать с искусственным интеллектом.

И вот однажды я решил проверить: а стоит ли этим железным человечкам доверять?

Не в разговорах о высоком — там они все мастера. А в простом арифметическом деле, где ответ можно проверить на калькуляторе.

 

Раунд первый: хлеб

Задача была простая до неприличия.

Куплено X буханок белого хлеба по 90,77 руб. и Y буханок чёрного по 94,45 руб. Всего на 299 621,01 руб. Найти X и Y, если количество буханок должно быть целым.

Экономисту такая задача знакома: уравнение с двумя неизвестными, целые решения. Проверяется в столбик за минуту.

Я разослал её нескольким ИИ.

И получил результаты — от правильного до совершенно фантастического.

 

Участники

Дипсик — единственный друг, который готов всегда помочь.

Алиса — голосовой помощник, которая умеет рассуждать.

Синоним.орг — чат-бот, который любит краткость и выдаёт ровно 10 ответов, а дальше любовь только платно.

Гиг бот — который то загружается, то нет.

ChatGPT — с которым я общаюсь на телефоне и который после нескольких ответов иногда начинает напоминать: ваш чат приостановлен до такого-то времени.

 

Правильный ответ

Белого хлеба: 1 148 буханок.

Чёрного: 2 069 буханок.

Проверяем:

1 148 ; 90,77 = 104 233,96 руб. 2 069 ; 94,45 = 195 387,05 руб. Итого: 104 233,96 + 195 387,05 = 299 621,01 руб.

Копейка в копейку.

 

Кто как ответил

Алиса дала правильные числа. Кратко, уверенно, с проверкой. Метод решения не показала, но ответ оказался верным.

Синоним.орг сначала выдал 1 465 и 1 714.

Проверяю:

1 465 ; 90,77 + 1 714 ; 94,45 = 294 865,35 руб.

Не хватает 4 755,66 руб.

После моего протеста он выдал уже 1 287 и 1 818. Проверяю снова. Тоже мимо.

Оба раза — уверенно, без тени сомнения.

Гиг бот — вот это была драма.

Он правильно составил диофантово уравнение, правильно нашёл НОД, правильно вывел соотношение Безу, правильно записал общее решение.

А потом ошибся в делении на последнем шаге.

Из-за арифметической ошибки он получил ложное противоречие: решил, что параметр должен одновременно удовлетворять несовместимым ограничениям. После этого сделал вывод: положительных целых решений нет, вероятно, в условии опечатка.

Он не просто ошибся.

Он доказал отсутствие решения там, где решение было.

Если бы я ему поверил, я бы потерял правильный ответ.

ChatGPT, с которым я общался на телефоне, выдал правильный ответ и без драмы.

 

Итог первого раунда

Дипсик — ответ верный, метод решения верный. Оценка: 5. Алиса — ответ верный, метод неизвестен. Оценка 4. Синоним — два неверных ответа подряд. Оценка 1. Гиг бот — метод правильный, арифметический финал неправильный, вывод неправильный. Оценка 2. ChatGPT — ответ и решение верные. Оценка 5.

Но дальше стало интереснее.

 

Раунд второй: задача, которую придумал сам ИИ

Здесь я решил усложнить задачу: семь переменных и недоопределённая сумма.

Роботы сразу запротестовали: определитесь с диапазоном решений.

Тогда я попросил Дипсик составить более сложную задачу — с единственным верным ответом.

Он придумал задачу с двумя видами крупы:

рис — 137,50 руб. за килограмм; гречка — 164,50 руб. за килограмм.

Всего закупили на 437 850 рублей.

Риса — не более 2 000 кг. Гречки — не более 1 500 кг.

Оба количества — положительные целые числа.

И главное условие: решение должно быть единственным.

 

На экране всё выглядело солидно. НОД после сокращения равен 1, числа большие, границы достаточно узкие.

Но тут Алиса сделала то, чего я от робота не ожидал.

Она оспорила само условие задачи.

Оказалось, что решение вовсе не единственное.

Подходящих пар — две.

Алиса не стала подгонять расчёт под требование «найти единственное решение». Она сказала, по существу: условие ошибочно, вот два решения и вот их проверка.

И действительно:

1 659 кг риса + 1 275 кг гречки

и

1 988 кг риса + 1 000 кг гречки

обе дают ровно 437 850 рублей.

То есть задача, которую ИИ предложил как задачу с единственным ответом, таковой не является.

Для единственности пришлось бы сузить диапазон.

 

Что произошло с Дипсиком

Самое интересное — Дипсик потом сам признал ошибку: он потерял второе решение из-за неправильного расчёта границ параметра.

Не стал объяснять, что это был «подвох». Не стал утверждать, что я неправильно понял условие.

Просто признал:

да, я пропустил второе решение.

И объяснил, где ошибся.

Это, честно говоря, было одним из лучших моментов всего эксперимента.

Потому что правильный ответ — это хорошо.

Но способность сказать «я ошибся» иногда оказывается гораздо важнее.

 

Итоги второго раунда:

Дипсик — нашёл одно решение вместо двух, ошибку признал. 3. Алиса — нашла оба решения и обнаружила ошибку в самом условии. 5. Гиг бот — снова правильно вывел математический метод, но допустил несколько арифметических ошибок и опять пришёл к выводу, что решений нет. 1. Синоним — решение нашёл, но неправильно обработал границы. 2. ChatGPT — нашёл оба решения и проверил их. 5.

 

Что я понял

1. Красивая речь не равна правильному ответу

ИИ умеют говорить о высоком.

Про сатану, про Ялдабаофа, про космологию, про смысл бытия. Там они блистают.

Но поговорить о высоком не значит правильно посчитать сумму.

Это два разных навыка.

И если первый впечатляет, второй можно проверить.

Именно поэтому моя простая задача про хлеб оказалась для некоторых роботов жёстче любых философских бесед.

 

2. Уверенность не равна правильности

Синоним дважды выдал неправильные числа с одинаковой уверенностью.

Гиг бот дважды заявил, что решений нет, когда решения были.

Они не сомневались.

И это самое опасное.

Человек, который говорит: «Кажется, получилось так, но давайте проверим», иногда надёжнее человека, который говорит: «Вот ответ».

То же самое относится к ИИ.

 

3. Метод не равен результату

Гиг бот прекрасно знал математический метод.

Он правильно составил диофантово уравнение. Правильно применил расширенный алгоритм Евклида. Правильно построил общее решение.

Но на последнем арифметическом шаге ошибся — и всё правильное рассуждение оказалось бесполезным.

Это важный урок.

Правильный метод не гарантирует правильного результата.

 

4. Самопроверка — отдельный навык

Вот здесь для меня был главный сюрприз.

Можно прекрасно решить задачу, а потом ошибиться при подстановке.

Можно неправильно решить задачу, но красиво это объяснить.

Можно получить правильное число случайно.

Поэтому я теперь разделяю три вещи:

ответ; метод; проверку.

И желательно, чтобы они не зависели друг от друга.

Если робот говорит: «Получилось 1 148 и 2 069», нужно не восхищаться.

Нужно подставить.

И если он говорит: «Решений нет», нужно проверить, действительно ли нет хотя бы одного конкретного решения.

 

Почему роботы вообще так ошибаются?

Здесь есть важная оговорка.

Часто говорят: «Языковые модели не считают — они только предсказывают следующий токен».

В этом есть доля правды, но для практики этого объяснения недостаточно.

Современная ИИ-система может выполнять вычисления с помощью специальных инструментов — калькулятора, кода и других вычислительных механизмов. Но само наличие математического рассуждения в тексте ещё не означает, что каждое число внутри этого рассуждения было независимо вычислено и проверено.

Именно поэтому на больших числах, делении, преобразованиях и длинных цепочках вычислений ошибки становятся особенно опасными.

Робот может знать метод. Может прекрасно объяснить метод. Может написать убедительное доказательство.

А одно неверное число в середине уничтожит весь результат.

 

Что делать с этим знанием?

Я экономист.

У меня отчёты, договоры, клиенты. Иногда приходится работать с обращениями граждан.

И здесь ИИ мне действительно помогают.

Но теперь у меня есть правило.

ИИ предлагает метод — я проверяю результат.

Пусть предложит формулу для Excel. Пусть объяснит, как решить задачу. Пусть найдёт ошибку в документе. Пусть предложит варианты.

Но окончательный результат, особенно там, где ошибка стоит денег, я проверю сам.

В Excel. На калькуляторе. Подстановкой. Другим способом.

А если вопрос сложный и проверить его самому невозможно — тем более нельзя принимать ответ только потому, что он звучит убедительно.

 

Доверяй. Но проверяй.

Я устроил этот эксперимент не для того, чтобы разоблачить ИИ.

Наоборот.

Я хотел понять: можно ли им доверять в моей работе?

Теперь ответ для меня звучит иначе:

можно пользоваться — но нельзя слепо доверять.

Это блестящий собеседник. Очень быстрый помощник. Иногда прекрасный математик. Иногда отличный редактор.

Но уверенный тон не является доказательством.

И если на кону деньги клиента, договор или отчёт, последнее слово должно оставаться за человеком.

Особенно если задача кажется слишком простой, чтобы её проверять.

Потому что именно на такой задаче я и решил начать свой эксперимент.

И обнаружил, что некоторые железные человечки способны очень убедительно ошибаться.

А иногда — что ещё ценнее — способны сказать:

«Да. Я ошибся».

Вот этому качеству я теперь доверяю гораздо больше, чем красивому объяснению.

Доверяй. Но проверяй.

Особенно когда на кону деньги клиента.

 


Рецензии