Продуктивность от ИИ на слайдах обычно завышают в разы

Изображение: Magnific.com
Совету директоров показывают слайд. Профильный комитет уже рассмотрел кейс и вынес рекомендацию масштабировать программу. Продуктивность разработки выросла на 80 % после внедрения ИИ-инструментов. Бюджет на масштабирование утверждают в тот же день. Никто не спрашивает, что показал бы тот же расчет, если бы ИИ вообще не внедряли. Как считать эффект внедрения ИИ так же строго, как окупаемость любого капитального актива, и что спросить у команды, которая защищает бюджет? Об этом рассказывает директор по развитию ИИ, ПАО «Группа Астра» Станислав Ежов.

Регулярно вижу такие защиты бизнес-кейсов и сам считаю окупаемость похожих инициатив. Заявленная цифра почти всегда завышена в разы. Тот же массив данных при аккуратном расчете с контролем дает результат кратно меньше того, что показал наивный подсчет.

Причина проста. Команда, защищающая бюджет, может посчитать один массив данных пятью разными способами, и каждый выглядит методологически правильным. По моим наблюдениям на нескольких командах среднего размера разброс между способами счета уходил в десятки процентных пунктов. Команда выбирает способ счета, который лучше смотрится на слайде.

 

Директор по развитию ИИ, ПАО «Группа Астра» Станислав Ежов

Директор по развитию ИИ, ПАО «Группа Астра» Станислав Ежов
Фото: «Группа Астра»

 

За этим стоят пять механизмов, и работают они одновременно.

Начинается все с обратной причинности. Инструмент чаще выдают тем, кто и без него работал быстрее остальных, и ИИ получает чужую заслугу.

Следом идет закон Гудхарта. Как только метрика становится целью защиты бюджета, она перестает честно измерять хоть что-то. Задачи дробятся на мелкие куски, потому что мелкие закрываются чаще и заметнее в отчете, и делают это неосознанно.

Третья причина в том, что расчет допускает множество спецификаций. В любом таком подсчете принимается десять-пятнадцать решений: с какой даты считать период, что включать в выпуск, чем нормировать результат. При переборе вариантов почти всегда находится тот, что дает нужный ответ.

Структурный сдвиг состава работы весит столько же. Команда закрывает столько же задач, но других: больше мелких правок и меньше крупной разработки. Счетчик задач рисует рост, хотя реально созданная ценность упала.

Пятым идет обычный шум. Ставлю его последним, хотя значит он не меньше остальных четырех. Увидеть его можно только через контрольный период на исторических данных, а остальные механизмы видны в самих цифрах. У команды среднего размера квартальные колебания производительности бывают внушительными и без всякого ИИ.

Инвестиция в ИИ проходит ту же рамку оценки, что любой капитальный актив, и по ней я принимаю решение, подписывать бюджет на инициативу или отправлять расчет на пересчет.

Первым шагом идет базовая операция. Нужно точно знать, сколько стоила единица работы до внедрения. Единицей может быть час разработчика, обработанная заявка или закрытый тикет. Без этой точки отсчета улучшение измерить нельзя.

Дальше идет полная стоимость внедрения. Лицензия составляет меньшую часть суммы, остальное уходит на интеграцию, обучение команды и контур безопасности. Проекты, где считали только подписку, обычно дороже плана в два-три раза уже на этапе внедрения.

Отдельно считается срок, за который эффект доходит до прибыли. Между выдачей инструмента и экономией в P&L проходит время на адаптацию и перестройку процессов. Совет директоров, закладывающий эффект с первого квартала, закладывает фантазию.

Последним в расчете учитывается риск при масштабировании. У станка зависимость от поставщика тоже есть, но ее сигналы видны: новая деталь, новый прайс. У модели изменение происходит без физического сигнала, обновление или смена цены за токен способны срезать эффект тихо. Добавьте к этому обычный риск масштаба. Пилот на десяти людях и раскатка на департамент из тысячи решают разные задачи, и экономика пилота почти никогда не переносится линейно.

Перед тем как утвердить бюджет на ИИ-инициативу, стоит задать несколько прямых вопросов.

Эффект считает команда, заинтересованная в результате, или сторона, не зависящая от исхода, например, финансовая функция или внутренний аудит? Независимая сторона решает проблему мотива. Проблему метода решает только следующий пункт. Без него тот же аудит получит тот же разброс, просто без умысла.

Посчитан ли эффект больше чем одним способом, и совпадают ли эти способы в общем диапазоне значений, или итог держится на одной удобной цифре. Отделен ли эффект ИИ от общего роста команды за счет найма, обучения или сезонного спроса. Посчитана ли полная стоимость владения инструментом, включая контур безопасности, или в расчет вошла только цена подписки. Существует ли контрольный период без ИИ для сравнения, и что произойдет с эффектом при кратном росте масштаба.

Пересматриваются ли бюджет и ожидания, если пересчет через два квартала покажет эффект в разы меньше заявленного, или защищенная цифра остается в отчетности, потому что признать ошибку дороже, чем ее не заметить.

Отрицательный ответ хотя бы на один из этих вопросов не означает отказ от инициативы. Он означает, что цифра на слайде показывает качество презентации. Эффект ИИ она не показывает. Рост цифровой мощности от ИИ создает долг проверяемости самого расчета эффекта, и в проектах бюджет на ИИ-инициативу не должен идти дальше без этой проверки, кто бы ее ни защищал.

Автор: Станислав Ежов, директор по развитию ИИ, ПАО «Группа Астра»

Тематики: Интеграция

Ключевые слова: внедрение, Искусственный интеллект, Группа Астра