Webrium
Подписаться

Откуда берётся счёт за искусственный интеллект

Почему у нейросети нет готовых ответов, за что вы платите на самом деле и как ваш разговор меняет итоговый счёт

Семь ячеек-кандидатов, одна выделена: каждое новое слово ответа машина заново выбирает из всей таблицы чиселвся таблица чиселновое слово

Ответ печётся при вас

Вы печатаете вопрос, через пару секунд читаете ответ. Кажется, где-то в хранилище нашлась готовая страничка — и её достали. Не так. Ответа не существовало до вашего вопроса: машина его рассчитала — прогнала ваш текст через огромную таблицу чисел и собрала результат слово за словом. Для счёта важно вот что: чтобы родить каждое новое слово, машина обязана обойти эту таблицу целиком, каждый раз заново. Заготовленных фраз у неё нет — каждый ответ печётся при вас, как батон в пекарне, даже если вы вчера просили точно такой же. Спросите то же самое ещё раз — вся работа повторится от и до. Причём работа начинается не с ответа: даже чтобы понять ваш вопрос, машине нужны расчёты.

Откуда взялась таблица? Её выучили: машине долго показывали огромные массивы текстов, а она подгоняла числа так, чтобы уметь правдоподобно продолжать любую фразу. Ваш вопрос для неё — начало фразы, которое надо продолжить. «Найти готовый ответ» тут невозможно в принципе: даже у одинаковых вопросов переписка перед ними разная, так что расчёт каждый раз свой.

Отсюда главное про цену: вы платите не за ответ, а за работу по его производству. Работа измеряется машинным временем на дорогом железе. Про железо — дальше.

Из чего складывается цена

Основа — чипы, которые крутят всю эту арифметику. Это родственники игровых видеокарт, только у геймера чип один, а тут залы. Внутри каждого — целые города микроэлементов, изготовленных с такой точностью, что брак — обычное дело, поэтому годные чипы дёшево стоить не могут. К тому же их мало: производителей таких чипов в мире можно пересчитать по пальцам одной руки, а очередь за ними длинная. Каждый такой чип — ещё и прожорливый обогреватель: он ест электричество, требует охлаждения, а охлаждение ест электричество снова. Дальше по цепочке — здание, охрана, сеть, люди на смене, которые следят, чтобы ничего не падало. Так устроена цена любой «облачной» услуги; ИИ тут не исключение, а скорее тяжеловес.

Теперь неудобная часть. Вечером в чат заходят все сразу, и провайдер обязан держать машины под наплыв. В четыре утра они простаивают — но не бесплатно: аренда, износ, дежурное электричество. Провайдер, который не угадал с запасом, вечером отвечает медленно или отказывает — и клиенты уходят, поэтому перестраховка оказывается дешевле репутации. Простой нельзя выбросить из бизнеса, и он размазан по всем запросам, включая ваши. Утешение одно: машина, которая отвечала вам вечером, утром отвечает кому-то другому — цена делится, хотя запас всё равно нужен.

И последнее в этой части. Модель сперва нужно было обучить — долгая работа тех же залов машин, ещё до первого ответа кому бы то ни было. Как стоимость печи заложена в цену каждого батона, так и обучение входит в каждый ответ.

Справедливости ради: единица работы со временем дешевеет. Чипы становятся экономичнее, методы — сообразительнее, конкуренция подталкивает вниз. Но аппетиты растут быстрее вежливости: мы подсовываем машинам целые документы, картинки, голос, а помощники нового поколения за один ваш вопрос успевают задать себе ещё кучу собственных. Час работы дешевеет — список задач дорожает, и ощущение «дорого» не уходит. Оно вообще сравнительное: рядом с живым исполнителем тех же задач машина выглядит скромно, рядом с бесплатным поиском — расточительством.

Счётчик живёт внутри разговора

Один и тот же тариф у двух людей даёт разные счета. Причина: счётчик сидит не в прайсе, а в самом разговоре.

Долгой памяти у машины нет: то, что выглядит как память, — это вся переписка, которую ей подают заново при каждом сообщении, иначе она потеряет нить. Значит, длинный разговор стоит дороже короткого даже при одинаковых вопросах: объём работы растёт с каждым сообщением. И уловка «задам контекст один раз, дальше буду спрашивать мелочами» не спасает — каждая мелочь едет вместе со всем контекстом.

Можно спросить: почему бы не запомнить переписку один раз и не пересчитывать? Потому что «запомнить» — значит держать ваш разговор в самой дорогой памяти, прямо на чипе, между сообщениями. Так держать для всех — не хватит никакого чипа. Пересчитать заново оказалось дешевле, чем помнить. Запомним эту деталь: она ещё пригодится, когда мы будем объяснять, при каких условиях наша позиция устареет.

Провайдеры обычно считают не слова, а короткие кусочки, на которые текст режется при обработке. Для бытовой прикидки это неважно — считайте словами, пропорция та же. Тарифов два: за то, что машина перечитала, и за то, что она родила; рождение, как правило, дороже прочтения.

Вся арифметика счёта помещается на салфетку: счёт за разговор ≈ перечитанное × входной тариф + сгенерированное × выходной. Подставьте свои тарифы и длину типичной переписки — получите порядок собственных трат без чужих калькуляторов.

Кстати, в счёт идут и вежливые слова самой машины: «отличный вопрос», объявление плана, итоговый пересказ. Каждое куплено по выходному тарифу, поэтому просьба «отвечай короче» — тоже про деньги. Повтор — не бесплатная правка: машина снова перечитывает всё, что было, плюс ваш новый вопрос, плюс пишет новый ответ.

Картинки и звук идут отдельной строкой, и не потому, что они «красивее». В фотографии больше исходных данных на единицу смысла: чтобы понять, что на ней изображено, машине приходится продираться через них все. Голос устроен похоже, плюс этап перевода звука в данные и обратно.

Если вы платите подпиской, вы видите одну цифру в месяц, но внутри неё крутится тот же счётчик, усреднённый по всем пользователям. Поэтому у подписок есть лимиты: провайдер заранее прикидывает, сколько разговора приходится на среднего пользователя, и очерчивает рамку, за которой просит доплачивать.

Тупик: экономить на своих словах

Когда счёт хочется урезать, первым напрашивается ход из житейской логики: раз платят за текст, надо давать меньше текста. Пишем короче, выбрасываем подробности, перестаём здороваться и благодарить — машина, думаем, «поймёт с полуслова».

Не работает, и вот почему. Ваши слова — самый дешёвый член в формуле со салфетки. Основные деньги уходят на то, что машина перечитывает, — весь накопленный разговор, — и на то, что она пишет, причём по более дорогому тарифу. Сжимая вопрос, вы экономите на самом мелком слагаемом. Хуже того: вопрос без подробностей заставляет машину угадывать. Угадала — повезло. Не угадала — вы переспрашиваете, и вот тут начинается настоящее: при переспросе весь разговор, со всеми прежними попытками, перечитывается заново, плюс пишется новый ответ. Каждое переспрашивание умножает счёт на всю проделанную работу целиком. Экономия, которая провоцирует повтор, — это не экономия, а рассрочка: платите потом и больше.

Второй ход из той же серии — «начну новый чат, чтобы не тянуть старое». Выглядит разумно: разговор разросся, хвост длинный, обрежу. Но в новом чате задачу придётся объяснять заново, а объяснение — это генерация, самая дорогая часть, и написанное объяснение дальше поедет в контексте каждого следующего вопроса. Вы заплатили за ту же настройку второй раз. Оговорим честно: новый чат — не всегда ошибка. Если тема действительно сменилась, старый контекст — мёртвый груз, и обрезать его правильно. Ошибка — резать разговор ради экономии, когда задача та же.

Что действительно помогает, видно из той же формулы: не провоцировать повтор — давать машине всё, что нужно для ответа с первого раза; не позволять разговору обрастать мусором; и просить писать короче — вот это, в отличие от собственного молчания, бьёт по дорогому выходному тарифу. Экономить надо не на своих словах, а на машинных.

Позиция редакции

Мы считаем, что «дорогой ИИ» — это почти всегда не тариф на витрине, а устройство конкретного разговора. Цена складывается из арифметики: перечитанный контекст плюс сгенерированный ответ, помноженные на число попыток. Управлять счётом может каждый, и не поиском самого дешёвого сервиса, а привычками: полный контекст с первого раза, компактный разговор, короткие ответы машины. Пока за одинаковую работу разные провайдеры просят сопоставимые деньги, выбор сервиса — мелкая настройка, а не рычаг. Рычаг — в разговоре.

И мы обязаны сказать, при каких условиях эта позиция неверна. Она держится на одном техническом факте: пересчитывать разговор каждый раз дешевле, чем помнить его между сообщениями. Если это изменится — если машины научатся дёшево запоминать переписку, не держа её в самой дорогой памяти, — длинный разговор перестанет дорожать с каждым сообщением, гигиена контекста потеряет смысл, и наш совет превратится в пережиток эпохи дорогой памяти. Второе условие: если провайдеры начнут брать не за работу, а за результат, счётчик исчезнет из разговора вовсе — и наши рекомендации тоже устареют. Мы не считаем эти сценарии близкими, но именно они, а не чья-то реклама, сделали бы нашу позицию неверной.

Кому нужна техническая глубина — у нас есть отдельный разбор о том, во сколько обходится работа модели на реальной нагрузке.

С чем это связано

Метка над заголовком говорит, зачем туда идти: продолжить тему, перейти к практике или увидеть возражение.

Счёт за инференс, разогнанный повторами вызовов, растёт и пробивает порог бюджета, зажигая сигнал тревогисчёт с повторамимесяц
Углубление

Сколько стоит инференс: считаем до счёта, а не после

Счёт за ИИ можно прикинуть заранее: модель расчёта заполняется своими числами за час. Главный множитель — не размер модели, а доля повторов.

Шесть столбцов растут ступеньками от первой попытки к шестой: каждая повторная попытка оплачивается полностью, и счёт за один и тот же вызов вырастает кратноПлатим за попытки
Углубление

Повторы, которые удваивают счёт

Счёт за API растёт, хотя продукт стоит на месте? Повторные попытки умножают затраты, а не складываются — разбираемся, где это происходит и что чинить на самом деле.

Два маршрута: короткий дорогой — погоня за одной цифрой точности, длинный дешёвый — набор метрик под разные режимы отказаодна цифранесколько метрик
Практика

Что мерить у модели кроме точности

Разобрались, откуда берётся счёт. Теперь проверьте модель, за которую платите: измеряем калибровку и отдельные режимы отказа, чтобы понять, стало ли лучше.

Поле, разделённое вертикальным швом: слева код, которому мир сообщает об устаревших допущениях — падает сборка, краснеет тест; справа промпт, где расхождение с код: мир кричитпромпт: тишина
Спор

Промпт как код: почему он гниёт быстрее

Авторы спорят с тем, что промпт ведёт себя как код: он портится быстрее, привычные приёмы разработки его не спасают.

Письмо по вторникам

Один разбор недели и короткий список того, что изменилось. Без дайджестов на сорок ссылок.

Начните вводить — материалы появятся здесь.

выбрать · Enter открыть · Esc закрыть