Поиск по своим данным: когда нужен отдельный движок
Отдельный движок окупается, когда поиск — основной способ добраться до данных. Модель расчёта в часах, куда подставляются свои значения.
Очередь между сервисами: когда она окупается
Модель расчёта в часах: когда очередь окупается, а когда никогда
Инструменты переписывают на Rust: считаем, стоит ли переезжать
Считаем переезд в часах: окупается то, чего ждёт человек, а не фоновый прогон
Векторная база: когда она окупается, а когда хватит обычного поиска
Модель расчёта в часах: когда векторный поиск окупается, а когда только мешает
Доля языков: кто теряет, а кто набирает
Наш замер долей: полезное в таблице — не порядок лидеров, а изменение малых величин
Длинный контекст: когда он экономит, а когда просто дорожает
Как на самом деле считается стоимость длинного контекста, за что вы платите при каждом запросе и когда кэш префикса даёт реальную экономию
Стоимость хранения: три сценария на 100 ТБ
Почему нельзя просто умножить цену за терабайт на сто и как собрать модель из пяти слоёв, чтобы честно сравнить свои диски, выделенный сервер и облако
Своё железо под инференс: расчёт на три сценария
Пошаговая модель расчёта, которая покажет, когда свой сервер для инференса дешевле облака, если подставить ваш профиль нагрузки и тариф на электричество
Kubernetes на команду из двенадцати человек
Как на своих числах решить, нужен ли команде Kubernetes: сравниваем часы нынешней эксплуатации с налогом на обслуживание кластера
Стоимость владения кодом: что считать и что игнорировать
Как посчитать в часах, сколько труда съедает уже написанный код, — по горячим модулям и следам, которые система и команда оставляют сами
Найм под редкий язык: сколько это стоит на самом деле
Почему найм на редкий язык дорожает временем, часами интервьюеров и простоем, и как посчитать это по своей воронке
Куда сместился Python за два года
Как за два года изменилась роль Python в архитектуре бэкенда и как измерить, какая доля времени вашего запроса уходит на сам язык
Сколько стоит инференс: считаем до счёта, а не после
Модель расчёта, которую можно заполнить своими числами за час. Главный множитель — не размер модели, а доля повторов.
Локальный инференс: когда он дешевле облака
Как построить модель расчёта, которая по вашей нагрузке, планке качества и тарифам покажет, когда локальный запуск LLM дешевле облачного API, а когда дороже
ИИ в редакторе: что реально ускорилось
Почему ассистент ускоряет набор кода, но не сроки задачи: как посчитать свой выигрыш по закону Амдала и когда вычитка подсказок его съедает
Self-hosted вместо подписок: честный расчёт
Почему деление цены подписки на цену сервера ничего не доказывает и как честно посчитать полную стоимость подписки и собственной инфраструктуры