Кто такие Сергей Нотевский и Сергей Курьян
Запрос «нейросети Сергей» в русскоязычном интернете чаще всего приводит к двум заметным фигурам: Сергею Нотевскому и Сергею Курьяну. Оба они — практики, которые строят реальные AI-продукты, но их пути и подходы заметно различаются.
Сергей Нотевский — AI Lead в компании Битрикс24. Он руководит внутренней AI-платформой, на которой работают все нейросетевые функции продукта: от транскрибации звонков до агента BitrixGPT. Его карьерный путь необычен: до IT он четыре года работал фитнес-тренером и успел запустить три бизнеса за три года. В IT он пришёл без денег на курсы, самостоятельно освоив программирование по самодельной программе за пару месяцев. В Битриксе он вырос от ручного тестировщика до лида мобильной автоматизации, а затем — до руководителя AI-направления.
Сергей Курьян — основатель IT-компании «Нейросети», которая разрабатывает готовые AI-решения для крупных российских компаний. Его ключевой продукт — платформа CorpGPT, позволяющая создавать корпоративных ассистентов и ботов без специальных знаний. Курьян активно продвигает идею, что нейросети — это инструмент повышения эффективности бизнеса в условиях кадрового дефицита и демографического спада.
Оба эксперта сходятся в главном: нейросети перестали быть экспериментальной технологией и стали рабочим инструментом, который приносит измеримый экономический эффект.
Зачем компании разворачивают собственные нейросети
Один из ключевых вопросов, который обсуждает Сергей Нотевский, — стоит ли компании арендовать нейросети как сервис (MaaS, Model-as-a-Service) или разворачивать их на собственных серверах. Битрикс24 выбрал второй путь, и у этого решения есть несколько причин.
Во-первых, это контроль над данными. Когда модели работают на собственной инфраструктуре, компания может гарантировать клиентам, что их данные не покидают закрытый контур. Это особенно важно для корпоративных клиентов, работающих с персональными данными и коммерческой тайной.
Во-вторых, это экономика при больших объёмах. Битрикс24 обрабатывает около миллиона запросов в день на 200 серверах с GPU. При таком масштабе аренда API у сторонних провайдеров обходится значительно дороже, чем эксплуатация собственного парка оборудования.
В-третьих, это гибкость. Собственная платформа позволяет дообучать модели под специфические задачи, комбинировать разные модели в ансамбль и оптимизировать инфраструктуру под конкретные сценарии использования.
Сергей Курьян из компании «Нейросети» также делает ставку на закрытый контур. Его платформа CorpGPT работает в изолированной среде, что обеспечивает полную защиту корпоративных данных. Это особенно актуально для государственных структур и крупного бизнеса, где утечка информации недопустима.
MaaS или self-hosted: как выбрать стратегию
Выбор между арендой моделей и развёртыванием собственной инфраструктуры — это не техническое, а стратегическое решение. Сергей Нотевский выделяет несколько факторов, которые нужно учесть.
Объём запросов. Если компания обрабатывает сотни или тысячи запросов в день, аренда API может быть оправдана. Но когда речь идёт о миллионах запросов, как в случае с Битрикс24, стоимость каждого токена начинает играть решающую роль. При больших объёмах собственное железо окупается.
Требования к безопасности. Для компаний, работающих с чувствительными данными, передача информации стороннему провайдеру может быть неприемлема. В этом случае self-hosted — единственный вариант.
Скорость и задержки. Собственная инфраструктура позволяет контролировать задержки и обеспечивать стабильную скорость ответа. Это критично для интеграций в реальном времени, например, для транскрибации звонков.
Команда и экспертиза. Разворачивание и поддержка собственной AI-инфраструктуры требует квалифицированных специалистов: ML-инженеров, DevOps, специалистов по оптимизации. Если такой команды нет, MaaS может быть более прагматичным выбором.
Сергей Курьян добавляет к этому ещё один аргумент: готовые платформы вроде CorpGPT позволяют бизнесу внедрять AI без необходимости нанимать дорогостоящих специалистов. Это снижает порог входа и делает технологию доступной для среднего бизнеса.
Как посчитать железо под модель: GPU, память и квантизация
Когда компания решает развернуть нейросеть у себя, возникает вопрос: сколько и какого железа нужно? Сергей Нотевский объясняет, что ключевой параметр — это объём видеопамяти GPU, необходимый для размещения модели.
Базовое правило: для инференса модели нужно примерно столько же памяти, сколько весят её веса. Например, модель с 70 миллиардами параметров в формате FP16 занимает около 140 гигабайт. Это значит, что для её запуска потребуется несколько GPU или один мощный сервер.
Однако есть способ сократить требования — квантизация. Это техника, при которой веса модели хранятся в формате с меньшей точностью, например, INT8 или INT4. Квантизация позволяет уменьшить требования к памяти в 2–4 раза ценой небольшого снижения качества. Для многих задач это приемлемый компромисс.
Нотевский также обращает внимание на то, что при выборе GPU нужно учитывать не только объём памяти, но и пропускную способность, а также скорость межсоединений между чипами. Для больших моделей критично, чтобы GPU могли быстро обмениваться данными.
При этом он предостерегает от слепого доверия бенчмаркам и рейтингам моделей. Официальные тесты часто не отражают реальную производительность на конкретных задачах. Вместо этого он рекомендует создавать собственные тестовые наборы, приближенные к реальным сценариям использования.
Почему бенчмаркам нельзя верить и как тестировать модели
Сергей Нотевский — ярый критик слепого доверия к бенчмаркам. По его словам, рейтинги моделей вроде LMArena или Context Arena показывают общую картину, но не гарантируют, что модель будет хорошо работать на ваших данных.
Проблема в том, что бенчмарки часто оторваны от реальности. Они тестируют модель на абстрактных задачах, которые могут не совпадать с тем, что нужно вашему бизнесу. Кроме того, модели могут «подгоняться» под популярные тесты, что искажает результаты.
Вместо этого Нотевский предлагает подход, который он называет «LLM as a judge». Суть в том, чтобы использовать одну сильную модель для оценки ответов другой модели. Например, вы задаёте модели вопрос, получаете ответ, а затем просите другую модель оценить его качество по заданным критериям.
Для этого нужно:
- Собрать набор реальных задач, с которыми модель будет работать в продакшене.
- Определить критерии оценки: точность, полнота, стиль, соответствие формату.
- Использовать JSON-схему для структурирования ответов и автоматической проверки.
- Прогнать несколько моделей через этот тест и сравнить результаты.
Такой подход позволяет выбрать модель, которая действительно подходит для ваших задач, а не ту, что лучше всех выглядит в рейтинге.
Галлюцинации, контекстное окно и «гниение контекста»
Одна из главных проблем нейросетей — галлюцинации, то есть генерация уверенных, но ложных ответов. Сергей Нотевский объясняет, что это не баг, а следствие того, как работают языковые модели: они предсказывают следующее слово, а не обращаются к базе фактов.
Частично проблему решает увеличение контекстного окна — количества текста, которое модель может «видеть» при генерации ответа. Однако Нотевский предостерегает от заблуждения, что большое окно всегда лучше. На практике модель может «забывать» информацию из начала длинного контекста или путаться в ней.
Это явление получило название «гниение контекста» (context rot). Даже если модель формально поддерживает окно в 200 тысяч токенов, качество ответов может деградировать уже после первых десятков тысяч. Для проверки этого используется тест «иголка в стоге сена»: в длинный текст помещается факт, а затем модель просят его найти. Результаты часто показывают, что модель «теряет» факт, если он находится слишком далеко от начала или конца.
Практический вывод: не стоит полагаться на модель как на единственный источник истины. Для критически важных задач нужно использовать дополнительные механизмы проверки, например, поиск по базе знаний или верификацию фактов.
Префикс-кэш: как экономить до 95% на токенах
Один из самых практичных советов Сергея Нотевского касается оптимизации расходов на инференс. Речь идёт о префикс-кэше (prefix cache) — технике, которая позволяет значительно сократить стоимость обработки запросов.
Суть в следующем: когда вы отправляете запрос к модели, она обрабатывает все входящие токены. Если у вас есть повторяющиеся элементы запроса — например, системный промпт, инструкции или общий контекст, — модель будет пересчитывать их каждый раз заново. Префикс-кэш позволяет сохранять результат обработки этих повторяющихся частей и переиспользовать его.
По оценкам Нотевского, в некоторых сценариях это позволяет экономить до 95% стоимости входящих токенов. Особенно это актуально для AI-агентов, которые делают много последовательных запросов с общим контекстом.
Для реализации префикс-кэша нужно, чтобы инфраструктура поддерживала эту возможность. Например, в собственной платформе Битрикс24 это реализовано на уровне серверной архитектуры. При использовании MaaS-провайдеров нужно уточнять, поддерживают ли они кэширование и как оно тарифицируется.
Этот приём особенно важен для компаний, которые строят AI-ассистентов или чат-ботов с длинными системными промптами. Даже небольшая оптимизация может дать существенную экономию при больших объёмах.
Команда AI-платформы: какие роли нужны и что такое харнес
Построение собственной AI-платформы требует не только железа, но и правильной команды. Сергей Нотевский описывает структуру команды, которая занимается AI в Битрикс24.
Ключевые роли:
- ML-инженеры — занимаются дообучением моделей, настройкой пайплайнов и оптимизацией.
- DevOps-инженеры — отвечают за инфраструктуру, развёртывание и мониторинг.
- Продакт-менеджеры — определяют, какие функции нужны пользователям и как их реализовать.
- Инженеры по качеству — разрабатывают тесты и метрики для оценки моделей.
Нотевский также вводит понятие «харнес» (harness) — это обвязка вокруг модели, которая включает промпты, инструменты, интеграции и логику. Харнес определяет, как модель используется в конкретном продукте, и часто важнее, чем сама модель.
Интересный момент: Нотевский считает, что навык работы с AI становится важнее конкретных технических знаний. Инженер, который умеет правильно формулировать задачи для модели и строить вокруг неё обвязку, может быть ценнее того, кто знает детали архитектуры нейросетей.
Сергей Курьян добавляет, что его компания «Нейросети» решает проблему нехватки специалистов за счёт готовых платформ. CorpGPT позволяет бизнесу внедрять AI без формирования большой команды — достаточно одного человека, который умеет настраивать ассистентов.
Практические сценарии применения: от транскрибации до беспилотников
Оба эксперта приводят конкретные примеры использования нейросетей в бизнесе, которые выходят за рамки простого «написать текст».
В Битрикс24 нейросети используются для:
- Транскрибации звонков — автоматическое преобразование речи в текст и анализ разговоров с клиентами.
- Автозаполнения CRM — извлечение ключевой информации из переписки и заполнение полей.
- Агента BitrixGPT — выполнение задач, работа с документацией и поиск людей внутри компании.
Сергей Курьян идёт дальше и говорит о применении AI в беспилотных технологиях. По его словам, любой беспилотник — это бизнес, а значит, есть бизнес-процессы, которые можно автоматизировать с помощью ИИ. Платформа CorpGPT позволяет создавать ассистентов для управления этими процессами.
В образовании нейросети помогают гарантировать качество усвоения информации и готовить специалистов нового уровня. Курьян подчёркивает, что технологии позволяют увеличить эффективность процессов минимум в десять раз, что особенно важно в условиях нехватки кадров.
Ключевой вывод из обоих кейсов: нейросети — это не замена человека, а инструмент, который усиливает его возможности. Правильно настроенная система берёт на себя рутину, позволяя людям сосредоточиться на творческих и стратегических задачах.
Как начать путь в AI-инженерии: советы от практиков
Сергей Нотевский, который сам прошёл путь от фитнес-тренера до AI-лида, делится практическими советами для тех, кто хочет войти в сферу.
Во-первых, не обязательно иметь профильное образование или деньги на дорогие курсы. Он сам освоил программирование по самодельной программе за два месяца, используя бесплатные ресурсы. Главное — мотивация и умение самостоятельно искать информацию.
Во-вторых, начинать нужно с практики. Не пытайтесь сразу изучить всю теорию — возьмите конкретную задачу и решите её с помощью нейросети. Например, автоматизируйте какой-то рутинный процесс в своей работе. Это даст практический опыт и понимание того, как работают модели.
В-третьих, важно понимать, что AI-инженерия — это не только про модели. Это про умение строить системы вокруг них: промпты, интеграции, тесты, мониторинг. Навык «обвязки» модели часто важнее, чем знание архитектуры.
Нотевский также рекомендует следить за развитием инструментов и экспериментировать. Например, Битрикс24 запустил проект «Вайбкод» — среду, где можно создавать приложения с помощью AI. Такие инструменты снижают порог входа и позволяют быстро проверять идеи.
Сергей Курьян добавляет, что для бизнеса сейчас главное — не бояться внедрять AI. Даже простые решения, например, чат-бот на базе CorpGPT, могут дать существенный эффект. Важно не просто говорить о технологиях, а применять их в реальной жизни.
Вопросы и ответы
Кто такой Сергей Нотевский и чем он известен?
Сергей Нотевский — AI Lead в компании Битрикс24. Он руководит внутренней AI-платформой, на которой работают все нейросетевые функции продукта: транскрибация звонков, автозаполнение CRM, агент BitrixGPT. Его карьерный путь необычен: он начинал как фитнес-тренер, затем пришёл в IT без профильного образования и дорос до руководителя AI-направления. Известен своими статьями на Хабре и практическими советами по развёртыванию нейросетей.
Что такое CorpGPT и кто его создал?
CorpGPT — это платформа, созданная IT-компанией «Нейросети» под руководством Сергея Курьяна. Она позволяет создавать корпоративных ассистентов и ботов без специальных знаний в области программирования. Система работает в закрытом контуре, что обеспечивает полную защиту персональных и корпоративных данных. Платформа предназначена для крупных компаний и позволяет автоматизировать бизнес-процессы.
Что выбрать: арендовать нейросеть как сервис или развернуть у себя?
Выбор зависит от нескольких факторов. Если у вас небольшой объём запросов — аренда API (MaaS) будет проще и дешевле. Если вы обрабатываете миллионы запросов в день, как Битрикс24, собственное железо окупается. Также важно учитывать требования к безопасности: для работы с чувствительными данными нужен закрытый контур. И наконец, оцените свою команду: для self-hosted нужны квалифицированные ML-инженеры и DevOps.
Почему нельзя доверять бенчмаркам нейросетей?
Бенчмарки показывают общую картину, но не отражают реальную производительность модели на ваших задачах. Модели могут «подгоняться» под популярные тесты, а сами тесты часто оторваны от реальных сценариев. Сергей Нотевский рекомендует создавать собственные тестовые наборы, приближенные к вашим задачам, и использовать подход «LLM as a judge», когда одна модель оценивает ответы другой.
Что такое «гниение контекста» и как с ним бороться?
«Гниение контекста» (context rot) — это явление, при котором модель «забывает» информацию из начала длинного контекста, даже если формально поддерживает большое контекстное окно. Качество ответов может деградировать уже после первых десятков тысяч токенов. Для борьбы с этим используйте дополнительные механизмы проверки, например, поиск по базе знаний, и не полагайтесь на модель как на единственный источник истины.
Что такое префикс-кэш и как он экономит деньги?
Префикс-кэш — это техника, которая сохраняет результат обработки повторяющихся частей запроса (например, системного промпта) и переиспользует его при следующих запросах. Это позволяет избежать повторных вычислений и сэкономить до 95% стоимости входящих токенов. Особенно актуально для AI-агентов, которые делают много последовательных запросов с общим контекстом.
Как начать карьеру в AI-инженерии без денег на курсы?
Сергей Нотевский советует начинать с практики: возьмите конкретную задачу и решите её с помощью нейросети. Используйте бесплатные ресурсы и самостоятельно осваивайте программирование. Важно понимать, что AI-инженерия — это не только про модели, но и про умение строить системы вокруг них: промпты, интеграции, тесты. Навык «обвязки» модели часто важнее, чем знание архитектуры.