Интеллектуальные агенты и будущее аналитики: развитие платформ data sapience

6 минут чтения

"Будущее аналитики - за интеллектуальными агентами": Data Sapience о развитии платформ данных

Российский рынок корпоративных данных постепенно выходит за рамки точечной замены отдельных зарубежных СУБД. Компании все чаще стремятся сформировать единую технологическую среду, в которой хранение информации, аналитика, машинное обучение и эксплуатация интеллектуальных моделей работают согласованно. Такой подход позволяет эффективнее использовать серверные мощности, сокращать дублирование данных и быстрее запускать новые цифровые сервисы.

Эксперты Data Sapience - менеджер по предпродажной поддержке Андрей Прохоров и владелец платформы Kolmogorov AI Михаил Зайцев - рассказали о возможностях Data Ocean Nova и Kolmogorov AI, особенностях их совместного применения, барьерах внедрения и будущем интеллектуальной аналитики.

Data Ocean Nova: единая среда для корпоративных данных

Платформа Data Ocean Nova относится к классу lakehouse-решений - гибридных озер-хранилищ. Она предназначена для работы с корпоративной информацией и отличается от традиционных систем управления базами данных архитектурным разделением хранения и вычислений.

В классических СУБД эти процессы тесно связаны: данные находятся внутри системы, а вычислительные ресурсы выделяются в рамках ее архитектуры. Современные платформы, включая Snowflake и Databricks, используют иной принцип. Информация хранится отдельно, а вычислительный контур подбирается в зависимости от конкретной задачи.

Data Ocean Nova развивает такую модель. Данные размещаются в едином объектном хранилище, а для их обработки можно использовать разные движки: Spark, StarRocks, Trino и Impala. Это дает возможность выбирать наиболее эффективный инструмент для пакетной обработки, интерактивной аналитики, SQL-запросов или работы с большими массивами информации.

Еще одна особенность платформы - гибридная архитектура на базе Kubernetes-приложений. Она позволяет динамически перераспределять вычислительные ресурсы между рабочими нагрузками. Если в один момент возрастает потребность в аналитике, а задачи машинного обучения временно снижаются, мощности можно направить туда, где они нужнее. Такое управление учитывает текущую нагрузку, требования бизнеса и условия соглашений об уровне сервиса.

Kolmogorov AI: операционная среда для ML и LLM

Kolmogorov AI предназначена для управления жизненным циклом моделей машинного обучения и больших языковых моделей. Платформа охватывает процессы MLOps и LLMOps: подготовку среды, обучение, внедрение, наблюдение за работой моделей и их дальнейшее сопровождение.

Для дата-сайентиста это единое рабочее пространство, в котором можно разрабатывать модели, запускать эксперименты, отслеживать результаты и переводить успешные решения в промышленную эксплуатацию. Платформа также ориентирована на современные агентные системы, способные самостоятельно планировать последовательность действий, обращаться к внешним инструментам и выполнять комплексные задачи.

Главная цель Kolmogorov AI - устранить разрыв между экспериментальной разработкой и промышленным использованием моделей. В традиционном сценарии модель может успешно работать в ноутбуке специалиста, но ее запуск в корпоративной среде требует множества дополнительных операций: настройки инфраструктуры, контроля версий, организации мониторинга и обеспечения безопасности. Единая MLOps-платформа делает этот переход более управляемым.

Почему платформы данных и ML важно объединять

Машинное обучение невозможно без надежного доступа к данным. Более того, на этапе разработки моделей специалистам часто требуется не только очищенная витрина, но и большие объемы необработанной информации. Это связано с необходимостью быстро проверять различные гипотезы, выбирать признаки и сравнивать результаты.

На практике платформа данных и MLOps-среда нередко существуют раздельно. Иногда они располагаются даже в разных центрах обработки данных. Тогда информацию приходится копировать между системами, а инфраструктуру каждой платформы - рассчитывать на максимальную нагрузку.

Возникает последовательная схема: сначала одна система подготавливает данные, затем другая начинает обучение или расчет. Пока один контур активно используется, второй может простаивать. Кроме того, копирование массивов повышает требования к каналам связи, усложняет контроль качества и увеличивает стоимость хранения.

Объединение Data Ocean и Kolmogorov AI позволяет использовать общую инфраструктуру. Вычислительные ресурсы можно перераспределять между аналитическими и ML-задачами, а данные не требуется многократно дублировать. Это повышает среднюю загрузку оборудования, уменьшает объем избыточной инфраструктуры и снижает совокупную стоимость владения.

Основные сложности внедрения

Наиболее трудный этап проекта часто начинается еще до установки платформы. В корпоративных системах сведения хранятся в разных форматах, имеют неодинаковую структуру и могут содержать противоречия. Чтобы получить полезный результат, необходимо извлечь информацию из источников, объединить ее, проверить качество и выстроить правила обработки.

Это прежде всего организационная и методологическая задача заказчика. Платформа может предоставить необходимые инструменты, однако именно компания должна определить, какие данные считать эталонными, кто отвечает за их качество и каким образом они будут использоваться подразделениями.

Для загрузки больших массивов, пакетной репликации и интеграции в Data Ocean предусмотрен инструмент Flex Loader. Для обработки изменений в реальном времени используется Data Ocean SDI. Решение может считывать изменения из транзакционных журналов систем-источников и очередей сообщений, а также выполнять преобразования "на лету" в соответствии с бизнес-правилами.

Общая технологическая база Data Ocean и Kolmogorov AI дополнительно упрощает внедрение. Командам не приходится осваивать большое количество разрозненных продуктов, администраторам требуется настраивать меньше интеграций, а путь от получения данных до запуска модели становится короче.

Качество данных как условие успеха

Даже самая современная модель не сможет обеспечить надежный результат, если обучается на неполной, устаревшей или противоречивой информации. Поэтому подготовка данных должна рассматриваться не как разовая техническая операция, а как постоянный процесс.

Компании необходимо организовать контроль происхождения данных, версий наборов, прав доступа и изменений в источниках. Важно понимать, откуда получен конкретный показатель, кто его изменял и какие правила применялись при обработке. Такие механизмы особенно значимы в регулируемых отраслях - финансовом секторе, промышленности, здравоохранении и государственном управлении.

Интегрированная платформа позволяет связать подготовку датасета с последующим обучением модели. Это облегчает воспроизводимость экспериментов: специалисты могут повторить расчет, сравнить версии данных и понять, почему качество модели изменилось.

Переход от моделей к интеллектуальным агентам

Следующим этапом развития аналитики станут интеллектуальные агенты. В отличие от обычного отчета или модели прогнозирования, агент способен самостоятельно разбивать цель на последовательность действий, обращаться к базам данных, вызывать прикладные сервисы и формировать итоговый ответ.

Например, аналитический агент может получить запрос о причинах падения продаж, самостоятельно проверить показатели по регионам, сопоставить их с остатками на складах, изучить маркетинговые активности и подготовить выводы. При этом пользователю не нужно вручную составлять десятки запросов и переключаться между разными системами.

Однако агентные решения требуют особенно строгого контроля. Необходимо ограничивать доступ моделей к корпоративным данным, фиксировать выполненные действия, проверять корректность ответов и предотвращать несанкционированный запуск операций. Поэтому развитие LLMOps и средств мониторинга становится не менее важным, чем создание самих моделей.

Аналитическая платформа уходит "в тень"

Пользовательский опыт постепенно меняется. Раньше специалисту требовалось знать структуру базы данных, язык запросов и особенности конкретного инструмента. В будущем многие операции будут выполняться через естественный язык или автоматически работающие агенты.

Это не означает полного исчезновения аналитических платформ. Напротив, их роль станет более значимой, но менее заметной для конечного пользователя. Внутри будут работать механизмы хранения, каталогизации, управления доступом, оркестрации вычислений и контроля моделей, а снаружи останется простой интерфейс постановки задачи.

Такой подход позволит вовлечь в работу с данными больше сотрудников, но одновременно повысит требования к управлению и безопасности. Компании должны будут четко определить, какие действия агент может выполнять самостоятельно, а какие требуют подтверждения человека.

Экономический эффект единого ландшафта

Консолидация данных и ML-инструментов дает эффект не только на уровне архитектуры. Она сокращает расходы на оборудование, лицензирование, сопровождение и обучение персонала. Чем меньше разрозненных систем используется в организации, тем проще управлять обновлениями, резервным копированием и информационной безопасностью.

Дополнительное преимущество - сокращение времени вывода новых решений. Если данные уже доступны в единой среде, а инструменты обучения и эксплуатации моделей интегрированы, переход от идеи к работающему сервису занимает меньше времени.

В результате платформенный подход становится основой для развития корпоративной аналитики. Компании получают не набор независимых продуктов, а единый контур, способный поддерживать хранение информации, потоковую обработку, машинное обучение, большие языковые модели и агентные приложения. Именно в такой связности эксперты Data Sapience видят дальнейшее развитие рынка данных и аналитики.

Прокрутить вверх