NetApp приобретет DataPelago, создателя универсальной системы обработки данных Nucleus (UDPE), которая ускоряет гетерогенные вычисления для аналитики и генеративного искусственного интеллекта.
Nucleus, созданный на основе Gluten, Velox и Substrait с открытым исходным кодом, значительно ускоряет работу Spark и Trino, обеспечивая превосходное соотношение цены и качества. Он легко подключается к существующим Lakehouses, SQL, Python, Airflow, Tableau, Power BI и т. д. без миграции данных или привязки к поставщику. DataPelago, основанная в 2021 году генеральным директором Раджаном Гоялом и финансовым директором Анандом Айером, вышла из невидимости в октябре 2024 года и собрала в общей сложности более 75 миллионов долларов, включая раунд финансирования в 2024 году на 47 миллионов долларов.
Генеральный директор NetApp Джордж Куриан заявил, что для развития аппаратного обеспечения искусственного интеллекта требуется одинаково мощная инфраструктура данных, чтобы раскрыть ценность корпоративных данных, и это приобретение укрепляет способность NetApp обеспечивать гибкую обработку данных для конкурентного преимущества.
В блоге DataPelago отмечается, что Nucleus будет встроен в платформу данных NetApp, что обеспечит гораздо более широкое внедрение на предприятии, чем стартап мог бы достичь самостоятельно. Ранее в этом году DataPelago заняла четвертое место в рейтинге Data Science в списке самых инновационных компаний мира 2026 года по версии Fast Company.
В отличие от традиционных архитектур, которые перемещают наборы данных во внешние кластеры ЦП/ГП, Nucleus выполняет ускоренные вычисления непосредственно на уровне хранилища. Тесты по сравнению с Nvidia cuDF показывают проецирование в 10,5 раз быстрее, фильтры в 10,1 раза быстрее и агрегирование в 4,3 раза быстрее. Расположенный между механизмами запросов (Spark, Trino, Flink) и платформами Python (Ray, Dask), его стек состоит из трех модульных уровней:
1.DataApp: подключаемый модуль интеграции для ускорения Spark, Trino и других двигателей.
2.DataOS: уровень оркестрации, динамически сопоставляющий задачи обработки данных со смешанными ускорителями для масштабируемой настройки производительности.
3.DataVM: пользовательская виртуальная машина с ISA для конкретного домена, предлагающая унифицированную абстракцию выполнения для процессоров, графических процессоров, FPGA и специализированных микросхем.
Основной поток выполнения данных
1. Доступ к данным через соединители инфраструктуры: развертывается как плагины Spark JAR, совместимые со стандартными соединителями данных, поддерживающие Parquet, ORC, Iceberg, Delta Lake, JSON и целевые хранилища, включая S3, GCS, ADLS, HDFS и локальные массивы. Ускорение распространяется на интеграцию хранилищ, сохраняя при этом собственную семантику запросов через стандартные уровни ввода-вывода механизма.
2. Планирование и оптимизация запросов: хост-система генерирует физический план; DataApp преобразует его в промежуточное представление через Gluten/Substrait. Интеллектуальный оптимизатор строит оптимальные графики потоков данных и распределяет ресурсы ЦП/ГП для выполнения DataOS/DataVM.
3. Оптимизация межаппаратной передачи данных: слияние оператора/ядра и потоковое выполнение исключают полную промежуточную материализацию для сокращения накладных расходов на ввод-вывод. Общая память с нулевым копированием снижает дублирование данных CPU-GPU, а ISA DataVM использует LLVM, CUDA и ROCm для маршрутизации задач на оптимальное оборудование посредством векторизованной обработки по столбцам. Эти настройки повышают загрузку графического процессора до 80–90 % за счет минимизации междоменного перетасовки данных.
Nucleus работает локально и в основных общедоступных облаках. Его ускоритель Spark обеспечивает увеличение пропускной способности в 3–4 раза по сравнению с Databricks Photon; он также интегрируется со Snowflake за счет ускорения обработки формата открытых таблиц и восходящих/нисходящих конвейеров Spark/Trino, питающих склад. DataPelago утверждает, что Nucleus сокращает затраты на инфраструктуру до 80% и обеспечивает в 10 раз более высокую производительность, чем устаревшие конвейеры. Устранив обязательное дублирование данных между операционными системами и системами искусственного интеллекта, он устраняет основное узкое место, замедляющее развертывание корпоративного искусственного интеллекта, при развертывании в реальном времени на крупных глобальных предприятиях по всем вертикалям.
Генеральный директор DataPelago Раджан Гоял заявил, что основная миссия компании — устранение узких мест в обработке данных, сдерживающих инновации в области искусственного интеллекта. В результате слияния с NetApp ее революционная технология ускорения сочетается с обширным портфелем инфраструктуры данных NetApp; Компании вложили значительные средства в графические процессоры и модели, но страдают от фрагментированных хранилищ данных, из-за которых оборудование используется недостаточно, а объединенный стек упрощает крупномасштабное развертывание искусственного интеллекта.
NetApp позиционирует это приобретение как знаковое обновление портфеля, в котором обработка с ускорением на графическом процессоре будет реализована непосредственно в рабочих процессах хранения данных, что обеспечит настоящую активацию корпоративных данных с нулевым копированием для ИИ. Финансовые результаты сделки остаются нераскрытыми; Учитывая корпоративную динамику Nucleus, тесную синергию с NetApp AIDE и растущий спрос на агентный искусственный интеллект, стоимость покупки, скорее всего, в 4–5 раз превысит общий объем финансирования DataPelago в 75 миллионов долларов. DataPelago будет работать как дочерняя компания NetApp.
Ключевое отличие: Nucleus, KV Cache и NetApp AIDE
1. Дифференциация Nucleus и KV-кэша: Nucleus оптимизирует прием, преобразование и запрос данных перед выводом до того, как данные достигнут серверов графического процессора. KV Cache от Nvidia — это оптимизация памяти внутри графического процессора, активная только после поступления данных на оборудование графического процессора для повышения эффективности генерации токенов. Nucleus ускоряет доставку данных для вычислений; KV Cache оптимизирует время выполнения модели после того, как данные попадают в ускорители.
2. NetApp AIDE против Nucleus UDPE: AIDE — это предварительная обработка ИИ с блокировкой ONTAP/AFX для LLM и агентов, функционирующая как собственный ETL со встроенной векторной базой данных, каталогизацией метаданных, обслуживанием RAG и интеграцией Nvidia AI Enterprise (включая микросервисы векторизации NIM). Nucleus не зависит от хранилища и ускоряет общие рабочие нагрузки Spark/Trino. Интеграция Nucleus с AIDE улучшит конвейеры трансформации, обучения, тонкой настройки и вывода, позволяя ускорить рабочие нагрузки Lakehouse непосредственно в системе хранения данных NetApp AFX; можно предвидеть комплексное комплексное решение AIDE+Nucleus.
CPO NetApp Сьям Наир прокомментировал, что Nucleus обеспечивает программно-определяемое ускорение в хранилище, обеспечивая подготовку данных с нулевым копированием, управление и активацию искусственного интеллекта на центральных и графических процессорах. NetApp управляет большим количеством корпоративных данных, хранящихся в нескольких средах, чем любой другой конкурент, и следующая волна конкурентоспособности искусственного интеллекта зависит от обработки данных в их источнике — команда инженеров DataPelago ускоряет реализацию этой стратегической дорожной карты.
Пекинская компания Qianxing Jietong Technology Co., Ltd.
Сэнди Янг/Директор по глобальной стратегии
WhatsApp/WeChat: +86 13426366826
Электронная почта: yangyd@qianxingdata.com
Веб-сайт: www.qianxingdata.com/www.storagesserver.com.
Бизнес-направление:
Распространение продуктов ИКТ/Системная интеграция и услуги/Инфраструктурные решения
Имея более чем 20-летний опыт распространения ИТ-технологий, мы сотрудничаем с ведущими мировыми брендами, предоставляя надежные продукты и профессиональные услуги.
«Использование технологий для построения интеллектуального мира»Ваш надежный поставщик услуг в сфере ИКТ!