Vista previa generada por IA
Lead Data Engineer LLM/RAG role at UKRSIBBANK BNP Paribas Group, Kyiv. Build, automate, support data pipelines for AI solutions.
Architect ETL/ELT with Airflow, Spark, Prefect; manage Python, SQL, Azure, vector stores, and data governance in a regulated banking environment.
ПРО НАС
ПРО НАС UKRSIBBANK BNP Paribas Group - один з найбільших універсальних банків України. Ми об’єднуємо досвід та креативність у своїй команді, створюючи відкрите та інклюзивне середовище для розвитку кожного працівника. Наші цінності – це відданість, інновації та відкритість, які допомагають нам досягати успіху в сфері банкінгу та робити позитивний вплив на суспільство. Ми дякуємо нашим захисникам та захисницям, які віддано боронять свободу та незалежність України, та створюємо сприятливе середовище для роботи в банку. З 2020 року UKRSIBBANK BNP Paribas Group проходить сертифікацію кращого роботодавця в Україні та Європі – Top Employer. Це єдиний банк в Україні, який має міжнародну сертифікацію Top Employers Institute.
Ми шукаємо Data Engineer із виразним фокусом на LLM / RAG
Ми шукаємо Data Engineer із виразним фокусом на LLM / RAG, який відповідатиме за побудову, автоматизацію та підтримку конвеєрів обробки даних для прикладних AI-рішень у напрямах ETL/ELT, підготовки даних для LLM і RAG (розбір документів, поділ на фрагменти,побудова ембедингів, індексація у векторних сховищах, формування контексту для моделей), журналювання та простежуваності AI-рішень,а також інтеграції з корпоративною платформою даних на базі open-source стеку та сервісів Azure, включно з даними з банківських legacy-систем як одного з важливих джерел. Роль передбачає тісну взаємодію з Solution Architect, командою Data Science, DevMLOps, System Analyst, QA, Security та Compliance з фокусом на побудову надійних, масштабованих і відтворюваних конвеєрів обробки даних для LLM / RAG-рішень корпоративного рівня, що відповідають вимогам управління, контролю та аудиту.
Ключові зони відповідальності
Будувати та підтримувати ETL/ELT-конвеєри обробки даних для AI/ML та LLM-рішень: отримання даних, перетворення, перевірка якості, завантаження, оркестрація через Apache Airflow / Prefect та інтеграція з CI/CD (GitLab CI, Azure DevOps). Будувати та підтримувати конвеєри підготовки даних для RAG і LLM-сценаріїв: розбір документів, поділ на фрагменти (fixed, semantic, recursive), генерація ембедингів, індексація та супровід векторних сховищ (Qdrant, OpenSearch kNN, Milvus), збагачення метаданих, інкрементальні оновлення, формування та контроль якості контексту для моделей. Забезпечувати інфраструктуру журналювання та простежуваності для AI- та LLM-рішень: журналювання прогнозів і взаємодії з LLM (запити, відповіді, токени, затримка), аудит використання моделей, простежуваність походження даних і контексту, а також конвеєри аудиторського сліду для відповідності вимогам та управління даними. Впроваджувати та підтримувати механізми контролю якості даних для AI / LLM-рішень: автоматизовану валідацію даних, керування схемами, контракти даних, виявлення аномалій у потоках даних, контроль якості контексту та звітність щодо якості. Інтегрувати конвеєри даних для AI та LLM із корпоративною платформою даних: Cloudera (CDP/CML), Spark, Hive, HDFS, забезпечуючи безшовний потік даних між корпоративним сховищем даних, банківськими legacy-системами як джерелами даних, конвеєрами пошуку релевантного контексту та компонентами AI-платформи. Будувати та підтримувати шар надання даних: REST / gRPC API (FastAPI), подієво-орієнтовану інтеграцію (Kafka / RabbitMQ), кешування даних (Redis) для забезпечення швидкого доступу до даних і контексту для AI- та LLM-компонентів. Забезпечувати управління даними та відповідність вимогам: документування походження даних, каталогізацію даних, політики зберігання, анонімізацію / псевдонімізацію даних відповідно до GDPR, EU AI Act та банківських вимог. Розробляти та підтримувати документацію для конвеєрів даних: специфікації, схеми потоків даних, словники даних, описи процесів добору контексту, робочі інструкції, визначення SLA та процедури реагування на інциденти.
Обов'язкові навички
Інженерія даних: проєктування та розробка ETL/ELT-конвеєрів, моделювання даних, контроль якості даних, простежуваність даних, пакетна та потокова обробка. Оркестрація: Apache Airflow / Prefect — проєктування DAG, керування залежностями, обробка помилок, моніторинг SLA, сповіщення. Big Data: Apache Spark (PySpark), SQL — для масштабної обробки даних у корпоративному середовищі. Бази даних і сховища: PostgreSQL, OpenSearch / Elasticsearch, Redis, S3 / MinIO / Azure Blob. Python — основна мова для побудови конвеєрів даних, ETL і валідації даних; SQL - для перетворення даних і перевірок якості. CI/CD для Data: інтеграція конвеєрів даних у GitLab CI / Azure DevOps, автоматизоване тестування, контроль версій для коду конвеєрів. Управління даними: документування походження даних, звітність щодо якості даних, керування схемами, контракти даних, розуміння вимог compliance.
Бажаєш дізнатися більше?
Додаткова інформація може бути надана на наступних етапах розгляду вакансії. #veteranfriendly