Міжнародна благодійна організація «Фонд Східна Європа» в межах реалізації швейцарсько-української програми «Електронне урядування задля підзвітності влади та участі громади (EGAP)» оголошує конкурс на відбір інженера/інженерки із супроводу даних StatGPT.
Основний фокус ролі — підключення та супровід статистичних даних на платформі StatGPT. Додатковий фокус — технічний супровід StatGPT, контроль оновлень і координація складних питань із розробниками платформи.
Експерт/експертка буде власником/цею каталогу наборів даних Державної служби статистики України (далі – Держстат) в StatGPT і координатором/кою стабільної роботи платформи. Експерт/експертка супроводжуватиме повний життєвий цикл dataset — від оцінювання SDMX-метаданих і конфігурації до тестування, оновлення та контрольованого виведення — а також забезпечуватиме підтримку користувачів і взаємодію з технічними партнерами.
Ключові завдання
1. Підключення та життєвий цикл наборів даних
• Оцінювати набір до початку робіт: повноту й унікальність назв, англійську та українську локалізацію, ієрархії, щільність даних, атрибути, доступність SDMX API; готувати аргументоване рішення go/no-go.
• Класифікувати виміри як indicator, non-indicator, time або special; визначати required/optional indicator dimensions, packed/unpacked values, default query ranges і синтетичні “all values”.
• Налаштовувати URN, citation, офіційність, displayed/pinned columns, attributes, aliases, indexer settings та інші параметри dataset.
• Запускати індексацію, перевіряти кількість показників і пошукову поведінку, виконувати reindex, deduplication та контролювати auto-update.
• Відстежувати зміни upstream-структур і code lists, коригувати конфігурацію та повторно тестувати набір.
• Ініціювати контрольоване виведення застарілих або замінених наборів лише після погодження з власником даних, оновлення тестів і перевірки, що ключові запити користувачів залишаються покритими.
2. Якість пошуку та регресійне тестування
• Створювати ground truth для запитів: очікуваний dataset, indicators, країна/регіон, період та інші dimension values.
• Покривати single- і multi-indicator, indicator-group, synonym, ambiguous, cross-dataset та multi-turn сценарії українською й англійською мовами.
• Оцінювати результати за precision і recall, повторювати критичні тести та відрізняти системну проблему від нормальної LLM-недетермінованості.
• Локалізувати причину помилки в metadata, dataset configuration, index, SDMX API, моделі або компоненті платформи; виправляти її в межах ролі чи ескалювати з повними доказами.
• Підтримувати regression suite та запускати її після змін конфігурації, upstream-даних, моделі або версії StatGPT.
3. Супровід платформи
• Контролювати щоденну працездатність StatGPT, адміністративного порталу, AI DIAL, бази даних, пошукового індексу та SDMX-інтеграцій; опрацьовувати сповіщення й інциденти.
• Адмініструвати data sources, datasets, channels, glossaries, prompts, доступні інструменти та планові завдання через Admin Portal і затверджені процедури.
• Разом з інфраструктурною командою виконувати планові оновлення Kubernetes/Helm-релізів: перевірка у тестовому середовищі, резервна копія, приймальні тести та rollback-план.
• Аналізувати журнали, API-відповіді та метрики; стежити за актуальністю сертифікатів, секретів, ролей доступу, лімітів зовнішніх API та використанням LLM-ресурсів.
• Підтримувати короткі runbooks, реєстр компонентів і версій, історію змін та відомі обмеження платформи.
4. Нові зовнішні джерела
• Перевіряти structure, data й availability endpoints, версію SDMX, формати відповіді, agency routing, локалізації, продуктивність та обмеження API.
• Налаштовувати стандартні підключення через SDMX Proxy; параметри timeout, retry, rate limiting і кешування погоджувати з інфраструктурною командою.
• Для нестандартної поведінки джерела готувати тестовий приклад і координувати compatibility settings, fixtures або зміни проксі з розробниками.
5. Підтримка користувачів і розвиток
• Консультувати працівників Держстату та зовнішніх користувачів щодо формулювання запитів, вибору показників, фільтрів, джерел, таблиць, графіків і завантаження результатів.
• Готувати короткі інструкції, FAQ, приклади запитів, навчальні матеріали та проводити демонстрації або вебінари.
• Класифікувати звернення, знаходити повторювані проблеми й перетворювати відгуки на зміни metadata, конфігурації, тестів, документації або backlog платформи.
• Взаємодіяти з open-source командою StatGPT(https://github.com/epam/statgpt), МВФ, SDMX-спільнотою та постачальниками даних: створювати якісні issues, надавати кроки відтворення, контролювати виправлення й проводити приймальне тестування.
Необхідні компетенції
Статистика та SDMX
• Базове розуміння статистичної та економічної термінології: національні рахунки, ціни/інфляція, ринок праці, зовнішній сектор та інші тематичні напрями Держстату.
• Уміння відрізнити предметні значення на кшталт “chain-linked volumes” від універсального контексту на кшталт країни або річної частоти — це основа правильної класифікації dimensions.
• Впевнене розуміння dataflow, DSD, dimension, codelist, attribute, URN, annotation і concept scheme; здатність читати DSD і code lists та оцінювати якість metadata.
• Знайомство з КВЕД/NACE/ISIC та ієрархічними класифікаціями.
AI-пошук і QA
• Концептуальне розуміння embeddings, semantic search, keyword/full-text search і named-entity recognition; здатність пояснити, чому показник знаходиться або не знаходиться за запитом.
• Розуміння grounding і недетермінованості LLM; готовність оцінювати якість за серією системних тестів, а не за одним запуском.
• Сильна увага до деталей, дисципліна у використанні checklist, decision framework і документації; уміння формувати ground truth та працювати з precision/recall.
Технічна підготовка
• Практична робота з REST API, YAML, JSON, XML/CSV, базовим SQL та засобами перевірки API.
• Розуміння Linux, Docker, Kubernetes і Helm на рівні виконання типових процедур, перевірки стану сервісів та первинної діагностики.
• Базове написання або адаптація скриптів, бажано Python; впевнена робота з Git/GitHub, issue tracking і технічною документацією.
• Досвід підтримки production-систем, платформ даних, API або QA складних інформаційних систем — орієнтовно від 3 років.
Комунікація та мови
• Вільна українська та англійська не нижче B2: основна технічна документація StatGPT є англомовною, а письмова англійська потрібна для dataset descriptions і зовнішніх ескалацій.
• Уміння зрозуміло пояснювати технічні й статистичні питання нетехнічним користувачам та конструктивно працювати з розробниками й власниками даних.
Буде перевагою
• Досвід із продуктами та методологією Держстату, data quality, metadata management або dissemination офіційної статистики.
• Практична робота з Azure/AKS, PostgreSQL, Elasticsearch, AI DIAL, LLM/RAG або інструментами моніторингу.
• Досвід із IMF, Eurostat, OECD, World Bank, BIS чи іншими SDMX-джерелами.
• Практичне використання ChatGPT, Claude або корпоративних AI-асистентів і розуміння чутливості до промптів та grounding.
Для участі в конкурсі просимо надіслати резюме та /або мотиваційний лист на адресу [email protected] з позначкою «Інженер/ка Держстат» до 01 жовтня 2026 року включно.
Фонд залишає за собою право контактувати лише з відібраними кандидатами.