Зображення статті
## Вихідна ситуація: 120 годин ручної роботи щоквартально
Середня фінтех-компанія з командою 50 осіб щоквартально витрачала понад 120 годин на підготовку фінансової звітності: збір даних із 7 різних систем, ручна нормалізація, узгодження цифр між відділами, підготовка PDF-звітів для інвесторів і регулятора. Три аналітики протягом двох тижнів робили роботу, яку ML-пайплайн навчився виконувати за 4 години.
## Архітектура ML-пайплайну
Рішення складається з трьох рівнів.
**Рівень збору даних.** Apache Airflow оркеструє щоденне витягування даних з бухгалтерської системи (1С), CRM (Salesforce), платіжного процесора та банківських API. Дані надходять у сирому вигляді в data lake на S3. Кожне завантаження валідується через Great Expectations: перевіряються схема, діапазони значень та відсутність критичних пропусків.
**Рівень аналізу та NLP.** Тут ML виконує основну роботу. Перша задача — класифікація транзакцій: модель на базі LightGBM з 94% точністю відносить кожну транзакцію до відповідної категорії витрат або доходів згідно з планом рахунків. Друга задача — NLP-аналіз коментарів до транзакцій: fine-tuned BERT-модель виявляє незвичні позначки та автоматично генерує примітки до аномальних записів для включення у звіт.
**Рівень генерації звітів.** На основі структурованих даних Python-скрипт генерує PDF-звіти за затвердженими шаблонами. Jinja2 заповнює фінансові таблиці, Matplotlib генерує динамічні графіки, ReportLab формує фінальний PDF. Звіт автоматично надсилається за списком розсилки.
## NLP-компонент: автоматичні коментарі
Найбільш трудомістка частина ручного процесу — написання пояснювальних коментарів до відхилень від бюджету. Аналітик мав пояснювати кожне суттєве відхилення (більше 10% від плану) людською мовою.
GPT-4o-mini з кастомним промптом отримує структуровані дані про відхилення і генерує коментарі українською мовою: "Перевищення операційних витрат у третьому кварталі на 14% зумовлено позаплановими витратами на юридичні послуги (432 тис. грн) та рекламну кампанію у вересні (215 тис. грн)." Аналітик витрачає 20 хвилин на review та корекцію замість 8 годин на написання.
## Результати впровадження
Час підготовки квартального звіту: з 14 робочих днів до 1 дня (аналітик лише перевіряє та затверджує). Кількість залучених спеціалістів: з 3 до 0.5 (частина робочого часу одного аналітика). Точність класифікації транзакцій: 94% проти 97% при ручному аналізі — різниця виявилась незначною для кінцевої якості звіту. Кількість помилок у звітах: знизилась до нуля (ручний процес давав в середньому 3–5 помилок, що виявлялись на етапі перевірки).
## Інсайти та уроки
Найбільший сюрприз: найскладнішою частиною виявився не ML, а узгодження бізнес-правил класифікації. Два відділи по-різному трактували, до якої категорії відносити певні витрати. Впровадження пайплайну змусило формалізувати ці правила — і це саме по собі мало цінність.
Ризик, який реалізувався: перший квартал після запуску виявив кейс, якого не було у навчальних даних — нестандартна структура транзакції від нового платіжного партнера. Модель класифікувала її некоректно, і аналітик виявив це під час review. Це підкреслило важливість людського контролю навіть після автоматизації.
Подальший план: автоматизація щомісячного управлінського звіту та інтеграція з системою бюджетування для автоматичного прогнозу відхилень від плану.
Стаття в розробці. Підпишіться щоб отримати сповіщення.
Написати нам →#автоматизація#фінтех#NLP#звітність#Airflow
КC
Команда CodeNest
Команда CodeNest
Практикуючий ML-інженер. Спеціалізується на побудові виробничих AI-систем для бізнесу.
🤖
Готові автоматизувати ваш бізнес?
Обговоримо ваш проєкт і запропонуємо оптимальне рішення. Безкоштовна консультація без зобов'язань.