Зображення статті
## Похоронний дзвін, якого не було
У 2015-2018 роках ентузіасти глибокого навчання активно декларували: нейронні мережі навчаться самостійно витягувати будь-які ознаки з сирих даних, і ручний feature engineering відійде в минуле. Реальність 2025 року виявилась набагато нюансованішою.
Нейронні мережі дійсно автоматизували feature learning у певних доменах: комп'ютерний зір і обробка природної мови тепер вирішуються кінець-в-кінець без ручних ознак. Але для структурованих табличних даних — яких в бізнесі незрівнянно більше — feature engineering залишається одним з найважливіших інструментів data scientist.
## Де нейронні мережі дійсно замінили feature engineering
Для зображень, аудіо і тексту — впевнена перемога нейронних мереж. BERT не потребує ручної токенізації зі збереженням контексту. ResNet витягує ієрархію ознак з пікселів без вказівки людини. Wav2Vec розуміє мову без інженерії спектральних ознак.
У цих доменах ручний feature engineering не лише непотрібний — він активно шкідливий: введення ручних ознак обмежує те, що модель може знайти самостійно.
## Де feature engineering залишається незамінним
### Структуровані табличні дані
Для класичних задач — прогнозування відтоку, кредитний скоринг, прогноз попиту, fraud detection — XGBoost і LightGBM з якісними ознаками стабільно перевершують або збігаються з глибокими мережами. І ця перевага забезпечується саме feature engineering.
Чому? Табличні дані рідко і маленькі (тисячі-сотні тисяч рядків проти мільйонів зображень), і у глибоких мереж просто недостатньо даних для автоматичного feature learning. Крім того, доменна експертиза дозволяє конструювати ознаки, що кодують складні бізнес-правила, які нейромережа навчиться лише на величезному датасеті.
### Часові ряди
Прогнозування попиту, фінансові ряди, IoT-сигнали сенсорів — тут feature engineering залишається ключовим навіть у 2025 році. Лаговані ознаки, ковзні середні, декомпозиція на тренд/сезонність/залишок, calendar features (день тижня, свято, місяць) дають моделі необхідний контекст.
Популярні бібліотеки: tsfresh (автоматична генерація 779+ ознак з часових рядів), featuretools (deep feature synthesis для реляційних даних). Але навіть з автоматичною генерацією доменна інтуїція щодо того, які часові патерни важливі, визначає якість.
### Малі датасети
При обмеженій кількості даних (сотні або тисячі прикладів) feature engineering є критичним способом «вкласти» доменне знання в модель. Fine-tuning BERT потребує мінімум 500-1 000 прикладів. LightGBM на 200 правильно сконструйованих ознаках може показати прийнятний результат вже при 200-500 прикладах.
## Ключові техніки, що залишаються актуальними
### Interaction features
Нейронні мережі теоретично вчаться взаємодіям між ознаками автоматично, але на малих табличних датасетах не завжди встигають. Явне конструювання добутків, відношень і різниць ознак часто дає відчутний приріст.
Приклад для кредитного скорингу: дохід / витрати = coverage ratio. Відокремлено дохід і витрати менш інформативні, ніж їх відношення.
### Temporal features для бізнес-задач
«Кількість днів від останньої покупки» — корисна ознака. Але «кількість днів від останньої покупки відносно середнього для когорти клієнтів з аналогічним профілем» — значно потужніша. Відносні ознаки, що враховують контекст, майже завжди перевершують абсолютні.
### Target encoding з контролем витоку
Target encoding (заміна категорії на середнє значення цільової змінної) — одна з найефективніших технік для категоріальних ознак з великою кількістю значень. Але наївна реалізація призводить до data leakage. Правильний підхід: out-of-fold encoding з кросвалідацією.
### Автоматизовані підходи: AutoML і feature stores
AutoML платформи (H2O AutoML, TPOT, AutoSklearn) поєднують автоматичний feature engineering і вибір моделі. Для стандартних задач вони можуть дати 80-90% від того, що дасть досвідчений data scientist за тиждень ручної роботи — за годину.
Feature stores (Feast, Hopsworks) централізують ознаки між різними ML-моделями організації, виключаючи дублювання обчислень і гарантуючи консистентність між навчанням і inference.
## Практична рамка для прийняття рішень у 2025
Питання не «робити чи не робити feature engineering», а «скільки і якого виду».
Для зображень, аудіо, тексту: мінімальний preprocessing (нормалізація, токенізація), решта — нейронній мережі.
Для табличних даних з багатою доменною експертизою: інвестуйте в feature engineering активно. Правильно сконструйовані ознаки часто дають 5-15% приросту метрик порівняно з сирими даними.
Для часових рядів: обов'язковий набір calendar features, лагових ознак і rolling statistics. Далі — за потребою.
Для малих датасетів (менше 5 000 прикладів): feature engineering критичний незалежно від типу даних.
Hybrid підхід: навчена нейромережа як feature extractor + XGBoost або LightGBM на вилучених ознаках. Часто перевершує обидва підходи окремо на середніх датасетах.
Передчасна відмова від feature engineering заради «чистого deep learning» без урахування розміру датасету і доменної специфіки — одна з найпоширеніших помилок, що призводить до гірших production-результатів.
Стаття в розробці. Підпишіться щоб отримати сповіщення.
Написати нам →#ML стратегія#feature engineering#data science
ІП
Іван Полтавець
Команда CodeNest
Практикуючий ML-інженер. Спеціалізується на побудові виробничих AI-систем для бізнесу.
🤖
Готові автоматизувати ваш бізнес?
Обговоримо ваш проєкт і запропонуємо оптимальне рішення. Безкоштовна консультація без зобов'язань.