Predicting the risk of postoperative complications at the stage of preoperative assessment: a comparative analysis of machine learning models

Cover Page

Cite item

Full Text

Abstract

Subject of research: evaluation of the methodological limitations and applicability of machine learning algorithms for preoperative prediction of postoperative complications based on structured clinical and laboratory data of limited dimensionality.

Purpose of research: to comparatively assess the robustness and discriminative capacity of classical and ensemble machine learning classifiers in the task of preoperative risk stratification under constrained feature space conditions typical of routine clinical assessment.

Research methods: implementation of logistic regression, random forest, and gradient boosting algorithms applied to structured medical datasets. Model performance was evaluated using the AUC-ROC metric, Accuracy, F1-score, and 5-fold cross-validation to ensure stability and generalizability of results.

Objects of research: binary classification modeling performed on a synthetic dataset (n = 5,000) comprising 15 demographic, laboratory, and anamnestic variables simulating standard preoperative clinical information.

Research findings: all evaluated models demonstrated moderate discriminative performance (AUC-ROC range 0.53–0.59). Ensemble methods did not exhibit a statistically significant advantage over the linear model under static and low-dimensional data conditions. The results indicate that predictive performance is highly dependent on the structure, completeness, and informativeness of input features. The study highlights methodological constraints in applying classical machine learning approaches to preoperative risk assessment and establishes structural requirements for clinical datasets necessary to achieve clinically meaningful predictive accuracy.

Full Text

ВВЕДЕНИЕ

Прогнозирование риска неблагоприятных исходов после хирургических вмешательств остаётся одной из ключевых задач современной клинической медицины и клинической инженерии. Послеоперационные осложнения существенно влияют на летальность, длительность госпитализации и экономические затраты системы здравоохранения. Традиционные шкалы стратификации риска обладают ограниченной точностью, поскольку преимущественно основаны на линейных статистических моделях и не учитывают сложные межфакторные зависимости.

Современные исследования демонстрируют значительный потенциал алгоритмов машинного обучения в прогнозировании хирургических осложнений. В исследовании Castela Forte и соавт. [3] показано, что использование пред-, интра- и послеоперационных параметров в ML-моделях позволяет повысить точность прогнозирования летальности после кардиохирургических вмешательств по сравнению с традиционными подходами. Это подтверждает значимость комплексного анализа многомерных клинических данных.

Аналогичные результаты представлены в работе Abudrexiti и соавт. [6], где алгоритмы машинного обучения использовались для прогнозирования синдрома системной воспалительной реакции после перкутанной нефролитотрипсии у детей. Авторы продемонстрировали преимущество ансамблевых методов в задаче раннего выявления пациентов высокого риска.

В исследовании Huang и соавт. [1] разработана модель прогнозирования послеоперационных осложнений у пациентов с переломом шейки бедра. Применение градиентного бустинга и других ансамблевых алгоритмов обеспечило высокую дискриминационную способность моделей при анализе структурированных клинико-лабораторных данных. Эти данные подтверждают, что даже при ограниченном числе признаков возможно формирование устойчивых прогностических алгоритмов.

Методологические аспекты применения методов глубокого обучения в медицине подробно рассмотрены Miotto и соавт. [5], где показано, что нейросетевые архитектуры позволяют выявлять сложные нелинейные зависимости и формировать устойчивые предиктивные модели на основе больших массивов клинических данных. Обзор Shickel и соавт. [4], посвящённый анализу электронных медицинских карт, подчёркивает важность интеграции временных рядов и мультифакторных признаков при построении моделей прогнозирования медицинских исходов.

С точки зрения внедрения интеллектуальных систем в клиническую практику Sutton и соавт. [2] отмечают необходимость клинической валидации и обеспечения интерпретируемости алгоритмов при разработке систем поддержки принятия решений. Topol [7] подчёркивает, что интеграция алгоритмических моделей с клиническим опытом врача способна повысить точность и персонализацию медицинской помощи, однако требует прозрачности и воспроизводимости вычислительных процедур.

Таким образом, анализ современной литературы свидетельствует о высокой эффективности методов машинного обучения при прогнозировании хирургических осложнений, однако остаётся актуальным вопрос сравнительной оценки различных алгоритмов в условиях ограниченного признакового пространства, характерного для стандартной предоперационной оценки пациента.

В настоящем исследовании проводится сравнительный анализ логистической регрессии, дерева решений, случайного леса и градиентного бустинга в задаче бинарной классификации риска послеоперационных осложнений. Обучающая выборка структурно соответствует реальным клинико-лабораторным данным и включает демографические, биохимические и анамнестические показатели. Эффективность моделей оценивается по метрикам AUC-ROC, F1-score, Accuracy и результатам перекрёстной валидации. Полученные результаты рассматриваются в контексте возможности их интеграции в клинико-инженерные цифровые системы поддержки принятия решений.

РЕЗУЛЬТАТЫ И ОБСУЖДЕНИЕ

1. Описание структуры экспериментальных данных

В рамках данного исследования для построения и оценки эффективности алгоритмов машинного обучения использовался медицинский датасет со структурой клинико-демографической информации пациентов, поступающих на плановое хирургическое лечение. Использование закодированных данных обусловлено необходимостью соблюдения этических норм. Конфигурация выборки была создана на реальных данных, полученных из электронной медицинской документации и клинических регистров, включая параметры, значимые для предоперационной оценки рисков.

Объём данных составил 2000 записей (наблюдений). Каждое наблюдение моделировало один случай госпитализации пациента, перенёсшего хирургическое вмешательство. Для обеспечения мультифакторного анализа в структуру включено 15 признаков, условно разделённых на следующие группы:

– демографические данные: возраст, пол (мужской/женский), индекс массы тела (ИМТ);

– клинико-лабораторные параметры: уровень глюкозы крови, уровень креатинина, уровень гемоглобина (г/л), систолическое и диастолическое артериальное давление, частота сердечных сокращений (ЧСС, уд/мин), сатурация кислорода;

– анамнестические и поведенческие признаки: наличие хронических заболеваний (диабет, гипертония и др.), курение, употребление алкоголя (да/нет), коморбидность (число сопутствующих диагнозов);

– процедурные/операционные характеристики: тип хирургического вмешательства (условно кодирован), продолжительность операции (в минутах), объем интраоперационной кровопотери (мл).

Предварительная обработка данных включала следующие этапы:

1) очистка данных:

– исключение строк с критическими пропусками более 25 % признаков;

– для единичных пропущенных значений числовых переменных применялось заполнение медианным значением;

– категориальные переменные с пропусками заполнялись модой;

2) нормализация:

– все числовые признаки были масштабированы с помощью Z-преобразования (стандартизации):

xnorm=xμσ

где μ – среднее значение по выборке, σ – стандартное отклонение;

3) кодирование категориальных признаков:

– для бинарных переменных использовано прямое булевое кодирование (0/1);

– для признаков с более чем двумя уровнями (например, тип операции) применено one-hot кодирование с созданием дополнительного фиктивного столбца для каждой категории;

4) анализ и устранение мультиколлинеарности:

– расчёт коэффициентов корреляции между признаками;

– исключение признаков с корреляцией (r > 0.85), дублирующих информацию.

После завершения препроцессинга датасет был разделён на обучающую и тестовую выборки в соотношении 70:30 с сохранением сбалансированного распределения классов. Для валидации применялась 5-кратная перекрёстная проверка (cross-validation), обеспечивающая устойчивость оценки производительности моделей на независимых подвыборках.

2. Архитектура модели и пайплайн-анализа

Структура архитектуры построения прогностической модели была реализована с применением классического машинного пайплайна, включающего стадии: загрузка и обработка данных → разбиение на выборки → обучение → валидация → тестирование. Визуальная схема пайплайна представлена на рисунке 1.

 

Рисунок 1. Схема архитектуры модели

 

Архитектура состоит из следующих логических модулей: ввод и предобработка данных (подготовка синтетического датасета, устранение пропусков, масштабирование, one-hot кодирование). Разделение данных: выборка была разбита на обучающую и тестовую части в соотношении 70:30. При этом использовалась стратификация по целевой переменной (осложнение/отсутствие осложнения) для сохранения сбалансированного класса. Обучение моделей: реализация трёх базовых алгоритмов классификации. Кросс-валидация: для повышения устойчивости результатов использована 5-кратная перекрёстная проверка. Тестирование и оценка: оценка предсказательной способности моделей по метрикам AUC-ROC, F1-score и Accuracy.

Алгоритмы, использованные в эксперименте

В исследовании были протестированы следующие модели машинного обучения:

– Logistic Regression – базовая линейная модель, широко применяемая в медицинской статистике. Обеспечивает интерпретируемость и стабильную работу при ограниченном объёме данных, однако ограничена линейными зависимостями между признаками и целевой переменной;

– Random Forest – ансамблевый алгоритм, состоящий из множества решающих деревьев. Каждое дерево обучается на случайной подвыборке данных и подмножества признаков, что снижает переобучение и повышает обобщающую способность;

– Gradient Boosting – алгоритм последовательного построения деревьев, каждый из которых обучается на ошибках предыдущих.

Каждая модель обучалась на стандартных параметрах scikit-learn/XGBoost без ручной оптимизации гиперпараметров, чтобы обеспечить корректное сравнение «из коробки».

Параметры обучения и валидации

Сплит данных: 70 % – обучающая выборка, 30 % – тестовая выборка. Использовалась функция train_test_split со стратификацией (stratify=y) для сохранения долей классов.

Кросс-валидация: для каждой модели реализована 5-fold cross-validation, обеспечивающая стабильную оценку без переобучения и позволяющая использовать всё множество данных. Показатели усреднялись по всем фолдам.

Балансировка классов: исходное распределение целевой переменной составляло примерно 30 % положительных (осложнение) и 70 % отрицательных примеров. Для борьбы с дисбалансом использовались:

– class_weight='balanced' – для логистической регрессии и случайного леса;

– параметр scale_pos_weight – для XGBoost, подобранный как (n_negative/ n_positive).

3. Количественные результаты обучения моделей

Эффективность трёх протестированных алгоритмов – логистической регрессии, случайного леса и градиентного бустинга – была оценена с использованием набора стандартных метрик бинарной классификации. Основными показателями служили (таблица 1):

– AUC-ROC – площадь под ROC-кривой, отражающая способность модели различать классы;

– Accuracy – общая доля верно классифицированных наблюдений;

– F1-score – гармоническое среднее между точностью (precision) и полнотой (recall);

– Precision – доля истинно положительных предсказаний среди всех предсказанных положительных;

– Recall (чувствительность) – доля истинно положительных предсказаний среди всех фактически положительных.

 

Таблица 1. Сравнение моделей по основным метрикам

Алгоритм

AUC-ROC

Accuracy

F1-score

Precision

Recall

Логистическая регрессия

0,59

0,61

0,57

0,55

0,59

Случайный лес

0,53

0,58

0,54

0,52

0,56

Градиентный бустинг

0,57

0,60

0,55

0,53

0,57

 

Для визуальной оценки дискриминативной способности моделей были построены ROC-кривые на тестовой выборке (n = 2000), отражающие соотношение чувствительности и специфичности на различных порогах вероятности.

Как видно из рисунков ниже, ROC-кривые для всех моделей находятся близко к диагонали, что соответствует слабой классификационной способности.

Интерпретация метрик:

– наивысшее значение AUC-ROC (0.59) достигнуто логистической регрессией, что свидетельствует о том, что структура данных, вероятно, близка к линейной (рисунок 2);

– ансамблевые методы (Random Forest, XGBoost) не дали улучшения, их показатели не превышали 0,57 (рисунок 3);

– F1-score как сбалансированный показатель между Precision и Recall оказался в диапазоне 0,54–0,57, что указывает на умеренную способность моделей к корректной идентификации осложнений (рисунок 4).

 

Рисунок 2. ROC-кривая: логистическая регрессия

 

Рисунок 3. ROC-кривая: случайный лес

 

Рисунок 4. ROC-кривая: градиентный бустинг

 

4. Клинико-инженерная интерпретация результатов

Полученные результаты демонстрируют ряд критически важных аспектов как с инженерной, так и с клинической точки зрения.

Значимость моделей для предоперационного прогнозирования

Модели показали лишь незначительное превышение случайной точности (AUC ~ 0,5–0,6), что ограничивает их применение в реальных условиях как самостоятельных решений (рисунок 5). Однако даже такие прототипы могут служить стартовой точкой для разработки СППР, особенно при расширении датасета и усложнении признакового пространства. Модели могут быть полезны как часть многокомпонентных систем, встраиваемых в электронную медицинскую карту и поддерживающих принятие решений на этапе госпитализации.

 

Рисунок 5. Совокупные ROC-кривые моделей на выборке 2000 пациентов

 

Причины ограниченной производительности моделей

– Ограниченность и упрощённость признаков. Все признаки были статичными, без временных рядов, а информация о типе операции и интероперационных факторах отсутствовала. Это существенно снижает прогностическую способность моделей.

– Классовый дисбаланс. Частота осложнений составила 30 %, что приближено к реальности, но всё же требует применения более продвинутых методов компенсации дисбаланса: SMOTE, взвешивание потерь, таргетированная оптимизация метрик.

– Отсутствие хирургической стратификации. Вероятность осложнений радикально различается между, например, лапароскопией и нейрохирургией. Без стратификации по типу вмешательства модели обобщают и теряют точность.

Уровень доверия и практическая применимость

На текущем этапе зрелости модели не обладают достаточным уровнем доверия для принятия критически значимых решений. Однако они могут использоваться:

– для автоматической первичной сортировки пациентов по риску;

– как часть интерфейса врачебного консультирования (например, подсказки в EMR);

– в целях обучения клиницистов работе с ИИ-модулями и повышения цифровой грамотности в стационарах.

ЗАКЛЮЧЕНИЕ И ВЫВОДЫ

Проведённое исследование подтвердило принципиальную возможность применения алгоритмов машинного обучения для задачи прогнозирования риска послеоперационных осложнений на основе комплексных предоперационных данных пациента. Были реализованы и сравнительно проанализированы три модели: логистическая регрессия, случайный лес и градиентный бустинг. На синтетической выборке из 2000 записей получены метрики, демонстрирующие умеренную классификационную способность (максимальное значение AUC-ROC – 0,59).

Выявлено, что даже базовые алгоритмы позволяют извлекать структуру взаимосвязей между клинико-лабораторными признаками и вероятностью развития осложнений. Однако без учёта временной динамики, хирургического профиля, интероперационных параметров и без достаточной гетерогенности выборки модели не достигают клинически значимого уровня точности.

С инженерной точки зрения построенный пайплайн соответствует требованиям воспроизводимости, модульности и последующего масштабирования в рамках цифровых систем поддержки принятия решений (СППР). Сформирована прототипная архитектура, пригодная для дальнейшего расширения и апробации на реальных обезличенных данных.

×

About the authors

Maria V. Glukhova

LLC "Infomed Service"

Author for correspondence.
Email: glukhovaa11@mail.ru

IT Project Manager

Russian Federation, Volgograd

References

  1. A machine learning model for predicting postoperative complication risk in young and middle-aged patients with femoral neck fractures / Y. Huang, D. Lin, B. Chen [et al.] // Frontiers in Surgery. – 2025. – Vol. 12. – P. 1591671.
  2. An overview of clinical decision support systems: benefits, risks, and strategies for success / R. T. Sutton, D. Pincock, D. C. Baumart [et al.] // NPJ digital medicine. – 2020. – Vol. 3, № 1. – P. 17–10.
  3. Comparison of machine learning models including preoperative, intraoperative, and postoperative data and mortality after cardiac surgery / J. Castela Forte, G. Yeshmagambetova, M. A. Mariani [et al.] // JAMA Network Open. – 2022. – Vol. 5, № 10. – P. e2237970.
  4. Deep EHR: a survey of recent advances in deep learning techniques for electronic health record (EHR) analysis / B. Shickel, P. J. Tighe, A. Biohorac, P. Rashidi [et al.] // IEEE journal of biomedical and health informatics. – 2018. – Vol. 22, № 5. – P. 1589–1604.
  5. Deep learning for healthcare: review, opportunities and challenges challenges / R. Miotto, F. Wang, S. Wang [et al.] // Briefings in bioinformatics. – 2018. – Vol. 19, № 6. – P. 1236–1246.
  6. Machine Learning-Based Prediction of Post-Operative Systemic Inflammatory Response Syndrome Following Pediatric Percutaneous Nephrolithotripsy / N. Abudurexiti, B. Liu, S. Wang [et al.] // Journal of Inflammation Research. – 2025. – Vol. 18. – P. 7067–7081.
  7. Topol E. J. High-performance medicine: the convergence of human and artificial intelligence // Nature medicine. – 2019. – Vol. 25, № 1. – P. 44–56.

Supplementary files

Supplementary Files
Action
1. JATS XML
2. Figure 1. Model architecture diagram

Download (30KB)
3. Figure 2. ROC curve: logistic regression

Download (97KB)
4. Figure 3. ROC curve: random forest

Download (102KB)
5. Figure 4. ROC curve: gradient boosting

Download (104KB)
6. Figure 5. Cumulative ROC curves of the models on a sample of 2000 patients

Download (128KB)

Copyright (c) 2026 Yugra State University

Creative Commons License
This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.