AI в AML-контроле: как построить ВКР на кейсе Commerzbank и Hawk
Поддомен: AI/ML | Роль: Data/ML-инженер
В марте 2026 года Commerzbank, один из крупнейших банков Германии, объявил о партнёрстве с Hawk AI для усиления AML-контроля (Anti-Money Laundering) с помощью искусственного интеллекта. Для студента ИТ-специальности это не просто новость — это готовый каркас дипломного проекта. Тренд на внедрение ML в финансовый комплаенс даёт конкретную задачу: спроектировать систему автоматического выявления подозрительных транзакций. В этой статье я покажу, как превратить этот кейс в защищённую ВКР — от формулировки тем до метрик и нормоконтроля.
Три направления для диплома на базе AI-комплаенса
В зависимости от вашего профиля и требований вуза, можете выбрать одну из тем. Каждая опирается на реальный бизнес-кейс и даёт место для инженерной реализации.
| Тема ВКР | Актуальность (отсылка к статье) | Цель | Задачи (3–4) | Структура глав |
|---|---|---|---|---|
| Разработка ML-модели для выявления подозрительных транзакций в банковской системе | Commerzbank внедряет AI в AML — это подтверждает спрос на такие решения. Ваша работа может быть прототипом для малого банка. | Построить и оценить модель классификации транзакций (подозрительная / легитимная) с показателями precision ≥ 0,9 и recall ≥ 0,85. |
1. Анализ методов AML (rule‑based vs ML). 2. Сбор и разметка синтетических данных (транзакции). 3. Обучение моделей (LogReg, Random Forest, GBDT). 4. Оценка метрик (ROC‑AUC, F1) и развёртывание как микросервиса. |
Гл.1 – AML и AI: обзор, стандарты (FATF, ISO 20022). Гл.2 – Проектирование и реализация модели. Гл.3 – Тестирование и оценка экономической эффективности. |
| Архитектура AI-сервиса комплаенса с потоковой обработкой (Kafka + MLflow) | Hawk AI предоставляет облачный сервис; ваша работа может повторить архитектуру на open‑source стеке. | Спроектировать отказоустойчивую систему реального времени для мониторинга транзакций. |
1. Выбор C4‑диаграммы компонентов. 2. Настройка конвейера (Kafka → Spark Structured Streaming → модель). 3. Версионирование модели (MLflow). 4. Развёртывание в Kubernetes. |
Гл.1 – Требования к архитектуре (ISO/IEC 25010). Гл.2 – Проектирование (C4, BPMN). Гл.3 – Реализация и нагрузочное тестирование. |
| Оценка эффективности внедрения ML‑модели в AML (TCO / ROI) | Банки (Commerzbank) мотивированы снижать издержки на ручной анализ. Покажите экономический эффект. | Рассчитать TCO и ROI от замены rule‑based системы на ML для выборки из 1 млн транзакций. |
1. Анализ затрат на инциденты (ложные срабатывания, ручная проверка). 2. Построение модели оценки (PR-кривая, cost‑benefit). 3. Формулы расчёта (NPV, IRR). 4. Оформление по ГОСТ 34 (экономический раздел). |
Гл.1 – Метрики эффективности (FPR, FNR). Гл.2 – Модель расчёта. Гл.3 – Эксперимент с синтетическими данными. |
Как встроить новость в текст ВКР
Статья о партнёрстве — сильный аргумент для первой главы (обоснование актуальности). Можно процитировать: «В 2026 году Commerzbank выбрал Hawk AI для автоматизации AML — это доказывает, что отрасль готова к ML». Далее во второй главе покажите, как такой сервис мог бы быть спроектирован. Пример типовой архитектуры:
# Псевдокод конвейера (Spark + модель)
from pyspark.sql import SparkSession
from pyspark.ml.classification import RandomForestClassificationModel
spark = SparkSession.builder.appName("aml_monitor").getOrCreate()
stream = spark.readStream.format("kafka") \
.option("kafka.bootstrap.servers", "localhost:9092") \
.option("subscribe", "transactions") \
.load()
model = RandomForestClassificationModel.load("models/rf_aml_v3")
predictions = model.transform(stream)
predictions.writeStream.outputMode("append").format("console").start().awaitTermination()
Для диаграмм используйте C4 (контейнеры) в третьей главе — это соответствует ГОСТ 34. Например, контейнер “ML‑сервис” с моделью, обученной на Spark, и API на FastAPI. Не забудьте про метрики: ROC‑AUC, Precision‑Recall, F1. Если вуз требует расчёт эффективности, приведите таблицу с экономией на False Positive (каждый ложный вызов отнимает 30 минут у аналитика).
Метрики, которые стоит считать
- True Positive Rate (Recall) — доля выявленных подозрительных транзакций. Цель ≥ 0,9.
- Precision — доля верных срабатываний среди всех срабатываний. Важно, чтобы не завалить аналитиков ложными тревогами.
- F1 Score — гармоническое среднее. Для AML часто используют F2, так как пропуск преступления опаснее ложной тревоги.
- Cost per Alert — стоимость одного срабатывания (ручная проверка + время системы).
Чему вы научитесь, реализовав эту тему
- Проектировать архитектуру ML-сервиса (Kafka, Spark, MLflow, Kubernetes).
- Оценивать модели по бизнес-метрикам (cost per alert, ROI).
- Оформлять ТЗ и пояснительную записку по ГОСТ 34.
- Работать с синтетическими данными (генерация транзакций).
- Готовить защитную речь с упором на практический результат.
FAQ: ответы на частые вопросы
Где взять реальные данные для обучения модели AML?
Используйте синтетические датасеты: IBM AML dataset или сгенерируйте сами с помощью Python (библиотека Faker + правила аномалий). В дипломе укажите, что данные соответствуют формату ISO 20022.
Требуют ли в вузе код в приложении? Как его оформлять?
Да, обычно листинг ключевых модулей (до 10 страниц). Оформляйте в виде приложения с нумерацией строк. Не копируйте весь проект — только ядро: загрузка данных, обучение, предсказание. Укажите ссылку на GitHub.
Как рассчитать экономический эффект, если нет реальных цифр?
Используйте модель с допущениями: средняя з/п аналитика, время на обработку одного алерта, стоимость ложного пропуска. Все допущения обоснуйте в работе — это примет научный руководитель. Пример: «Предположим, что в месяц обрабатывается 1000 тревог, 80% из них ложные; стоимость одного ложного срабатывания — 15 минут работы аналитика». Далее считаете экономию времени.
Можно ли обойтись без Kubernetes? Слишком сложно.
Да, для диплома достаточно развернуть модель как REST API на Flask/FastAPI на локальной машине или в Docker. Kubernetes можно описать в перспективах развития. Но если вуз требует «облачных технологий», используйте простой кластер Minikube — это несложно.
✅ Чек-лист «Что проверить перед сдачей»
- Ссылка на статью Commerzbank + Hawk AI в списке литературы (оформлена по ГОСТ Р 7.0.5).
- Задачи ВКР соответствуют выводам (проверьте логическую цепочку).
- Архитектура нарисована в одной из нотаций (C4, UML, BPMN) — не скриншот из Paint.
- Метрики модели (F1, ROC-AUC) представлены в виде таблицы или графика.
- Расчёты экономии (TCO/ROI) выполнены с допущениями и формулами.
- Уникальность текста > 70% (проверить через Антиплагиат.ВУЗ).
- Приложение с кодом содержит не менее 100 строк и прокомментировано.
🔥 Типичные ошибки и как их избежать
Ошибка 1: Модель показывает 99% accuracy, но на практике не работает — дисбаланс классов. Решение: Используйте Precision-Recall кривую, а не accuracy. В дипломе объясните, почему для AML важен recall.
Ошибка 2: Код работает только на вашем ноутбуке — нет инструкции по развёртыванию. Решение: Сделайте Dockerfile и docker-compose.yml, добавьте описание в раздел «Реализация».
Ошибка 3: Ссылки на статью нет или она оформлена как «[1]» без анализа. Решение: Процитируйте новость во введении и покажите, как ваш проект продолжает этот тренд.
Если вам нужно уложиться в 120 часов работы над ВКР, но не хватает времени на отладку модели или оформление по ГОСТ — наши эксперты помогут. Бесплатная консультация по выбору темы и первичная проверка плана. Обращайтесь — поможем с любой темой в AI/ML.
Источник: NEWS: Commerzbank partners with Hawk on AI compliance tech (опубликовано 2026-03-13)