LIVE

Кредитный скоринг заемщика: какие данные анализирует ИИ

Кредитный скоринг заемщика строится вокруг вероятности дефолта. В банковской практике дефолтом считается просроченная задолженность более 90 дней подряд в течение 12 месяцев с момента выдачи кредита. Алгоритм оценивает не только текущий доход и записи в БКИ.

Макар Литвинов·Обновлено: 16 сентября 2026 г.·11 мин

Кредитный скоринг заемщика: какие данные анализирует ИИ

В модель поступают транзакции, долговая нагрузка, движение средств по счетам, параметры заявки и связанные поведенческие признаки.

Решение формируется быстро. В крупных системах обработка заявки занимает секунды. Скорость достигается не за счёт одной нейросети. Работает конвейер: сбор данных, нормализация, генерация признаков, расчёт вероятности дефолта, проверка на мошенничество, применение кредитной политики.

Точный состав факторов и их вес банки не раскрывают. Проприетарные формулы относятся к коммерческой тайне. Общая архитектура известна. Классические модели постепенно заменяются градиентным бустингом, гибридными нейросетями и системами Big Data.

Эволюция алгоритмов: от анкеты к динамическому профилю

Классический кредитный скоринг использовал статические признаки: возраст и регион проживания, размер дохода, стаж и тип занятости, семейное положение, количество действующих кредитов, просрочки в кредитной истории, сумму и срок запрашиваемого займа. Для обработки таких данных применялись линейная и логистическая регрессия. Каждому фактору назначался вес. Модель рассчитывала итоговую вероятность события: например, дефолта в течение заданного периода.

Такая схема удобна для контроля. Её параметры можно интерпретировать. При изменении входного фактора видно, как меняется результат. Но регрессионная модель плохо работает с нелинейными зависимостями и большим количеством взаимосвязанных признаков. Заёмщик может иметь высокий доход, но одновременно использовать несколько кредитных карт, регулярно снимать наличные и направлять почти весь денежный поток на погашение долгов. Простая сумма показателей не отражает структуру нагрузки. Нужен анализ последовательностей и взаимосвязей.

Современный кредитный скоринг заемщика использует несколько классов моделей:

ПодходКакие данные обрабатываетОграничение
Логистическая регрессияСтатические параметры анкеты, БКИ, доходПлохо отражает нелинейные зависимости
Деревья решений и градиентный бустингТабличные данные, транзакционные признаки, взаимодействия факторовТребует контроля переобучения и качества признаков
Нейросетевые моделиПоследовательности транзакций, поведение клиента, сложные связиСложнее объяснить результат
Графовые нейронные сетиСвязи между клиентами, счетами, устройствами и операциямиВысокая чувствительность к качеству графа
Гибридный контурБКИ, транзакции, поведенческие данные, антифродСложная эксплуатация и аудит решений

Градиентный бустинг часто используется для табличных данных. Он строит последовательность деревьев, каждое из которых исправляет ошибки предыдущих. В результате модель видит комбинации признаков, которые неочевидны при раздельном анализе. Нейросеть нужна там, где присутствует последовательность. Сам факт наличия операций по карте малоинформативен. Значение имеет порядок событий: получение зарплаты, переводы, оплата обязательств, снятие наличных, возврат средств. Эти цепочки можно преобразовать в признаки или передать в модель, способную анализировать временную структуру.

Скоринг оценивает не «хорошего» или «плохого» клиента. Он оценивает вероятность конкретного события при заданных данных и горизонте наблюдения.

Архитектура данных: что видит модель

Банковский алгоритм не получает человеческий портрет заёмщика. На вход поступает набор полей, признаков и связей между ними. Данные проходят несколько этапов обработки.

Сначала система проверяет идентичность клиента и качество источников. Затем приводит значения к единому формату. Доходы могут поступать из анкеты, выписки по счёту и внешних источников. Эти значения не всегда совпадают. Модель должна определить устойчивый диапазон, а не механически выбрать одну цифру.

Следующий уровень — feature engineering, то есть генерация признаков. Сырые операции превращаются в параметры, пригодные для расчёта:

  • средний входящий денежный поток за период;
  • регулярность поступлений;
  • отношение платежей по долгам к доступному доходу;
  • доля обязательных расходов;
  • количество операций за период;
  • изменение расходов по месяцам;
  • частота использования кредитного лимита;
  • количество запросов кредитной истории;
  • задержки по предыдущим обязательствам;
  • наличие резких изменений финансового поведения.

Большая часть этих показателей не фиксируется в анкете. Они выводятся из истории операций. Один и тот же доход может иметь разный риск-профиль. Зарплата, поступающая регулярно от одного работодателя, отличается от набора нерегулярных переводов. У модели есть возможность учитывать не только сумму, но и стабильность потока.

Бюро кредитных историй

БКИ остаётся базовым источником. В кредитной истории отражаются действующие и закрытые обязательства, платежная дисциплина, количество запросов и сведения о просрочках. Алгоритм использует эти данные не изолированно. Высокая долговая нагрузка не равна автоматическому отказу. Модель сопоставляет её с доходом, сроками погашения и поведением по предыдущим договорам. Заёмщик с несколькими закрытыми кредитами без просрочек и клиент с тем же количеством активных обязательств имеют разные профили.

В России персональный кредитный рейтинг выражается по шкале от 1 до 999 баллов. Диапазон 800–999 считается высоким и связан с высокой вероятностью одобрения займа. Это не гарантия выдачи. Банк применяет собственную модель, продуктовые ограничения, лимиты и процедуры проверки. Сам рейтинг не раскрывает формулу банковского решения. Он показывает результат оценки по методике конкретного бюро. Внутренний скоринг может учитывать дополнительные транзакционные и поведенческие признаки, недоступные в публичной шкале.

Транзакционные признаки

Движение средств по карте или расчётному счёту формирует временной ряд. Для модели имеет значение не только наличие поступлений, но и их распределение. Система может выделять регулярные платежи, повторяющиеся категории расходов, переводы между собственными счетами и операции с кредитными продуктами. В корпоративном сегменте анализируется денежный поток по расчётному счёту, обороты и цикличность поступлений.

Здесь есть техническое ограничение. Транзакция сама по себе не объясняет назначение платежа. Перевод между физическими лицами может быть зарплатой, возвратом долга или разовой помощью. Поэтому признаки строятся на совокупности операций и истории, а не на одном событии. Кроме того, при смене банка модель теряет часть наблюдений: новый кредитор видит только ту историю, которую заёмщик принёс с собой в виде переводов и внешних подтверждений.

Альтернативные источники и цифровой след

Альтернативные данные дополняют БКИ. К ним относятся транзакции по картам и расчётным счетам, данные телеком-операторов, активность в сети и технические параметры взаимодействия с сервисом. Использование таких источников не означает, что решение строится только на цифровом следе. Кредитная история и финансовые показатели остаются частью контура. Альтернативные данные расширяют наблюдение там, где традиционной информации недостаточно.

Для клиента без длинной кредитной истории это может иметь значение. У банка меньше записей о прошлых займах. Тогда модель анализирует доступные финансовые потоки и поведенческие характеристики. При этом качество прогноза зависит от полноты и корректности данных. Неполный цифровой след работает как неполная анкета: модель видит часть картины и принимает решение с большей неопределённостью.

Что может анализироваться

В набор признаков способны входить:

  • стабильность платежного поведения;
  • регулярность пополнений;
  • частота использования разных платёжных инструментов;
  • соотношение собственных и заёмных средств;
  • типичные категории расходов;
  • динамика остатка на счёте;
  • повторяемость операций;
  • связь между устройством, аккаунтом и заявкой;
  • сетевые связи между клиентами и финансовыми операциями.

Графовые нейронные сети используются для анализа связей. Узлами графа могут выступать клиенты, счета, устройства или операции. Рёбрами становятся переводы, общие технические атрибуты и иные подтверждённые связи. В антифроде такая архитектура позволяет находить группы связанных заявок. Несколько аккаунтов могут использовать одни устройства, номера или платёжные реквизиты. Само совпадение не доказывает нарушение. Оно повышает приоритет дополнительной проверки.

Социальные связи также могут учитываться в графовой модели. Но это не означает автоматического переноса риска с одного человека на другого. Алгоритм анализирует структуру и плотность связей, а не выносит вывод на основании одного общего контакта. Связь через дальнего родственника или бывшего коллегу не равнозначна совместному бизнесу.

Данные телеком-операторов

Телематические признаки могут описывать стабильность номера, длительность его использования и параметры взаимодействия с сервисом. Они применяются в основном как дополнительные сигналы идентификации и антифрода. Доступность конкретных данных зависит от правового основания, согласий, договоров между участниками и внутренних политик банка. Универсального списка, одинакового для всех кредитных организаций, нет.

Оценка цифрового следа также несёт риск ошибок. Один телефон могут использовать несколько членов семьи. Клиент может сменить устройство, оператора или адрес сети. Редкая активность в интернете не является доказательством неплатёжеспособности. Модель должна учитывать контекст и качество сигнала. Именно поэтому телематические и поведенческие данные обычно входят в ансамбль с весом, меньшим, чем у финансовых показателей.

Машинное обучение в скоринге: заявлено и по факту

Маркетинговые описания часто сводят ИИ к формуле: больше данных, выше точность. Архитектура сложнее. Дополнительный источник не всегда улучшает модель. Шумные или смещённые данные способны ухудшить результат.

ЗаявленоПо факту
Модель анализирует больше источниковБольше источников означает больше требований к очистке, синхронизации и правовому контролю
Нейросеть быстрее принимает решениеСкорость расчёта возможна после построения стабильного конвейера данных и инфраструктуры
ИИ снижает кредитный рискРиск может снижаться при корректной валидации, но ошибки и ложные отказы сохраняются
Цифровой след дополняет профильНеполный или ошибочный цифровой след создаёт дополнительный шум
Автоматизация устраняет субъективностьСмещение может перейти из решения сотрудника в данные и настройки модели
Сложная модель точнее простойТочность зависит от выборки, метрики, горизонта прогноза и качества внедрения

В кредитном скоринге оценивается не только accuracy. Для банка критичны другие метрики: precision и recall для выявления дефолтов и подозрительных заявок, ROC-AUC для сравнения способности моделей разделять классы, стабильность результатов на новых периодах, калибровка вероятности дефолта, уровень ложных отказов, доля пропущенных рискованных заявок, drift данных после изменения поведения клиентов.

Модель может хорошо работать на исторической выборке и деградировать после изменения рынка. Например, меняется структура доходов, условия кредитования, поведение пользователей или правила идентификации. Поэтому скоринг требует регулярной валидации и механизма отслеживания дрейфа признаков.

Отдельная проблема — target leakage. Это попадание в обучение признака, который стал известен уже после события или напрямую связан с его результатом. Такая модель показывает высокий результат на тесте, но не работает в реальном времени. Есть и проблема дисбаланса классов. Дефолтных клиентов меньше, чем клиентов без просрочек. При неправильной настройке модель может классифицировать почти всех как надёжных и показывать высокую формальную точность. Для кредитного риска такой результат бесполезен.

«Чёрный ящик» и причины отказа

Сложная модель может выдать вероятность дефолта, но не сформулировать причину в форме, пригодной для клиента. Нейросеть работает с большим числом взаимосвязанных параметров. Итог не сводится к одному полю анкеты.

Для внутренней системы это допустимо только при наличии процедур контроля. Банк должен понимать, какие данные поступили в модель, какие признаки были сгенерированы, какая версия алгоритма использовалась, какие ограничения применялись, почему заявка перешла в отказ, ручную проверку или одобрение, как восстановить цепочку принятия решения.

Проблема объяснимости касается двух разных задач. Первая — техническая. Нужно определить вклад признаков в конкретный результат. Вторая — коммуникационная. Нужно передать клиенту понятное объяснение без раскрытия внутренней защиты от мошенничества и параметров модели. Методы интерпретации, включая анализ важности признаков и локальные объяснения, не превращают нейросеть в прозрачную формулу. Они показывают приближённый вклад факторов. Объяснение может зависеть от выбранного метода и версии модели.

«Чёрный ящик» — это не только проблема доверия. Это проблема аудита, отладки и ответственности за ошибочное решение.

Ошибки возможны на каждом уровне:

1. Ошибка исходных данных. В БКИ могла попасть некорректная информация о просрочке или закрытом обязательстве.

2. Ошибка идентификации. Кредитная история может быть связана не с тем человеком из-за совпадения персональных данных.

3. Неполный финансовый профиль. Часть доходов проходит за пределами банка и не видна в транзакционном контуре.

4. Смещение обучающей выборки. Исторические данные отражают решения прошлой кредитной политики.

5. Переобучение. Модель запоминает особенности выборки и теряет качество на новых клиентах.

6. Изменение поведения. Старые признаки перестают описывать текущую экономическую ситуацию.

7. Ошибочная интерпретация. Система принимает корреляцию за устойчивую причинную связь.

Исправление ошибки в кредитной истории не равнозначно мгновенному изменению банковского решения. Данные должны обновиться в источнике, пройти синхронизацию и попасть в следующий расчёт. Кроме того, банк может использовать собственную историю взаимоотношений с клиентом, недоступную внешнему заёмщику.

Стандарты оценки: от рейтинга до дефолта

Персональный кредитный рейтинг и банковский скоринг — разные уровни оценки. ПКР в диапазоне от 1 до 999 помогает описать кредитную дисциплину по методике БКИ. Внутренний алгоритм банка решает прикладную задачу: выдавать ли конкретный продукт, на какую сумму, под какой срок и с каким уровнем риска.

Внутри банковского контура могут рассчитываться несколько вероятностей: вероятность дефолта заёмщика, вероятность досрочного погашения, вероятность просрочки на отдельных сроках, вероятность мошеннического поведения, ожидаемый убыток по продукту. Эти вероятности комбинируются с ценовой политикой и резервными требованиями. Итоговая ставка по кредиту зависит не только от риска, но и от стоимости фондирования, операционных расходов и маржи банка.

Дефолтная граница в 90 дней просрочки используется как стандартный ориентир для оценки кредитного события. Но модель может прогнозировать более ранние признаки ухудшения платежной дисциплины. Изменение структуры платежей или регулярное использование доступного лимита способны появиться до формальной просрочки. Именно эти ранние сигналы дают модели преимущество перед жёсткой бинарной классификацией по БКИ.

В 2024 году кредитный скоринг уже нельзя описывать только как анализ анкеты и БКИ. Банковская система стала многослойной:

1. Идентификация. Проверка клиента, устройства, номера и заявки.

2. Сбор данных. БКИ, анкета, счета, карты и допустимые внешние источники.

3. Генерация признаков. Перевод операций и событий в числовые параметры.

4. Расчёт риска. Градиентный бустинг, нейросеть или гибридная модель.

5. Антифрод. Поиск аномальных связей и несогласованностей.

6. Кредитная политика. Лимиты, продуктовые правила и пороги одобрения.

7. Контроль решения. Логирование, мониторинг drift и анализ ошибок.

Такая архитектура объясняет, почему одинаковая кредитная история может приводить к разным решениям в разных банках. Различаются продуктовые лимиты, набор данных, период наблюдения, стоимость риска и порог одобрения. Заёмщик, получивший отказ в одном банке, нередко получает одобрение в другом — это следствие не каприза, а различий в скоринговых контурах.

Что остаётся под контролем заёмщика

Точная формула модели недоступна. Но часть входных данных можно контролировать напрямую. Речь не о попытке обмануть скоринг. Искусственное изменение поведения способно выглядеть как аномалия и дать обратный эффект. Практический контур выглядит следующим образом:

  • проверять записи в БКИ и оспаривать фактические ошибки;
  • не допускать просрочек по действующим обязательствам;
  • не подавать множество заявок за короткий период без необходимости;
  • поддерживать стабильный и предсказуемый денежный поток;
  • избегать регулярного обналичивания средств с карты;
  • закрывать старые кредиты, которые больше не нужны, а не держать их «для истории»;
  • разделять личные и кредитные операции по разным счетам, чтобы профиль был читаемым;
  • сохранять длительные отношения с основным банком — внутренняя история взаимоотношений тоже учитывается.

Скоринг — не приговор и не лотерея. Это инженерный контур, который принимает решение по ограниченному набору наблюдаемых параметров. Чем понятнее модель видит финансовое поведение, тем точнее её прогноз. Задача заёмщика — не подстроиться под алгоритм, а выстроить ту финансовую дисциплину, при которой любой разумный скоринг даст адекватную оценку.

Частые вопросы

Почему мне отказали в кредите, если у меня хорошая кредитная история?
Банк использует собственную модель оценки, которая учитывает не только данные БКИ, но и транзакционную активность, долговую нагрузку и внутренние продуктовые лимиты. Одинаковая кредитная история может приводить к разным решениям в разных банках из-за различий в их скоринговых контурах.
Влияют ли переводы между физическими лицами на кредитный скоринг?
Да, модель анализирует движение средств по счету, включая регулярность поступлений и структуру расходов. Однако система не всегда может определить назначение платежа, поэтому признаки строятся на совокупности операций и истории, а не на одном событии.
Учитывают ли банки данные из социальных сетей или активность в интернете?
Банки могут использовать альтернативные данные, такие как технические параметры взаимодействия с сервисом или данные телеком-операторов, для идентификации и антифрода. Эти показатели обычно имеют меньший вес, чем финансовые данные, и служат дополнением к основному профилю.
Как исправить ошибку в кредитном скоринге?
Если ошибка связана с неверными данными в БКИ, их необходимо оспорить в источнике. После обновления данных они должны пройти синхронизацию и попасть в следующий расчет модели, однако это не гарантирует мгновенного изменения решения банка.
Что такое дефолт в банковском скоринге?
В банковской практике дефолтом считается наличие просроченной задолженности более 90 дней подряд в течение 12 месяцев с момента выдачи кредита.