- Что такое синтетические данные простыми словами
- Чем синтетические данные отличаются от реальных
- Зачем синтетические данные нужны в ИИ и машинном обучении
- Как генерируют синтетические данные
- Примеры применения в бизнесе и разработке ИИ
- Риски: смещения, утечки, низкое качество и переобучение
- Как оценивать качество синтетического датасета
- Заключение
- Часто задаваемые вопросы
- Отзывы от учеников «Универус»
В начале 2025 года «Сбер» объявил, [1] что при обучении GigaChat 3 Ultra из 14 триллионов токенов 6 триллионов оказались сгенерированными компьютером, то есть не взятыми из интернета, а созданными искусственно.
В статье разберем, откуда берутся такие данные, зачем компании платят за это деньги, и где синтетика уже меняет целые отрасли.
Что такое синтетические данные простыми словами
Представьте ситуацию: родители хотят научить ребенка отличать кошек и собак. Для этого понадобится показать тысячи фотографий. Но под рукой только 10 снимков. Тогда рисуют еще сотню похожих картинок — кошки нарисованные, но ребенок поймет, как выглядит кошка.

Синтетические данные — это так же, только вместо рисования — компьютер. Алгоритм изучает исходные данные, улавливает закономерности и генерирует новые записи, которых раньше не было, но которые выглядят и ведут себя как настоящие.
При этом за каждой такой записью нет живого человека. Нет имени, адреса, телефона. Нет ничего личного. Правдоподобная информация, созданная с нуля.
Разберем на конкретном примере. Банк хочет обучить программу, которая ловит мошенников. Для этого нужны тысячи примеров подозрительных переводов. Брать транзакции клиентов нельзя — закон запрещает. Тогда ИИ генерирует похожие переводы: суммы, время, получатели — выглядит правдоподобно, но за этим нет ни одного реального клиента.
По оценке Global Market Insights, [1] мировой рынок таких технологий уже превысил $310 миллионов и будет расти на 35% каждый год до 2034 года — бизнес понял ценность.
- Как устроены нейросети простыми словами и почему сейчас на них строят новые онлайн-сервисы.
- Пошагово показывают, как из обычной идеи сделать рабочий сайт: от текста и дизайна до первых пользователей.
- Как подключить оплату и платную подписку, чтобы сайт или сервис могли приносить деньги автоматически.
- Как собрать бота в популярных мессенджерах, который отвечает людям и принимает оплату без участия владельца.
- Какие реальные способы заработка используют участники: от первых продаж в течение недели до стабильного дохода с цифрового актива.
Уже начали обучение 12 350 человек
Чем синтетические данные отличаются от реальных
Если говорить просто: исходные данные (реальные) описывают то, что уже случилось. А синтетические то, что могло бы случиться по тем же правилам.
- Исходные данные собирают люди и устройства: врачи заполняют карточки пациентов, датчики фиксируют температуру, пользователи нажимают кнопки на сайте.
- Синтетические никто не собирал — алгоритм придумал, опираясь на закономерности из исходных данных.
Реальные, обезличенные, анонимизированные и синтетические данные
Здесь часто путаются даже специалисты, поэтому разберем по порядку. Реальные и синтетические данные — это два полюса, между которыми есть еще промежуточные варианты:

- Реальные данные — то, что собрали напрямую: история покупок конкретного Ивана Смирнова, или снимок МРТ конкретного пациента.
- Обезличенные данные — те же исходные записи, но из них убрали имя, телефон и другие очевидные «метки». Проблема в том, что при наличии дополнительной информации такие данные возвращают к исходному виду. По российскому закону № 152-ФЗ данные считаются обезличенными только тогда, когда без дополнительного «ключа» человека не опознать. С 1 сентября 2025 года обезличенные данные в России обрабатывают без согласия гражданина.
- Анонимизированные данные — из них окончательно убрали все личное, без возможности восстановить. Делают через агрегацию: не «Иван Петров купил хлеб», а «87% покупателей берут хлеб по пятницам».
- Синтетические данные устроены иначе. Брать из реальности и чистить не нужно — их создают с нуля. За каждой строчкой такого датасета нет живого человека по умолчанию. Поэтому с ними проще работать и юридически, и этически.
Обезличенные и анонимизированные данные несут следы исходных записей, и иногда через перекрестные ссылки с другими базами их удается «раскрыть». Синтетические такого риска лишены — при условии, что генерация сделана грамотно.
Почему «похожие на реальные» не значит «качественные»
Данные выглядят правдоподобно, но при этом могут быть бесполезными или даже вредными. Это частая ловушка.
Представьте синтетический набор медицинских карточек. Компьютер правильно воспроизведет средний возраст пациентов, типичные диагнозы, стандартные назначения, но потеряет редкое сочетание симптомов, которое встречается у одного человека из тысячи. Врачи при этом знают: такие редкие случаи чаще оказываются критическими.
Модель, обученная на такой синтетике, будет уверенно работать на типичных случаях, и ошибаться там, где цена ошибки высока.
Сергей Волосянков технический специалист «Универус»:
«Правдоподобные и полезные данные — это разные вещи. Синтетический набор может выглядеть хорошо, проходить базовые проверки, но провалить главный тест — после обучения модель не работает нормально. Смотреть важно не на внешний вид датасета, а на то, как ведет себя модель, когда ее обучили на этих данных и проверили на реальной тестовой выборке».
О том, как проверять качество синтетики — расскажем в конце статьи.
Зачем синтетические данные нужны в ИИ и машинном обучении
Причин несколько, и у каждой своя боль, которую синтетика закрывает.

Когда реальных данных мало
Нейросеть учится на примерах. Чем больше примеров, тем лучше результат. Но ведь случается так, что примеров мало.
В медицине, к примеру, снимки редких заболеваний встречаются единицами на всю страну. Нейросеть не научится распознавать болезнь по 5 картинкам, нужны тысячи. Синтетика закрывает этот дефицит: алгоритм генерирует дополнительные снимки, которые статистически похожи на исходные.
С языковыми моделями история та же, но масштаб глобальнее. Современные LLM, ChatGPT*, Claude*, YandexGPT и GigaChat — стремительно переходят на синтетические данные, доля которых в обучающих корпусах уже достигает 40–50%. А причина простая: качественного контента, созданного людьми, в открытом интернете больше не хватает. Для англоязычных моделей это способ прокачать сложную логику, для русскоязычных — единственный путь преодолеть дефицит чистого рунета.
Синтетику широко применяют в файн-тюнинге нейросетей — это когда обученную модель дополнительно «подтачивают» под конкретную задачу на сгенерированных примерах.
Приватность, безопасность и тестирование
Очень важный фактор «данные», который которые нельзя показывать посторонним. Медицинские карты, банковские транзакции, личная переписка. Законы строгие, штрафы большие, а утечка — это репутационная катастрофа.
Синтетические данные снимают эту проблему. Финансовые компании сокращают время разработки моделей на 40–60% за счет того, [2] что не нужно проходить длинные согласования с юристами и регуляторами. AI-лаборатория American Express использовала синтетические датасеты, чтобы улучшить модели выявления мошенничества — без риска засветить данные клиентов.
Тестирование — отдельная история, которую часто недооценивают. Разработчики хотят проверить новую систему на реалистичных данных, но использовать боевую базу клиентов рискованно. Синтетический набор закрывает задачу без единого человека в датасете. Подробнее об этом в статье «ИИ в автоматизации тестирования».
В России запрос на синтетику сформировался раньше, чем в других странах из-за закрытого доступа к зарубежным датасетам. Поэтому инициатива «Сбера» и Ассоциации больших данных по национальному стандарту синтеза выглядит логично.
При работе с языковыми моделями полезно понимать, как устроено контекстное окно нейросети, которое определяет, сколько информации модель удержит за один проход при генерации данных.
Балансировка датасетов и редкие сценарии
Еще одна распространенная проблема. В жизни одни события случаются часто, другие редко. Мошеннические транзакции составляют меньше 1% от общего числа переводов. Если обучить модель на таких данных, она научится говорить «все нормально» на каждый запрос и будет права в 99%, но не поймает ни одного мошенника.
Синтетика выравнивает этот дисбаланс. Метод SMOTE (популярный алгоритм машинного обучения для борьбы с дисбалансом данных), например, создает дополнительные примеры редкого класса — и на оригинальную научную статью об этом методе ссылаются уже 14 500 раз. [3] Такая популярность говорит о том, что проблема знакома каждому, кто работает с данными.
Отдельный пример — беспилотные автомобили. Waymo проехала 200 миллионов миль в реальном режиме и миллиарды миль в виртуальной среде. В феврале 2026 года компания вместе с Google DeepMind представила Waymo World Model — систему, [4] которая генерирует синтетические сценарии вождения и симулирует редкие опасные ситуации: гололед, торнадо, неожиданные препятствия.
Здесь понятно, что значит синтетические данные на практике: специально разбить машину ради обучения невозможно. В симуляции можно разбивать сколько угодно.
Как генерируют синтетические данные
Единого способа нет, и все зависит от задачи, бюджета и того, насколько сложные закономерности нужно воспроизвести. Где-то хватит простых правил, а где-то без нейросети не обойтись. Разберем от простого к сложному.

Правила, симуляции и статистические модели
- Вариант 1: задать правила. Разработчик говорит компьютеру: «Генерируй переводы на суммы от 100 до 100 000 ₽, время — рабочие часы, получатели — случайные». Получается быстро и дешево. Подходит для тестирования, когда важна структура данных, а не тонкие закономерности.
- Вариант 2: создать симуляцию. Воспроизводится виртуальный мир с физическими законами: как движутся машины, как реагируют датчики, какие бывают помехи. Так тренируют беспилотники и промышленных роботов.
- Вариант 3: работа статистических моделей. Они изучают исходные данные, запоминают распределения и связи между показателями, и реализуют эту математическую структуру в новых записях. Подход прозрачный и объяснимый, но сложные зависимости ему даются хуже.
Генеративные модели, LLM и табличные данные
Здесь начинается то, что сейчас ассоциируется с ИИ.
Генеративно-состязательные сети, или GAN — это 2 нейросети, которые соревнуются между собой. Первая генерирует поддельные записи, вторая пытается отличить подделку от исходных данных. Со временем первая учится делать подделки настолько убедительно, что вторая перестает справляться. В итоге получают данные, неотличимые от исходных.
Для таблиц — а именно в таком формате хранится большинство бизнес-данных — разработали специальные инструменты. Популярный из них — CTGAN. Работает с разными типами колонок и не теряется, когда данных одного класса мало.
Языковые модели ChatGPT*, Claude*, GigaChat тоже генерируют данные, только текстовые. Например, проект Stanford Alpaca (исследовательский проект Стэнфордского университета, целью которого было создание доступной и легко обучаемой языковой модели, способной точно следовать инструкциям) [5] начинался с 175 примеров, написанных вручную. Затем языковая модель сгенерировала на их основе 52 000 обучающих примеров. [6] Так создают обучающие наборы для других моделей.
При работе с языковыми моделями важно понимать, как устроены токены, именно в них считается стоимость генерации, и при больших объемах синтетики это становится ощутимой статьей расходов. Подробнее о том, как высчитать стоимость 1 токена, в статье «Что такое токены в нейросетях».
Синтетические тексты, изображения, аудио и графы
Синтетику делают в разных форматах — каждый под свою задачу. В таблице продемонстрировали, какой инструмент за что отвечает:
| Формат | Как генерируют | Где применяют |
Тексты | Языковые модели | Диалоги для чат-ботов, обучающие примеры, синтетические отзывы, учебные материалы |
Изображения | GAN и диффузионные модели (те же технологии, что у Midjourney) | Медицинские снимки, дорожные сцены, технические чертежи |
| Аудио | Системы преобразования текста в речь | Голосовые ассистенты, распознавание речи |
Графы | Стохастические блочные модели, графовые диффузионные сети | Рекомендательные системы, защита приватности в финансовых и социальных сетях |
Графы — формат, который чаще вызывает вопросы. Это набор точек и связей между ними. Например, пользователи социальной сети и подписки друг на друга. Синтетический граф воспроизводит такую структуру без единого пользователя внутри. Какой бы формат ни понадобился — инструменты для генерации уже существуют и активно используются в продуктовых системах по всему миру.
Примеры применения в бизнесе и разработке ИИ
Посмотрим, где синтетика уже работает.
- Финансы. JPMorgan Chase создал синтетическую платежную сеть: [7] больше 58 000 транзакций между почти 20 000 пользователями, часть из которых помечена, как мошенники. Такой набор передают исследователям без риска, потому что реальных клиентов там нет.
- Медицина. NVIDIA создала модель MAISI, [8] которая генерирует объемные снимки компьютерной томографии с разметкой до 127 анатомических структур. Врачи получают дополнительный обучающий материал без сложностей с согласием пациентов.
- Беспилотный транспорт. Waymo прогоняет на синтетике опасные ситуации, которые на дороге встретишь 1 раз в жизни или не встретишь вовсе. [4] В феврале 2026 года компания вместе с Google DeepMind представила систему Waymo World Model, которая воспроизводит редкие аварийные сценарии в симуляции.
- Разработка языковых моделей. Microsoft обучила Phi-4 (линейка высокопроизводительных компактных ИИ-моделей от Microsoft, обученных с акцентом на сложные рассуждения, математику и логику, а не только на объем данных), [9] где большую часть составляла качественная синтетика — и модель показала результаты наравне с моделями в 5 раз большего размера. GigaChat 3 Ultra от «Сбера» подтвердил тот же принцип для русского языка.
- Российский рынок. По данным CNews, [10] синтетические данные и автоматическая разметка помогают российским компаниям обойти дефицит данных и избежать проблем с конфиденциальностью — без длинных согласований и больших бюджетов на сбор исходников.
Сергей Волосянков, основатель «Универус»:
«На курсах часто спрашивают: „Это же для гигантов, нам-то зачем?“. Отвечаю просто. Если не хватает примеров редкого класса — компьютер сгенерирует за минуты. Если нельзя использовать боевую базу клиентов для тестов — за час собирают синтетический набор. Синтетика давно стала инструментом повседневной разработки, а не привилегией крупных корпораций».
Риски: смещения, утечки, низкое качество и переобучение
У синтетических данных 4 риска, о которых важно знать заранее:
- Смещения. Если в исходных данных перекос, компьютер его не исправит, а сделает еще хуже. Скажем, в базе мало женщин-руководителей. Синтетика закрепит этот дисбаланс, и модель будет считать такое распределение нормой.
- Утечки. Бывает, что модель слишком хорошо запоминает исходные данные и случайно воспроизводит их фрагменты в синтетике. Тогда вся работа по защите приватности идет насмарку. При плохо настроенной генерации из датасета можно восстановить оригинальные записи. Защита от этого — дифференциальная приватность. Грубо говоря, в данные добавляют контролируемый «шум», который не дает вычислить конкретную запись.
- Низкое качество. Если при генерации потеряли редкие и нетипичные случаи, модель учится на слишком простой картине мира. Внешне датасет выглядит нормально, но модель будет ошибаться именно там, где ошибаться нельзя.
- Коллапс модели. Это самый неочевидный риск. Если нейросеть учить на ее же собственных ответах снова и снова, качество начнет падать. Но важный момент — коллапс наступает только тогда, когда синтетика полностью заменяла исходные данные. Когда синтетику добавляли к исходным данным, деградация была куда слабее.
Gartner в 2025 году предупредил, [11] что к 2027 году больше половины руководителей в области данных столкнутся с серьезными сбоями из-за неграмотной работы с синтетикой.
Как оценивать качество синтетического датасета
Единого стандарта пока нет, и в России его только разрабатывают. На практике сложились 3 способа проверки:

- Достоверность означает то, насколько синтетика похожа на исходные данные по статистике. Проще говоря: те же распределения и связи между показателями. Проверяют это математическими инструментами — KL-дивергенцией (Кульбака-Лейблера) и тестом Колмогорова-Смирнова. Звучит сложно, но смысл простой — данные должны «вести себя» так же, как настоящие.
- Полезность — самая важная проверка. Модель обучают на синтетике, а потом тестируют на исходных данных. Если результат примерно такой же, как при обучении на исходных данных, то синтетика сработала. Если хуже — где-то потеряли важные закономерности при генерации.
- Приватность — проверяют, не просочились ли в синтетику фрагменты исходных записей. Для этого смотрят, насколько каждая синтетическая запись похожа на ближайшую реальную, и проверяют устойчивость к специальным атакам на раскрытие данных.
Важно понимать, что улучшить 3 показателя одновременно не выйдет. Чем лучше защита приватности, тем ниже достоверность и полезность. Это не баг, а фундаментальный компромисс. Под каждую задачу выбирают, что важнее, и уже под это настраивают генерацию.
Главное — проверять качество нужно всегда, без исключений. Даже небольшое расхождение между синтетикой и исходными данными в итоге тянет качество модели вниз.
Заключение
Синтетические данные решают 3 задачи, с которыми разработчики сталкиваются постоянно: данных не хватает, показывать их нельзя, а выборка перекошена. И это уже не теория — медицина, беспилотники, банки и языковые модели работают с синтетикой прямо сейчас.
Но инструмент требует аккуратности и правило тут одно: генерировать осознанно, проверять по трем метрикам и держать исходные данные рядом.
В 2026 году в России разрабатывается национальный стандарт синтеза данных — тем, кто разберется в теме до появления стандарта, будет проще, когда требования станут жестче.
Автор
Редакция Универус
Часто задаваемые вопросы
1. Могут ли синтетические данные заменить исходные?
Нет, и вот почему. Синтетика создается на основе исходных данных — алгоритм учится у них, а не придумывает информацию с нуля. Если убрать исходные данные, модель начнет учиться на собственных ошибках и постепенно деградирует — это доказал эксперимент Шумайлова в журнале Nature. Синтетика работает как дополнение, а не замена.
2. Законно ли использовать синтетические данные вместо персональных?
Если данные сгенерированы правильно и не раскрывают конкретного человека, под закон о персональных данных такой набор не подпадает. Банки и медицинские компании работают с синтетикой по этой причине — меньше согласований, меньше рисков. Проверять датасет на утечки при этом нужно в каждом случае.
3. Нужен ли дорогой компьютер, чтобы генерировать синтетические данные?
Зависит от задачи. Если нужны таблицы с числами — справится рабочий ноутбук. Если нужны синтетические изображения или видео — без видеокарты не обойтись. Табличную синтетику через инструмент CTGAN запускают на среднем домашнем компьютере — порог входа здесь доступный.
Отзывы от учеников «Универус»
«Пришел на курс с нулем в матстате, боялся, что не потяну. Объясняют без заумных терминов, с живыми примерами. Тему синтетических данных раньше обходил стороной, теперь генерирую тестовые датасеты для работы в финтехе. Практики много, воды мало».
Дмитрий, аналитик данных
«Выбирала между несколькими школами — не жалею о выборе. Разбирают кейсы из практики компаний, а не абстрактные схемы. После занятий по генеративным моделям наконец разобралась, как устроены GAN изнутри».
Марина, ML-инженер
«Курс структурный, без пафоса. Преподаватели отвечают развернуто, а не отсылают гуглить. Синтетические данные оказались куда шире, чем казалось: графы, аудио, таблицы. Рекомендую тем, кто хочет разобраться в теме с нуля».
Артем, backend-разработчик
«Думала, в 40+ поздно переучиваться. Ничего подобного. Материал укладывается даже без технического бэкграунда. Теперь применяю знания в маркетинговой аналитике: синтетика помогает тестировать гипотезы без риска слить базу клиентов».
Елена, маркетолог-аналитик
*Официально недоступны в РФ
Источники:
- vedomosti.ru/technologies/trendsrub/articles/2026/06/11/1205314-zahvativayut-rinok
- wsj.com/articles/fake-it-to-make-it-companies-beef-up-ai-models-with-synthetic-data-11627032601
- arxiv.org/abs/1106.1813
- waymo.com/blog/2026/02/the-waymo-world-model-a-new-frontier-for-autonomous-driving-simulation/
- crfm.stanford.edu/2023/03/13/alpaca.html
- arxiv.org/abs/2212.10560
- arxiv.org/abs/2301.07791
- research.nvidia.com/labs/cvr/maisi/
- arxiv.org/abs/2412.08905
- cnews.ru/news/line/2026-02-10_trendy_rynka_bolshih_dannyh
- gartner.com/en/newsroom/press-releases/2025-06-17-gartner-announces-top-data-and-analytics-predictions
