1. Рамки анализаВ истории технологий нет прецедента, чтобы архитектурный дефект алфавитного языка сохранялся 40 лет и затрагивал все измерения ИТ.
Случай, когда буквенно-слоговое письмо было оцифровано как идеографическое, уникален, и его экономические последствия не имеют готового шаблона для оценки.
Настоящий документ не пытается выразить в деньгах проблемы, чью стоимость невозможно достоверно оценить, потому что соответствующие расходы никогда отдельно не фиксировались и не изучались в прямой связи
с архитектурным дефектом. Это, однако, не означает отсутствия реальных экономических последствий, а лишь то, что их нельзя надёжно извлечь из открытых источников. К таким показателям относятся:
- упущенная выгода и нереализованные возможности;
- смежные отрасли и мультипликативные эффекты;
- скрытые кастомные решения, ситуационные обходные пути и патенты, не находящиеся в открытом доступе;
- коммерческая тайна компаний;
- прямые сопутствующие издержки (полные затраты на оплату труда и обеспечение рабочих мест, электроэнергию, серверные и вычислительные мощности, консалтинг, посредничество и субподряд, помещения и дополнительные услуги, налоги, добавленную стоимость) – при том что фактические доли данных статей расходов составляют 30–90 % затрат
в каждой категории.
2. Архитектурный дефект первого дняВ 1987 г., при создании стандарта KS C 5601, корейское письмо было оцифровано не как алфавитная система, а как собрание готовых слогов
«идеографов». Это решение было закреплено в Unicode в 1993 г.
Ключевое сопоставление с Китаем.
Китайский язык объективно сложнее: он содержит тысячи иероглифов «идеографов» и не имеет алфавитной природы. Его оцифровка потребовала колоссальных усилий, и китайские инженеры выполнили эту работу настолько качественно, насколько это возможно для идеографической системы. Более того, в Китае сосуществовали и используются до наших дней два подхода: Пиньинь, созданный государственными структурами и институтами,
и система Уби, созданная независимым разработчиком Ван Юнминем,
которую китайское правительство и мировое сообщество приняли
как один из стандартных методов ввода.
Корейский язык — комбинаторная система письма, созданная в 1443 г. как прямая замена иероглифике и насчитывающая на сегодняшний день 33 буквы. Она проще китайской, поскольку основана на комбинаторике и буквенно-слоговом подходе. Тем не менее был оцифрован так же, как китайский начальная-срединная-конечная, хотя для китайского это оправдано структурой чтения идеографов, а для корейского привело к тому, что одни и те же символы стали восприниматься по-разному, тогда как в печати и логике они используются именно как буквы.
3. Технологические последствияВ этом разделе рассматриваются только потери, документированные в открытых источниках, проанализированные через призму Архитектурного дефекта первого дня. В исследованиях, патентах и рейтингах этот дефект часто фигурирует как «сложная среда» или «вызовы» – абстрактные понятия, не отражающие реальную проблему и её последствия. Приводимые стоимостные оценки приблизительны, поскольку по-настоящему объективные данные публично недоступны. Представленные ниже цифры и выводы не отрицают наличия зрелых высокоуровневых решений и библиотек для корейского сегмента. Высокоуровневые инструменты не имеют возможности устранить полностью низкоуровневый дефект, поэтому последствия оцифровки влияют на корейский ИКТ-сектор по сей день.
3.1. Нормализация (NFC/NFD) и поискМеханизм. Корейский текст представлен в Unicode в двух несовместимых формах: NFC (готовые слоги) и NFD (последовательности букв чамо). Любая операция – сравнение строк, полнотекстовый поиск, сортировка, индексирование, регулярные выражения – требует предварительной нормализации, т.е. приведения к единой форме. Без неё даже семантически идентичные слова могут не совпадать. Стандартные движки (SQLite FTS, Elasticsearch, Solr) и библиотеки регулярных выражений не могут корректно работать с корейским без подключения внешних компонентов, таких как ICU (International Components for Unicode).
Ни один другой алфавитный язык первого эшелона не сталкивается с подобной дихотомией представления. Английский, вьетнамский, русский – все имеют одну форму кодировки, и поисковые системы работают «из коробки». Китайский, будучи идеографическим, также лишён проблемы NFC/NFD. Арабский и хинди требуют специализированных, но уже устоявшихся инструментов (arabic_reshaper, python‑bidi, деванагарские шрифты). Корейский же обрабатывается одновременно как идеографическая система и как неполноценный алфавит: на уровне декомпозиции элементы вроде двойных срединных гласных и двойных конечных согласных являются полностью независимыми, при этом на разных уровнях абстракции идентичные элементы имеют разное представление. Такой подход привёл к ветвлениям и удорожанию тактовой стоимости декомпозиции по сравнению с любым другим языком первого эшелона.
Конкретные проявления:- Кроссплатформенная несовместимость. Операционные системы используют разные формы нормализации: macOS – NFD, Windows и Linux – NFC. Файл, сохранённый на Mac, не может быть найден поиском на Windows без дополнительной обработки. Пользователи Apple сообщают об этой проблеме с 2024 г. (Apple Discussions, 2024). Разработчики вынуждены писать код, учитывающий особенности каждой ОС.
- Деградация поисковых систем. SQLite FTS не может корректно искать корейский текст без ICU; открытые баг-репорты от 2026 г. подтверждают актуальность проблемы (SQLite FTS5 CJK, issue #4). Elasticsearch и Solr также требуют подключения внешних анализаторов, что увеличивает нагрузку на серверы и усложняет конфигурацию.
- Удорожание операций с базами данных. Oracle (доминирующий на корейском рынке с долей > 50 %) и другие СУБД применяют ICU для обработки корейского. Каждый нормализованный запрос потребляет на 10–20 % больше процессорного времени. Лицензионные выплаты иностранным вендорам, включая Oracle и Microsoft, достигают $5–10 млрд в год, и часть этих расходов приходится именно на поддержку нормализации.
- Уникальные легаси-проблемы корейского сегмента. Стандарты EUC‑KR и ActiveX, возникшие как следствие архитектурной ошибки 1987 г., до сих пор требуют поддержки в государственных и финансовых системах. Несовместимость EUC‑KR с Unicode и отсутствие в современных системах базовой поддержки ActiveX создают ощутимые проблемы для унификации решений корейского ИКТ и приведения их в соответствие с мировыми стандартами.
- Интеграция. В отличие от стандартного алфавитного языка первого эшелона, где поиск функционирует без дополнительных настроек, поддержка корейского требует подключения ICU, написания обёрток и тестирования на разных платформах. Это порождает уникальные издержки как при разработке, так и при эксплуатации. Размер компании и длительность присутствия на корейском рынке являются факторами, повышающими эти издержки. Малые компании используют общедоступные актуальные инструменты, средние — их кастомизированные версии, а крупные и международные корпорации вынуждены создавать собственные решения, учитывающие совместимость и легаси-проблемы. Крупная компания или международная корпорация, работающая на экспорт, рассматривает корейский язык как важный, но лишь один из многих. Необходимость унификации корейского сегмента с глобальными языковыми стандартами и внутренними системами поддержки напрямую препятствует снижению удельных затрат за счёт объёма.
3.2. Методы ввода (IME)Десятки задокументированных ошибок в терминалах и IDE демонстрируют, что даже простейшая задача, решенная для всех буквенных языков в первую очередь при цифровизации, а затем устраненная на мировом уровне унификацией Юникода, для корейского сегмента закрытым вопросом не является. Объем затрат не поддается исчислению, однако, это наглядная демонстрация, что потери происходят, даже там, где даже у сложнейших языков проблема решена.
Примеры ошибок (GitHub):
- Warp Terminal (#6891) – корейский ввод ломается после обновлений.
- Claude Code (#12528) – после переключения языка символы распадаются на чамо.
- Claude Code (#18291) – чамо не отображаются, пока слог не завершён.
- Gemini CLI (#2638) – задержка ввода, пропадание символов.
- Ghostty (#5404), OpenCode (#303), BossTerm (#87) – десятки открытых ошибок.
- Cursor – пользователь заявил: «Исправление одной этой проблемы, вероятно, удвоило бы мою продуктивность» (Cursor Forum, 2025).
3.3. Искусственный Интеллект: Токенизация и качество данныхАрхитектурный дефект сказывается и на ИИ-индустрии Кореи
в двух направлениях: экономическом (количество затрачиваемых токенов и результативность итоговых ответов) и качественном (двойное представление данных, сложность верификации через стандартные бенчмарки). Эти два направления взаимосвязаны и образуют замкнутый круг. Поскольку дефект низкоуровневый, его решение может быть внедрено лишь на том же уровне абстракции, на котором и возникает проблема, а именно на уровне C++ драйверов, предназначенных для ИИ-моделей. На более высоких уровнях исправления, которые на данный момент выбраны как основной способ решения, не дадут эффекта экономического или качественного, либо не дадут соразмерного затратам улучшения.
3.3.1. Экономическое направлениеКорейский текст требует в 1,6–2,59 раза больше токенов, чем английский, и находится примерно в том же диапазоне, что и китайский, при обработке одного и того же объёма информации. Однако качество ответов и результатов у корейских моделей значительно ниже, чем у американских и китайских. Данные в форматах NFD и NFC не связаны между собой с точки зрения токенизации, и любые решения на верхнем уровне не изменят фактически сложившийся формат работы с токенами. Расширение выборки языков не устраняет проблему: в языках с единственной формой представления, таких как английский или китайский, разночтения исключены самой архитектурой, и токенизация работает предсказуемо. Как следствие, остальные языки экономически более рентабельны с точки зрения затрат и прогнозируемых результатов.
Примеры:
SK Telecom разработала собственный токенизатор для модели A.X 4.0, требующий на 33 % меньше токенов, чем GPT‑4o. Однако качественного улучшения ответов это не дало. Потратить меньше токенов на неправильный ответ означает, что придётся потратить столько же или больше на следующую итерацию — и так до достижения удовлетворительного результата. Количество и качество взаимосвязаны: нельзя решить проблему только в одном из аспектов.
Независимый бенчмарк EntropyMath (декабрь 2025, Университет Соган / Deep Fountain) показывает, что лучшая корейская модель, K‑EXAONE‑236B‑A23B, потребляет ~25,2 тыс. токенов на задание, тогда как мировой лидер GPT‑5.2 (high) — лишь ~12,6 тыс. токенов (EntropyMath Leaderboard, 2026). Двукратная разница — прямое следствие архитектурного дефекта.
3.3.2. Качественное направлениеПомимо прямых расходов, архитектурный дефект ведёт к системному снижению качества данных, на которых обучаются и тестируются корейские ИИ-модели. Это создаёт иллюзию прогресса и маскирует реальное отставание. Более того, дефект породил институциональную ловушку, в которой корпорации вынуждены конкурировать на заведомо худших условиях.
3.3.2.1. KMMLU – основной корейский бенчмарк для оценки моделейОригинальный бенчмарк KMMLU (Korean Massive Multitask Language Understanding) содержал 35 030 вопросов и создавался как аналог английского MMLU. В 2025 г. обнаружилось, что 7,66 % данных содержат ошибки: «утекшие» ответы, расплывчатые формулировки, несуществующие ссылки. Также было выявлено пересечение тестовых вопросов с обучающими данными.
Попытка исправления – KMMLU‑Redux. Из 35 030 вопросов осталось лишь 2 587 (менее 7,4 % исходного объёма). Затем был создан KMMLU‑Pro (2 822 вопроса на основе профессиональных экзаменов).
Все актуальные версии разработаны LG AI Research – той же самой компанией, которая создаёт модель EXAONE, что делает сложным проверку и оценку объективности модели EXAONE через их же собственный бенчмарк.
LG EXAONE – флагманская модель LG. По данным LG Display, общее число накопленных патентов, связанных с моделью, превышает 70 000. Однако, согласно документации, её токенизатор работает на уровне отдельных байтов UTF‑8. Документация упоминает сложные многоуровневые системы обработки (MeCab, SuperBPE, расширение словаря до 150 K), но из неё не следует, каким образом эти системы решают архитектурный дефект Хангыля. В тексте говорится, что сложность среды и вызовы были учтены при разработке. Следовательно, сделать выводы о том, решена ли проблема, невозможно.
3.3.2.2. Академический подход: Публикации, патенты и их качество. Корея занимает 6-е место в мире по числу публикаций об ИИ (58 913 статей в 2020–2024 гг.) и 4-е место по высокотехнологичным патентам (IMD WDCR 2025).
Оценка влияния публикаций, патентов на мировую ИИ-индустрию по другим показателям дает более точную картину:
- Цитируемость. 6-е место по объёму и на 22-м месте по цитированиям на статью и на 26-м по Field‑Weighted Citation Impact (Chosun Ilbo, 2025). Публикации есть, но интерес внешних исследователей и ученых ниже ожидаемого при высоких объемах работ и грантовой поддержке.
- Корпортивные исследования. Samsung с 59 публикациями в ведущих журналах занимает 12-е место, лидерами остаются Alphabet (820), Microsoft (414) и Meta (385).
- Международное сотрудничество. 33 %, 43-е место, что демонстрирует низкие возможности для совместной работы в сфере ИИ. Опыт решения проблем двойного представления данных и других сложностей исключительно корейского сегмента переводит корейских исследователей в категорию узкоспециализрованных специалистов.
3.3.3. Независимый бенчмарк EntropyMathEntropyMath – эволюционная многопользовательская система оценки, разработанная исследовательской группой Университета Соган и Deep Fountain. Бенчмарк генерирует высокоэнтропийные задания, специально предназначенные для «взлома» LLM и проверки их способности к логическому мышлению, а не простому запоминанию (Университет Соган, 2025; entropymath.com).
Исследовательская группа под руководством профессора Ким Чон Рака провела независимое тестирование 5 корейских и 5 зарубежных LLM на задачах CSAT и дополнительных заданиях.
Ключевые результаты (по состоянию на 2026 г.):
- Мировые лидеры (GPT‑5.2 high, Gemini‑3‑Pro‑Preview) доминируют в верхней части таблицы.
- Корейские модели (K‑EXAONE‑236B‑A23B, Solar‑Pro 2, HCX‑007, EXAONE‑4.0‑32B) занимают нижнюю половину.
- K‑EXAONE‑236B‑A23B потребляет ~25,2 тыс. токенов на задание – вдвое больше, чем GPT‑5.2 high (~12,6 тыс.). Это прямое подтверждение количественного ущерба от архитектурного дефекта.
4.Сравнительный анализАнализ ИТ-решений для разных языков взят из открытых источников и обсуждений. Помимо прямого сравнения, вводится новая переменная – Лёгкость интеграции – оценка того, насколько просто интегрировать язык в свой продукт или систему. Чем меньше внешних и дополнительных решений требуется для обеспечения базовой функциональности, тем выше балл. Для английского языка установлена оценка 10, также он является точкой отсчета для сравнения(время с момента решенности для английского и сопоставление с количеством дополнительных, у английского почти всегда 0)
Сводная таблица
Сектор | English | Tiếng Việt | 中文 | हिन्दी | العربية | 한국어 |
AI/LLM | 10 | 9 | 7 | 5 | 4 | 3 |
Поиск (FTS, Regexp, SQLite) | 10 | 9 | 7 | 6 | 6 | 4 |
Методы ввода (IME) | 10 | 8 | 7 | 7 | 6 | 2 |
Встроенные системы и IoT | 10 | 9 | 6 | 6 | 5 | 4 |
E-commerce | 10 | 8 | 7 | 6 | 6 | 5 |
Лёгкость интеграции | 10 | 8 | 5 | 5 | 4 | 1 |
Итог | 10 | 8.5 | 6.5 | 5.8 | 5.2 | 3.2 |