
Привет, я Александр Бондаренко, эксперт по комплаенсу и руководитель проектной группы в Далее. Еще до выхода «закона о защите русского языка» мы стали искать быстрый способ вычистить сайты от недопустимых заимствований и «латиницы».
В итоге создали алгоритм с многоступенчатым фильтром, OCR и LLM. Система находит в контенте только недопустимые слова и тут же предлагает русские аналоги. На выходе получаем результат в 20 раз быстрее, чем при адаптации текста вручную.
Рассказываю, как реализовано решение и чем кардинально отличается от скармливания страниц в ChatGPT или другие ИИ-боты.
Дисклеймер: В тексте используются профессиональные термины на английском языке. Статья носит информационный характер и адресована специалистам, а не физлицам-потребителям.
Читать далее