Ведомство Минобрнауки России внедрило новый метод анализа данных из соцсетей с использованием больших языковых моделей (LLM). Разработанный подход способен обрабатывать информацию быстро и точно, что делает его полезным в региональных управлениях, экстренных службах и научных проектах. Как подчеркивают разработчики, достоверность и скорость обработки данных являются ключевыми аспектами в данной системе.
Специалисты из министерства пояснили, что соцсети способны стать надежным источником для изучения общественных настроений. Однако традиционные способы использования LLM часто приводят к генерации правдоподобной, но недостоверной информации. Поэтому были предложены три последовательных варианта взаимодействия модели с реальными данными: прямой запрос, конвейер с предварительным извлечением ключевых слов и кластерный подход.
Прямой запрос — это простейший метод, но он имеет низкую стабильность. Более продвинутый – конвейер, который предварительно извлекает ключевые слова и формулирует темы, обеспечивает лучший баланс между стабильностью и точностью, особенно на средних объемах данных. Кластерный подход, в котором тексты преобразуются в векторы, а затем группируются по схожести, продемонстрировал наилучшие результаты, особенно на больших массивах данных, обеспечивая 100% стабильность и 94% прослеживаемости.
Исследования, проведенные на реальных данных из домовых чатов, подтвердили, что эффективность и надежность LLM при мониторинге соцсетей зависят от архитектуры обработки данных. По словам ученых, кластерный метод, при котором тексты обобщаются после группировки, оказался наиболее успешным в сравнении с другими подходами.
Разработка уже была внедрена в систему мониторинга, что позволяет значительно улучшить качество анализа соцсетей. Эта инициатива может стать началом нового этапа в использовании LLM для обработки данных в реальном времени, что открывает новые возможности для анализа общественных настроений.
