Краткий pipeline
- 1Сбор
- 2Нормализация
- 3Дедупликация
- 4Извлечение сущностей
- 5Выделение событий
- 6Построение связей
- 7Анализ тональности
- 8Поиск аномалий
- 9Оценка рисков
- 10Выводы и evidence
Шаги могут выполняться частично, итеративно и с разной полнотой в зависимости от задачи и доступности данных. Пропуск шага не заполняется выдуманным результатом.
Сбор данных
На входе — документ из открытого источника или материал пользователя. Если поле доступно, система сохраняет источник, время сбора, URL, исходный текст, доступные метаданные и идентификатор документа. Первоисточник сохраняется настолько, насколько это применимо и законно: чтобы вывод можно было проверить, а не только прочитать пересказ.
Какие площадки входят в сбор и где проходят границы покрытия — на странице источников. Отсутствие документа в корпусе не означает, что события не было.
Нормализация и дедупликация
Одинаковые и почти одинаковые публикации, репосты и синдицированные перепечатки не должны выглядеть как независимые события. Нормализация приводит даты, названия источников и технический мусор к сопоставимому виду; дедупликация связывает повторы с каноническим документом, когда это удаётся сделать уверенно.
Точный процент успешности дедупликации не публикуется: без регулярного измерения такое число было бы рекламным. Ошибки возможны и в ту, и в другую сторону: дубль может остаться, различные материалы могут быть склеены слишком агрессивно.
Сущности
Система выделяет объекты, о которых говорит корпус. Типы включают компанию, персону, организацию, локацию, продукт, тему и другие сущности, если они устойчиво распознаются в тексте.
Совпадение имени не всегда означает одну сущность. Однофамильцы, одноимённые компании, сокращения и переводы требуют сопоставления по контексту, связям и алиасам, а не только по строке имени.
Entity resolution в Verilyze — это сопоставление упоминаний с карточкой объекта. Если уверенности недостаточно, упоминание не следует считать окончательно склеенным с объектом. Ошибки NER и неоднозначность имён — известное ограничение, а не исключение.
События
Публикация не равна событию. Несколько документов могут описывать один инцидент, заявление, проверку или коммуникацию. Событие — аналитическая сборка: тип, дата или период, связанные сущности, доказательства из источников и, если используется, оценка значимости.
Как отделять поток публикаций от репутационного инцидента, разобрано в материале «Публикация и событие». Это методологическая заметка, а не измерение конкретного рынка.
Claims и evidence
Ключевое требование Verilyze: вывод должен быть связан с источниками. Evidence позволяет открыть исходные материалы и проверить, на чём стоит утверждение. Отсутствие evidence снижает уверенность: такой вывод нельзя использовать как установленный факт.
LLM-summary не является первичным доказательством. Сводка модели может помочь ориентироваться в корпусе, но не заменяет текст публикации, дату, URL и контекст. Если summary расходится с источником, источником считается первоисточник.
Тональность
Базовая схема тональности — положительная, отрицательная и нейтральная. Оценка строится по публикации или её фрагменту, а не по одному слову-маркеру. Контекст важнее словаря: цитата оппонента, ирония, отрицание и пересказ чужой претензии часто выглядят «негативно» лексически, но не являются позицией автора.
Ирония, сложные формулировки и смешанные тексты могут быть классифицированы ошибочно. Тональность — аналитический признак, а не моральная оценка объекта и не юридическая квалификация публикации.
Риски
Нужно разделять три слоя. Факт — то, что прямо следует из источника и может быть проверено. Аналитический признак — тональность, аномалия, связь, всплеск. Risk score — агрегированный индикатор, собранный из нескольких сигналов.
Оценка риска агрегирует несколько аналитических сигналов. Конкретная модель и веса могут изменяться по мере развития продукта; итоговый score следует воспринимать как аналитический индикатор, а не объективную вероятность события.
Формула score не публикуется, пока она меняется и не закреплена измерением. Публикация фиктивной формулы была бы хуже, чем честный отказ её раскрывать.
Аномалии
Аномалия — отклонение от обычного фона объекта, а не любое упоминание. В текущем контуре к аномалиям относятся всплеск количества публикаций, появление нетипичного источника, резкое изменение тональности, нетипичная связка сущностей и отклонение от фонового уровня объекта.
Аномалия — сигнал для проверки, а не доказательство инцидента. Всплеск может быть репостом, календарным событием, ошибкой сбора или реальной эскалацией; различить это должен аналитик по evidence.
Прогнозы
Прогнозные компоненты оценивают возможные сценарии продолжения текущей информационной динамики на основе доступных данных. Это модельная оценка, а не гарантия будущего события.
Verilyze не предсказывает будущее как установленный факт. Горизонт прогноза — дни и недели информационной динамики, а не юридический, финансовый или операционный исход. Если данных мало, прогноз не становится точнее за счёт уверенного тона.
Уверенность и неопределённость
Единой числовой метрики confidence для всех выходов системы пока нет. Автоматические результаты имеют различную степень надёжности: она зависит от полноты корпуса, качества источника, однозначности сущности, наличия evidence и сложности формулировки.
Если система показывает уровень уверенности для конкретного вывода, его нужно читать как служебный индикатор, а не как статистическую гарантию. Отсутствие индикатора не означает, что вывод надёжен.
Проверка человеком
Аналитик должен проверять существенные выводы по первоисточнику: дату, контекст, связанные объекты и независимость источников. Автоматический рейтинг, тональность, риск и прогноз не заменяют профессиональную проверку, если от результата зависит управленческое, юридическое, кадровое или репутационное решение.
Существенные решения не должны приниматься только на основании AI output. Verilyze — информационно-аналитический контур, а не автоматический арбитр фактов.
Ограничения
- Неполное coverage источников: корпус отражает доступные системе материалы, а не все публикации в интернете.
- Удалённые и изменённые публикации могут исчезнуть из первоисточника после сбора.
- Языковые нюансы, ирония и смешанные тексты повышают ошибку классификации.
- Ошибки NER, склейки сущностей и ложные связи возможны.
- Ошибки тональности и LLM-сводок возможны и должны проверяться по тексту источника.
- Неполный контекст: система не видит закрытые обсуждения и материалы вне корпуса.
- Отсутствие данных ≠ отсутствие события.
Данные и конфиденциальность
Пользовательские материалы используются для выполнения задачи, работы сервиса и предусмотренных условиями целей. Загруженные файлы, документы, тексты и ссылки не используются для обучения собственных моделей Verilyze и не идут на самостоятельное дообучение сторонних моделей.
Более широкая training policy, чем закреплена в документах, на этой странице не заявляется. См. политику обработки персональных данных и условия использования.
Версионирование методологии
Эта страница описывает методологию версии 1.0. При существенных изменениях контура версия будет повышена, а дата обновления изменена. Уточнение формулировок без смены модели может обновлять только дату.