Вычислительная лингвистика
-
Вычислительная лингвистика: моделирование и изучение языка.
Компьютерная лингвистика: изучение языка с помощью вычислений, ИИ, математики и других наук. История, задачи и развитие области с 1950-х годов.
-
Обработка естественного языка: история и современные подходы.
Обработка естественного языка (NLP): лингвистика и компьютерные науки. Обучение машин пониманию и анализу человеческой речи и текста.
-
Вычислительный лексикон английского языка: WordNet и его применение.
WordNet: вычислительный лексикон английского языка для анализа текста и ИИ. Синонимы, определения, примеры использования. Бесплатная база данных!
-
Корпусная лингвистика: изучение языка на основе реальных текстов
Корпусная лингвистика: изучение языка на основе реальных текстов. Анализ корпусов текстов для выявления языковых закономерностей и сравнения языков.
-
Цифровые коллекции языковых данных
Корпус текстов: что это такое? Обзор лингвистических и технологических корпусов, их виды (моно- и многоязычные) и применение в NLP и исследованиях языка.
-
Лексический анализ и токенизация в компьютерных науках.
Лексическое токенизирование: преобразование текста в токены (слова, символы). Отличие от токенизации в LLM – грамматика vs. вероятностный подход. SEO-оптимизация.
-
Глоссарий: определение, виды и применение
Глоссарий: что это такое? Определение, виды (двуязычные, в книгах), примеры использования терминов и понятий в различных областях знаний.
-
Генерация текста на естественных языках
Генерация естественного языка (NLG): создание текста машиной на основе данных. Применение в отчетах, чат-ботах и AI. Искусственный интеллект и лингвистика.
-
Анализ текста: извлечение информации и методы исследования
Текстовая аналитика (Text Mining): извлечение ценной информации из текста – сайтов, книг, отзывов. Автоматический анализ данных, выявление трендов.
-
Извлечение информации из неструктурированных документов.
Извлечение информации (IE) из неструктурированных документов с помощью NLP. Автоматизация обработки текста, изображений и видео для структурирования данных.
-
Коллокации в корпусной лингвистике
Коллокации в корпусной лингвистике: сочетаемость слов, типы (прил.+сущ., глагол+наречие и др.), извлечение коллокаций. Важно для анализа текстов и SEO.
-
Автоматическое суммирование текста: методы и подходы
Автоматическое суммирование текста и изображений с помощью ИИ и NLP. Компьютерные методы для создания кратких и информативных выжимок данных.
-
Латентный семантический анализ в обработке естественного языка
Латентный семантический анализ (LSA) в NLP: анализ связей между документами и терминами. Использует SVD для снижения размерности и сравнения текстов.
-
Метод извлечения предложений для автоматического реферирования текста.
Автоматическое суммирование текста: метод извлечения предложений. Быстрый и простой способ, но может страдать связность итоговой выжимки. SEO-оптимизация.
-
Стоп-слова: неиндексируемые слова в поисковых системах.
Стоп-слова в поисковых системах: что это, зачем нужны и как используются в обработке текста. Оптимизация индексации и экономия ресурсов.
-
Программа проверки грамматики и правописания текста
Проверка грамматики онлайн: что такое, как работает? История и применение программ для исправления ошибок в тексте. NLP и Writer's Workbench.
-
Корпус Брауна: Американский английский 1961 года
Корпус Брауна: свод текстов амер. англ. 1961 года (1 млн слов). Исследование частоты слов, жанров. Основа для лингвистики и анализа языка.
-
Нормализация текста: приведение к единому каноническому виду.
Нормализация текста: приведение к единому формату для обработки и хранения. Устранение неоднозначности чисел, дат, аббревиатур. Важно для синтеза речи.
-
Матрица "документ-термин": история и применение в анализе текста.
Матрица "документ-термин": что это такое? Определение, создание и применение в обработке естественного языка и анализе текстов. NLP, частота терминов.
-
Семантическая близость и связь в обработке естественного языка.
Семантическая близость в обработке естественного языка: измерение сходства значений слов и понятий, а не просто совпадений. Различия с семантической связанностью.
-
Извлечение именованных сущностей из неструктурированного текста.
Распознавание именованных сущностей (NER): извлечение и классификация сущностей (люди, организации, даты) из неструктурированного текста. Высокая точность!
-
Статистическое моделирование языка
Языковые модели: статистические основы, применение в распознавании речи, машинном переводе и генерации текста. Современные LLM и их эволюция.
-
Единая медицинская терминологическая система (UMLS): обзор и возможности
Унифицированная медицинская языковая система (UMLS): обзор, возможности и инструменты для биоинформатики и обработки естественного языка в медицине.
-
Ключевые слова в корпусной лингвистике: определение и анализ.
Ключевые слова в тексте: определение, выявление с помощью статистического анализа (loglinear, chi squared) и корпусной лингвистики. Важность для контекста.
-
Statistically improbable phrase
-
Американский национальный корпус: структура, аннотации и возможности использования.
Американский национальный корпус (ANC): 22 млн слов американского английского с 1990 г. Тексты, речь, email, Twitter. Бесплатный доступ к OANC!
-
Шотландский корпус текстов и речи (SCOTS)
Шотландский корпус текстов и речи (SCOTS): онлайн-доступ к 4.7 млн слов шотландского английского и скотс с 1940 года. Бесплатный поиск и изучение!
-
Конкорданс: История, виды и применение
Конкорданс: алфавитный список слов в книге с контекстом. Исторически важен для религиозных текстов и классики. Сейчас теряет актуальность с развитием поиска.
-
Анализ биомедицинских текстов: извлечение информации и знаний
Анализ биомедицинских текстов: извлечение знаний из научных статей (BioNLP). Методы, применение в PubMed, обработка больших объемов данных.
-
Проверка и исправление орфографии в компьютерных программах.
Проверка орфографии: как работает? 🔎 Предложения слов при ошибках в текстах, словарях и поисковиках. Корпусы текстов для точного анализа.
-
WebFountain: Анализ неструктурированных данных в сети Интернет
WebFountain от IBM: аналитика больших данных из интернета. Сбор, хранение и анализ неструктурированной информации для выявления трендов и закономерностей.
-
LinguaStream: Платформа для обработки естественного языка
LinguaStream: бесплатная платформа для обработки естественного языка (NLP) от GREYC. Создание и оценка сложных аналитических потоков для текстов.
-
Деревья банков: Структура и применение размеченных текстовых корпусов в лингвистике.
Трийбанк: что это такое? Разбор структуры предложений в лингвистических корпусах, применение в компьютерной лингвистике. История и терминология.
-
Сегментация текста в практике письма
Сегментация текста: разделение на смысловые единицы (слова, предложения, темы). Важно для чтения и обработки естественного языка (NLP).
-
Выравнивание слов в билингвальном тексте: методы и применение.
Выравнивание слов в битексте: определение соответствий между словами в двуязычном тексте для машинного перевода. Ключевой этап для статистического МП.
-
Латентное распределение Дирихле: модель для выявления скрытых тем и структур в данных.
Латентное распределение Дирихле (LDA): вероятностная модель для автоматического выделения тем в текстах. Применение в NLP и популяционной генетике.
-
Lexical chain
-
Word error rate
-
Analogical modeling