Темы

Вычислительная лингвистика

Computational Linguistics · 39 статей

  1. Вычислительная лингвистика: моделирование и изучение языка.

    Компьютерная лингвистика: изучение языка с помощью вычислений, ИИ, математики и других наук. История, задачи и развитие области с 1950-х годов.

    #1206 · 2 мин чтения

  2. Обработка естественного языка: история и современные подходы.

    Обработка естественного языка (NLP): лингвистика и компьютерные науки. Обучение машин пониманию и анализу человеческой речи и текста.

    #5213 · 7 мин чтения

  3. Вычислительный лексикон английского языка: WordNet и его применение.

    WordNet: вычислительный лексикон английского языка для анализа текста и ИИ. Синонимы, определения, примеры использования. Бесплатная база данных!

    #8101 · 10 мин чтения

  4. Корпусная лингвистика: изучение языка на основе реальных текстов

    Корпусная лингвистика: изучение языка на основе реальных текстов. Анализ корпусов текстов для выявления языковых закономерностей и сравнения языков.

    #9458 · 6 мин чтения

  5. Цифровые коллекции языковых данных

    Корпус текстов: что это такое? Обзор лингвистических и технологических корпусов, их виды (моно- и многоязычные) и применение в NLP и исследованиях языка.

    #12619 · 1 мин чтения

  6. Лексический анализ и токенизация в компьютерных науках.

    Лексическое токенизирование: преобразование текста в токены (слова, символы). Отличие от токенизации в LLM – грамматика vs. вероятностный подход. SEO-оптимизация.

    #18273 · 10 мин чтения

  7. Глоссарий: определение, виды и применение

    Глоссарий: что это такое? Определение, виды (двуязычные, в книгах), примеры использования терминов и понятий в различных областях знаний.

    #47923 · 1 мин чтения

  8. Генерация текста на естественных языках

    Генерация естественного языка (NLG): создание текста машиной на основе данных. Применение в отчетах, чат-ботах и AI. Искусственный интеллект и лингвистика.

    #75049 · 5 мин чтения

  9. Анализ текста: извлечение информации и методы исследования

    Текстовая аналитика (Text Mining): извлечение ценной информации из текста – сайтов, книг, отзывов. Автоматический анализ данных, выявление трендов.

    #78026 · 8 мин чтения

  10. Извлечение информации из неструктурированных документов.

    Извлечение информации (IE) из неструктурированных документов с помощью NLP. Автоматизация обработки текста, изображений и видео для структурирования данных.

    #88865 · 5 мин чтения

  11. Коллокации в корпусной лингвистике

    Коллокации в корпусной лингвистике: сочетаемость слов, типы (прил.+сущ., глагол+наречие и др.), извлечение коллокаций. Важно для анализа текстов и SEO.

    #98135 · 2 мин чтения

  12. Автоматическое суммирование текста: методы и подходы

    Автоматическое суммирование текста и изображений с помощью ИИ и NLP. Компьютерные методы для создания кратких и информативных выжимок данных.

    #127809 · 23 мин чтения

  13. Латентный семантический анализ в обработке естественного языка

    Латентный семантический анализ (LSA) в NLP: анализ связей между документами и терминами. Использует SVD для снижения размерности и сравнения текстов.

    #134075 · 9 мин чтения

  14. Метод извлечения предложений для автоматического реферирования текста.

    Автоматическое суммирование текста: метод извлечения предложений. Быстрый и простой способ, но может страдать связность итоговой выжимки. SEO-оптимизация.

    #168866 · 2 мин чтения

  15. Стоп-слова: неиндексируемые слова в поисковых системах.

    Стоп-слова в поисковых системах: что это, зачем нужны и как используются в обработке текста. Оптимизация индексации и экономия ресурсов.

    #171037 · 3 мин чтения

  16. Программа проверки грамматики и правописания текста

    Проверка грамматики онлайн: что такое, как работает? История и применение программ для исправления ошибок в тексте. NLP и Writer's Workbench.

    #177488 · 5 мин чтения

  17. Корпус Брауна: Американский английский 1961 года

    Корпус Брауна: свод текстов амер. англ. 1961 года (1 млн слов). Исследование частоты слов, жанров. Основа для лингвистики и анализа языка.

    #187764 · 3 мин чтения

  18. Нормализация текста: приведение к единому каноническому виду.

    Нормализация текста: приведение к единому формату для обработки и хранения. Устранение неоднозначности чисел, дат, аббревиатур. Важно для синтеза речи.

    #196828 · 2 мин чтения

  19. Матрица "документ-термин": история и применение в анализе текста.

    Матрица "документ-термин": что это такое? Определение, создание и применение в обработке естественного языка и анализе текстов. NLP, частота терминов.

    #196956 · 5 мин чтения

  20. Семантическая близость и связь в обработке естественного языка.

    Семантическая близость в обработке естественного языка: измерение сходства значений слов и понятий, а не просто совпадений. Различия с семантической связанностью.

    #220890 · 4 мин чтения

  21. Извлечение именованных сущностей из неструктурированного текста.

    Распознавание именованных сущностей (NER): извлечение и классификация сущностей (люди, организации, даты) из неструктурированного текста. Высокая точность!

    #263197 · 6 мин чтения

  22. Статистическое моделирование языка

    Языковые модели: статистические основы, применение в распознавании речи, машинном переводе и генерации текста. Современные LLM и их эволюция.

    #263596 · 2 мин чтения

  23. Единая медицинская терминологическая система (UMLS): обзор и возможности

    Унифицированная медицинская языковая система (UMLS): обзор, возможности и инструменты для биоинформатики и обработки естественного языка в медицине.

    #320393 · 3 мин чтения

  24. Ключевые слова в корпусной лингвистике: определение и анализ.

    Ключевые слова в тексте: определение, выявление с помощью статистического анализа (loglinear, chi squared) и корпусной лингвистики. Важность для контекста.

    #326976 · 3 мин чтения

  25. Statistically improbable phrase

    #333926 · 2 мин чтения

  26. Американский национальный корпус: структура, аннотации и возможности использования.

    Американский национальный корпус (ANC): 22 млн слов американского английского с 1990 г. Тексты, речь, email, Twitter. Бесплатный доступ к OANC!

    #335527 · 2 мин чтения

  27. Шотландский корпус текстов и речи (SCOTS)

    Шотландский корпус текстов и речи (SCOTS): онлайн-доступ к 4.7 млн слов шотландского английского и скотс с 1940 года. Бесплатный поиск и изучение!

    #346601 · 2 мин чтения

  28. Конкорданс: История, виды и применение

    Конкорданс: алфавитный список слов в книге с контекстом. Исторически важен для религиозных текстов и классики. Сейчас теряет актуальность с развитием поиска.

    #349645 · 2 мин чтения

  29. Анализ биомедицинских текстов: извлечение информации и знаний

    Анализ биомедицинских текстов: извлечение знаний из научных статей (BioNLP). Методы, применение в PubMed, обработка больших объемов данных.

    #350357 · 14 мин чтения

  30. Проверка и исправление орфографии в компьютерных программах.

    Проверка орфографии: как работает? 🔎 Предложения слов при ошибках в текстах, словарях и поисковиках. Корпусы текстов для точного анализа.

    #351067 · 3 мин чтения

  31. WebFountain: Анализ неструктурированных данных в сети Интернет

    WebFountain от IBM: аналитика больших данных из интернета. Сбор, хранение и анализ неструктурированной информации для выявления трендов и закономерностей.

    #361828 · 1 мин чтения

  32. LinguaStream: Платформа для обработки естественного языка

    LinguaStream: бесплатная платформа для обработки естественного языка (NLP) от GREYC. Создание и оценка сложных аналитических потоков для текстов.

    #394760 · 1 мин чтения

  33. Деревья банков: Структура и применение размеченных текстовых корпусов в лингвистике.

    Трийбанк: что это такое? Разбор структуры предложений в лингвистических корпусах, применение в компьютерной лингвистике. История и терминология.

    #403166 · 2 мин чтения

  34. Сегментация текста в практике письма

    Сегментация текста: разделение на смысловые единицы (слова, предложения, темы). Важно для чтения и обработки естественного языка (NLP).

    #433728 · 3 мин чтения

  35. Выравнивание слов в билингвальном тексте: методы и применение.

    Выравнивание слов в битексте: определение соответствий между словами в двуязычном тексте для машинного перевода. Ключевой этап для статистического МП.

    #449551 · 2 мин чтения

  36. Латентное распределение Дирихле: модель для выявления скрытых тем и структур в данных.

    Латентное распределение Дирихле (LDA): вероятностная модель для автоматического выделения тем в текстах. Применение в NLP и популяционной генетике.

    #452001 · 5 мин чтения

  37. Lexical chain

    #477317 · 3 мин чтения

  38. Word error rate

    #479716 · 4 мин чтения

  39. Analogical modeling

    #493147 · 5 мин чтения