Информационный взрыв: проблемы и последствия роста объемов данных.
Information explosion
Информационный взрыв: резкий рост объёма данных и сложность управления информацией. Перегрузка информацией, история термина с 1964 года. SEO-оптимизация.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Быстрый рост объема опубликованной информации или данных.
Rapid increase in the amount of published information or data
Информационный взрыв – это быстрый рост объема опубликованной информации или данных и последствия этого изобилия. По мере увеличения количества доступных данных, проблема управления информацией становится всё более сложной, что может привести к информационной перегрузке. Онлайн-оксфордский словарь английского языка указывает на использование этой фразы в статье журнала New Statesman за март 1964 года. Газета The New York Times впервые использовала эту фразу в своей редакционной статье 7 июня 1964 года в статье Уолтера Салливана, где он описал её как "широко обсуждаемую" (стр. 11). Самое раннее известное использование фразы зафиксировано в речи президента NBC Пэта Уивера о телевидении, произнесенной 27 сентября 1955 года в Институте практиков рекламы в Лондоне. Речь была повторно передана на радиостанции WSUI в Айове, а выдержки из неё были опубликованы в газете Daily Iowan два месяца спустя. Многие секторы испытывают этот быстрый рост объема доступной информации, такие как здравоохранение, торговля и государственное управление. Еще одним сектором, на который влияет это явление, является журналистика. Профессия, которая в прошлом отвечала за распространение информации, сегодня может оказаться подавлена её избытком. Методы извлечения знаний из огромного количества электронной информации (например, объединение данных может помочь в анализе данных) существуют с 1970-х годов. Другой распространенный метод работы с таким объемом информации – качественные исследования. Эти подходы направлены на организацию информации, её синтез, категоризацию и систематизацию для повышения удобства использования и облегчения поиска.
The information explosion is the rapid increase in the amount of published information or data and the effects of this abundance. As the amount of available data grows, the problem of managing the information becomes more difficult, which can lead to information overload. The Online Oxford English Dictionary indicates use of the phrase in a March 1964 New Statesman article. The New York Times first used the phrase in its editorial content in an article by Walter Sullivan on June 7, 1964, in which he described the phrase as "much discussed". (p11.) The earliest known use of the phrase was in a speech about television by NBC president Pat Weaver at the Institute of Practitioners of Advertising in London on September 27, 1955. The speech was rebroadcast on radio station WSUI in Iowa and excerpted in the Daily Iowan newspaper two months later. Many sectors are seeing this rapid increase in the amount of information available such as healthcare, supermarkets, and governments. Another sector that is being affected by this phenomenon is journalism. Such a profession, which in the past was responsible for the dissemination of information, may be suppressed by the overabundance of information today. Techniques to gather knowledge from an overabundance of electronic information (e. g., data fusion may help in data mining) have existed since the 1970s. Another common technique to deal with such amount of information is qualitative research. Such approaches aim to organize the information, synthesizing, categorizing and systematizing in order to be more usable and easier to search.
Вызовы
Несмотря на то, что обилие информации может быть полезным на различных уровнях, некоторые проблемы вызывают опасения, такие как конфиденциальность, правовые и этические нормы, фильтрация и точность данных. Фильтрация подразумевает поиск полезной информации в огромном объеме данных, что напрямую связано с работой специалистов по данным. Типичным примером необходимости фильтрации данных (анализа данных) является здравоохранение, поскольку в ближайшие годы ожидается появление электронных медицинских карт (ЭМК) пациентов. При таком количестве доступной информации врачам потребуется выявлять закономерности и отбирать важные данные для постановки диагноза. Уровень доступности можно повысить либо за счет снижения стоимости, либо за счет увеличения полезности информации. Автор полагает, что снижение стоимости возможно благодаря ассоциациям, которые должны оценить релевантность информации и собрать ее в более структурированном виде.
Even though the abundance of information can be beneficial in several levels, some problems may be of concern such as privacy, legal and ethical guidelines, filtering and data accuracy. Filtering refers to finding useful information in the middle of so much data, which relates to the job of data scientists. A typical example of a necessity of data filtering (data mining) is in healthcare since in the next years is due to have EHRs (Electronic Health Records) of patients available. With so much information available, the doctors will need to be able to identify patterns and select important data for the diagnosis of the patient. The accessibility rate could be improved by either reducing the costs or increasing the utility of the information. The reduction of costs according to the author, could be done by associations, which should assess which information was relevant and gather it in a more organized fashion.
Веб-серверы
По состоянию на август 2005 года насчитывалось более 70 миллионов веб-серверов. По состоянию на 2007 год насчитывалось более 135 миллионов веб-серверов.
As of August 2005, there were over 70 million web servers. as of 2007 there were over 135 million web servers.
Блоги
Согласно данным Technorati, количество блогов удваивается примерно каждые 6 месяцев, и по состоянию на 2006 год их насчитывалось 35,3 миллиона. Это пример начальной стадии логистического роста, когда рост приблизительно экспоненциален, поскольку блоги – относительно новое явление. По мере приближения числа блогов к числу потенциальных авторов (людей) наступает насыщение, темпы роста замедляются, и количество блогов в конечном итоге стабилизируется.
According to Technorati, the number of blogs doubles about every 6 months with a total of 35.3 million blogs as of 2006. This is an example of the early stages of logistic growth, where growth is approximately exponential, since blogs are a recent innovation. As the number of blogs approaches the number of possible producers (humans), saturation occurs, growth declines, and the number of blogs eventually stabilizes.