Томас Ши Тао Хуан: Пионер компьютерного зрения и обработки изображений
Thomas Huang
Томас Хуан: биография китайско-американского ученого, инженера и пионера в области компьютерного зрения, распознавания образов и взаимодействия человек-компьютер.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Китайско-американский инженер и учёный в области компьютерных наук (1936–2020)
Chinese American engineer and computer scientist (1936–2020)
Томас Ши Тао Хуан (26 июня 1936 года – 25 апреля 2020 года) – американский учёный в области компьютерных наук, инженер-электрик и писатель, родившийся в Китае. Он был исследователем и профессором-эмеритом в Университете Иллинойса в Урбане-Шампейне (UIUC). Хуан был одним из ведущих специалистов в области компьютерного зрения, распознавания образов и взаимодействия человека и компьютера.
Thomas Shi Tao Huang (, June 26, 1936 – April 25, 2020) was a Chinese born American computer scientist, electrical engineer, and writer. He was a researcher and professor emeritus at the University of Illinois at Urbana Champaign (UIUC). Huang was one of the leading figures in computer vision, pattern recognition and human computer interaction.
Ранние годы и образование
Хуан родился 26 июня 1936 года в Шанхае, Китайская Республика. В 1949 году его семья переехала на Тайвань. Хуан изучал электронику в Национальном Тайваньском университете и получил степень бакалавра в 1956 году. Затем Хуан отправился в Соединенные Штаты для обучения в Массачусетском технологическом институте (MIT). В MIT он первоначально работал с Питером Элиасом, который интересовался теорией информации и кодированием изображений, а затем с Уильямом Ф. Шрайбером. В то время коммерчески доступного сканирующего оборудования не было, поэтому потребовалось построить сканер для оцифровки и воспроизведения изображений. Компьютерные программы писались на языке ассемблера с использованием прототипа компьютера Lincoln Lab TX-0. Описания оцифрованных изображений хранились на перфорированной бумажной ленте, а его диссертация на степень Sc.D. называлась «Изобразительный шум» (1963). Его магистерская работа была посвящена алгоритмам кодирования изображений с использованием адаптивных методов интерполяции с учетом чувствительности к границам. Докторская диссертация включала исследование субъективного восприятия изобразительного шума в широком спектре. Он сотрудничал с Координированной научной лабораторией (CSL) и возглавлял группу формирования и обработки изображений Института передовых наук и технологий Бекмана, а также был сопредседателем исследовательского направления Института Бекмана по интеллектуальному взаимодействию человека и компьютера. В 2012 году он был удостоен звания Swanlund Chair – высшей почетной должности в UIUC. Хуан ушел на пенсию из преподавательской деятельности в декабре 2014 года, но продолжал активно заниматься исследовательской работой. Хуан был одним из основателей и редактором Международного журнала компьютерного зрения, графики и обработки изображений, а также серии Springer в информационных науках издательства Springer Verlag. Он участвовал в организации первого Международного симпозиума по кодированию изображений (1969), первого Международного семинара по видеокодированию с очень низкой скоростью передачи данных (1993) и первой Международной конференции по автоматическому распознаванию лиц и жестов (1995), которые впоследствии стали регулярно проводиться. Он также публиковал работы по цифровой голографии. Работая в Пердью, он занимался нелинейными фильтрами, в частности медианными фильтрами, которые стали стандартным методом удаления шума в изображениях. Некоторые из его ранних работ были посвящены сжатию изображений, а затем расширились на области улучшения, восстановления и анализа. Он разработал подходы к сжатию бинарных документов, использующие двухмерную отсканированную информацию, анализируя изменения между соседними строками сканирования и выявляя точки перехода, где следующая строка отличается. Статистические прогнозы и экспериментальные результаты соответствовали работе модели, основанной на исследованиях Дж. Дж. Я. Хуанга и Питера М. Шультайса. В 1984 году Цай и Хуан первыми представили многокадровый метод в частотной области, который связывал дискретное преобразование Фурье низкоразрешенных спутниковых изображений, полученных на этапе захвата, с непрерывным преобразованием Фурье высокоразрешенного изображения, используя обратное преобразование Фурье для получения итогового изображения с повышенным разрешением. Хуан также работал над волновыми методами кодирования и фрактальным кодированием. Волновое кодирование особенно важно для поиска изображений по содержанию в мультимедийных базах данных, содержащих изображения, видео, аудио и текст. Оно позволяет осуществлять поиск по меньшим закодированным изображениям, а не по изображениям в полном разрешении, а также создавать оглавления и семантические индексы для видео с использованием мультимедийной информации (последовательность изображений, аудио и субтитры, если они доступны). В области 3D-моделирования Хуан занимался идентификацией трехмерного движения и структуры жестких объектов по нескольким изображениям, в которых можно идентифицировать соответствующие признаки. Эта работа была важна для сжатия телевизионных изображений, разработки стандартов изображения и исследований в области компьютерного и человеческого зрения. Хуан считал обработку изображений и речи фундаментально схожими. Они также разработали методы обнаружения аудиоэлементов, которые, вероятно, привлекут внимание человека, и используют их для того, чтобы помочь людям более эффективно просматривать большие объемы аудиозаписей для поиска важной информации. Хуан внес значительный вклад в мультимодальное взаимодействие человека и компьютера и разработку интерфейсов. Он был одним из первых исследователей, объединивших методы, основанные на аудио и видео, для идентификации аффективных состояний человека. Более поздние работы Хуана и других направлены на «разработку серии алгоритмов для извлечения информации из мультимодальных данных оптимальным способом».
Huang was born June 26, 1936, in Shanghai, Republic of China. In 1949, his family moved to Taiwan. Huang studied electronics at the National Taiwan University and received his bachelor's degree in 1956. Huang went on to the United States to study at the Massachusetts Institute of Technology (MIT). At MIT he worked initially with Peter Elias, who was interested in information theory and image coding, and then with William F. Schreiber. At that time scanning equipment was not commercially available, so it was necessary to build a scanner for digitizing and reproducing images. Computer programs were written in assembly language using a prototype Lincoln Lab TX 0 computer. Descriptions of digitized images were stored on paper tape with punched holes. and his Sc. D. thesis, Pictorial noise (1963). His master's work focused on algorithms for image coding using adaptive techniques for interpolation with sensitivity to edges. His doctorate included work on the subjective effects of pictorial noise across a spectrum. He was involved with the Coordinated Science Laboratory (CSL), and served as head of the Image Formation and Processing Group of the Beckman Institute for Advanced Science and Technology and co chair of the Beckman Institute's research track on Human Computer Intelligent Interaction. As of 2012, he was named a Swanlund Chair, the highest endowed title at UIUC. Huang retired from teaching as of December 2014, but continued to be active as a researcher. Huang was a founding editor of the International Journal of Computer Vision, Graphics and Image Processing, and of Springer Verlag's Springer Series in Information Sciences. He helped to organize the first International Picture Coding Symposium (1969), the first International Workshop on Very Low Bitrate Video Coding (1993), and the first International Conference on Automatic Face and Gesture Recognition (1995), all of which became repeated events. He also published on digital holography. While at Purdue, he worked on nonlinear filters, particularly median filters, which became a standard technique for the removal of noise in images. Some of his earliest work dealt with image compression, extending later into areas of enhancement, restoration and analysis. He developed approaches for binary document compression that utilized 2 dimensional scanned information, examining the changes from one line of a scan to the next, and detecting transition points at which a subsequent line differs. Statistical predictions and experimental results of the model's performance conformed well. building on the work of J. J. Y. Huang and Peter M. Schultheiss. In 1984, Tsai and Huang were the first to present a frequency domain multi frame method which related the discrete Fourier transform of observed low resolution satellite images from the acquisition stage to the continuous Fourier transform of the high resolution image, using the inverse Fourier transform to obtain a final image with increased resolution. Huang also worked on wavelet methods of encoding and on fractal coding. Wavelet coding is particularly important for content based image retrieval from multimedia databases containing images, video, audio, and text. It enables searches to be done on smaller encoded images rather than on full size retrieved images. and constructing tables of contents and semantic indexes for video using multimedia information (image sequence, audio, and closed captions if available). In the area of 3 D modelling, Huang worked on the identification of three dimensional motion and the structure of rigid objects given multiple images in which corresponding features can be identified. This work was important for the compression of television images, for the development of image standards, and for research into human and computer vision. Huang considered image and speech processing to be fundamentally similar, They also developed methods for detecting audio elements that are likely to attract human attention, and are using them to enable humans to more effectively go through large amounts of audio recordings to find important information. Huang did important work in multimodal human computer interaction and interface design. He was one of the first researchers to combine audio and video based techniques for identification of human affective states. More recent work by Huang and others attempts to "develop a series of algorithms to extract information from multi modality in an optimal way",
Хуан также надеялся разработать более естественные и эффективные способы взаимодействия человека с компьютером или виртуальной средой с использованием речи и жестов, включая использование визуального чтения по губам для повышения точности распознавания речи и интеграцию распознавания речи и анализа визуальных жестов для управления дисплеями в виртуальных средах. В 2015 году Хуан вместе с Энн Виллемсен Данлап работал над междисциплинарным проектом по разработке трехмерного компьютерного аватара, способного отображать соответствующие эмоции, для использования в онлайн-коммуникации медицинской информации пациентам. Он также исследовал использование высокопроизводительных вычислений и больших данных для разработки более совершенных методов глубокого обучения.
Huang also hoped to develop more natural and effective ways for humans to interact with a computer or virtual environment using speech and gesture. the use of visual lip reading to enhance audio speech recognition accuracy; and integration of speech recognition and visual gesture analysis in the controlling of displays in virtual environments. In 2015, Huang worked with Ann Willemsen Dunlap in an interdisciplinary project to develop a 3 D computer generated avatar, capable of showing appropriate emotions, to be used in online communication of medical information to patients. He also explored the use of high performance computing and big data to develop better techniques for deep learning.
Награды
Хуан руководил более чем 100 аспирантами. В 2012 году Фонд Томаса и Маргарет Хуан для поддержки исследований аспирантов был создан по инициативе бывших студентов Джеймса Дж. Куча и Чан Вэнь Чэна, чтобы отметить вклад Хуана и его жены в качестве наставников и преподавателей, а также его вклад как исследователя. Фонд будет предоставлять стипендии для поддержки студентов, занимающихся интеллектуальным взаимодействием человека и компьютера, в Институте Бекмана.
Huang supervised more than 100 graduate students. In 2012, the Thomas and Margaret Huang Fund for Graduate Research was created in response to appeals by former students James J. Kuch and Chang Wen Chen, to celebrate the contributions of Huang and his wife as mentors and teachers as well as his contributions as a researcher. The fund will provide scholarships to support students in Human Computer Intelligent Interaction at the Beckman Institute.