Машины, которые говорят и слушают

Реферат - Компьютеры, программирование

Другие рефераты по предмету Компьютеры, программирование

?я, что уже в ближайшее время ЭВМ, оборудованные системами речевого вывода, настолько проникнут в нашу жизнь, что совершенно изменят взаимоотношения человека и техники.

В основе систем автоматического речевого ответа, поступающих в настоящее время на рынок, лежат три основных способа синтеза рэчи - непосредственное кодирование речевой волны (дискрети-аация и сжатие), форматный синтез и синтез, основанный на линейном предиктивном кодировании (линейном предсказании). В [б] приводятся системы автоматического речевого вывода - наиболее распространенные в настоящее время в США системы такого рода. Так, в сис-томч Votrax процесс формирования устного высказывания по тексту, поступившему из ЭВМ или с клавиатуры в закодированном виде,начинается о разбивки текста на основные звуковые влементы - фонемы. Так как фонемная цепочка, соответствующая тексту, не обеспечивает высокочастотной речи, то эта цепочка программно преобразуется в цепочку аллофонных кодов (аллофоны - это варианты произнесения фонем в зависимости от контекста; разные исследователи называют различное число аллофонов для каждого языка;в системе Votrax используется 12Ь аллофонов, что позволяет получать более естественную речь). Для порождения слитной речи аллофоны Должны плавно переходить друг в друга.

Каждому аллофону соответствует управляющее слово, воздействующее на аппаратный синтезатор звуков, который в два этапа перерабатывает цепочку 12-разрядных управляющих слов. На первом этапе Управляющее слово декодируется и перерабатывается в аналоговые управляющие сигналы, задающие частоту основного тона, длительность изменения во времени амплитуды и гармоник, связанных с каждым ал-Яофоном. На втором этапе реализуется собственно синтез. При этом параметрические сигналы, воздействуя на генераторы звука и прог-Рачмируемые фильтры, преобразуются в звуки речи. Звонкие звуки оздаются с помощью генератора регулируемой высоты тона, а глухие - с помощью генератора бел го шума.

В приборах Texas Instruments три большие интегральные сис-^ы (БИС) моделируют голосовой тракт человека. В основе модели вяит метод линейного предсказания (или линейного предиктивного ко-

45

дирования - ЛПК). При ЛПК на кристалл синтезатора подаются значения коэффициентов для цифрового фильтра второго порядка,который моделирует динамику форматных частот. Вычисление коэффициентов фильтра производит другая БИС - микропроцессор тыз -1000. Третья БИС хранит отдельные части слов в параметрическом виде. Воссоздание речи по этим параметрам осуществляет сложный программный алгоритм.

Преимущество метода ЛПК заключается в тс-л, что он позволяет воспользоваться тем фактом, что голосовой тракт человека относительно медленно меняет свои параметры при речеобразовании.Это свойство ограничивает диапазон изменения форматных параметров, которые могут следовать за форматами уже с генерированных отрезков звуков речи. Такое прогнозирование уменьшает требования к объему памяти системы, а также к скорости обмена данными; с описываемой системой она равна 1200 бит/с.

Синтезатор National Semiconduoton Inc. способен осуществлять анаяого-цифровое преобразование речевых сигналов и сохранять их в памяти для дальнейшего восстановления. Такой метод предполагает огромный объем информации, которая должна храниться в памяти, что делает его малопривлекательным. Однако в рассматриваемой системе эта трудность обходится за счет использования различных методов сжатия данных. Это позволило реализовать качественный синтез речи во временной области на уровне &1С.

Дискретизацию и сжатие исходной речи, записанной на магнитной ленте, осуществляет мини-ЭВМ. Результирующие данные сохраняются в постоянном запоминающем устройстве (ПЗУ) для последующего восстановления, осуществляемого БИС процессора речи. Благодаря применению Трех методов сжатия (подстройки фазового угла, дельта-модуляции и полупериодного обнуления) скорость поступления данных, по которым восстанавливается нормальная речь, снижается примерно до 1000 бит/с речи, так что по ПЗУ емкостью 10 кбит можно хранить примерно 10 слов.

Процесс сяатия начинается с дискретизации аналогового речевого Сигнала и разделения цифрового массива на участки, в каждом из которых 128 оГсчетов; эти участки в какой-то степени характеризуют периоды основного тона. Для получения набора цифровых выборок, аналогичных формируемому предложению, подстраиваются фазовые углы этих отрезков. Дальнейшее сжатие осуществляется с помощью дельта-модуляции, в результате чего вместо хранения абсолютной амплитуды каждой выборки в память записываются только знаки приращения амплитуд относительно предшествующего значения.

46

рассмотрим далее более подробно несколько современных систем параметрического синтеза.

В ГЮО] описана разработанная фирмой Texas Instrument a программа, позволяющая преобразовывать произвольный текст в речь. Программа совместно с интегральным синтезатором речи типа tms-5й00 позволяет читать вслух информацию, отражаемую на экране дисплея домашнего компьютера 9S14. В отличив от Speak and Spell система не иоподозувт записанные ранее в ПЗУ слова и фразы, а синтезирует слова из 128 аллофонов (аналогично системе Votrax описанной ранее), которые объединяются системой для образования слитной речи. Программа преобразования текста в цепочку аллофонов выбирает аллофоны из библиотеки и определяет их ударение и интонацию. Затем эта информация поступает в блок синтеза речи, к?/p>