用Java实现语音引擎Word下载.docx-资源下载

用Java实现语音引擎Word下载.docx

1、现在，对于在命令行上（或者调用sayPhoneWord（）方法时）提供的“h|e|l|oo”字符串，你或许有所不解。下面我就来解释一下。语音引擎的工作原理是把细小的声音样本连接起来，每一个样本都是人的语言发音（英语）的一个最小单位。这些声音样本称为音素（allophone）。每一个因素对应一个、二个或者三个字母。从前面“hello”的语音表示可以看出，一些字母组合的发音显而易见，还有一些却不是很明显：h - 读音显而易见e - 读音显而易见l - 读音显而易见，但注意两个“l”被简缩成了一个“l”。OO - 应该读作“hello”中的读音，不应读作“bot”、“too”中的读音。下面是一个有效

2、音素的清单：a ：如catb ：如cabc ：d ：如dote ：如betf ：如frogg ：h ：如hogi ：如pigj ：如jigk ：如kegl ：如legm ：如metn ：如begino ：如notp ：如potr ：如rots ：如satt ：u ：如putv ：如havew ：如wety ：如yetz ：如zooaa ：如fakeay ：如hayee ：如beeii ：如highoo ：如gobb ： b的变化形式，重音不同dd ： d的变化形式，重音不同ggg ： g的变化形式，重音不同hh ： h的变化形式，重音不同ll

3、： l的变化形式，重音不同nn ： n的变化形式，重音不同rr ： r的变化形式，重音不同tt ： t的变化形式，重音不同yy ： y的变化形式，重音不同ar ：如caraer ：如carech ：如whichck ：如checkear ：如beerer ：如latererr ：如later （长音）ng ：如feedingor ：如lawou ：ouu ：如zoo （长音）ow ：如cowoy ：如boysh ：如shutth ：如thingdth ：如thisuh ： u 的变化形式wh ：如wherezh ：如Asian人说话的时候，语音在整个句子之内

4、起落变化。语调变化使得语音更自然、更富有感染力，使得问句和陈述句能够相互区别。请考虑下面两个句子：It is fake - f|aa|kIs it fake? - f|AA|k也许你已经猜想到，提高语调的方法是使用大写字母。以上就是使用该软件时你需要了解的东西。如果你对其后台实现细节感兴趣，请继续阅读。二、实现语音引擎语音引擎的实现只包括一个类，四个方法。它利用了J2SE 1.3包含的Java Sound API。在这里，我不准备全面地介绍这个API，但你可以通过实例学习它的用法。Java Sound API并不是一个特别复杂的API，代码中的注释将告诉你必须了解的知识。下面是Talker类的

5、基本定义：package com.lotontech.speech;import javax.sound.sampled.*;import java.io.*;import java.util.*;import .*;public class Talkerprivate SourceDataLine line=null;如果从命令行执行Talker，下面的main（）方法将作为入口点运行。main（）方法获取第一个命令行参数，然后把它传递给sayPhoneWord（）方法：/* 读出在命令行中指定的表示读音的字符串*/public static void main（String args）Ta

6、lker player=new Talker（）;if （args.length0） player.sayPhoneWord（args0）;System.exit（0）;sayPhoneWord（）方法既可以通过上面的main（）方法调用，也可以在Java程序中直接调用。从表面上看， sayPhoneWord（）方法比较复杂，其实并非如此。实际上，它简单地遍历所有单词的语音元素（在输入字符串中语音元素以“|”分隔），通过一个声音输出通道一个元素一个元素地播放出来。为了让声音更自然一些，我把每一个声音样本的结尾和下一个声音样本的开头合并了起来：* 读出指定的语音字符串public void sa

7、yPhoneWord（String word）/ 为上一个声音构造的模拟byte数组byte previousSound=null;/ 把输入字符串分割成单独的音素StringTokenizer st=new StringTokenizer（word,|,false）;while （st.hasMoreTokens（）/ 为音素构造相应的文件名字String thisPhoneFile=st.nextToken（）;thisPhoneFile=/allophones/+thisPhoneFile+.au;/ 从声音文件读取数据byte thisSound=getSound（thisPhoneF

8、ile）;if （previousSound!=null）/ 如果可能的话，把前一个音素和当前音素合并int mergeCount=0;if （previousSound.length=500 & thisSound.length=500）mergeCount=500;for （int i=0; ipreviousSoundpreviousSound.length-mergeCount+i=（byte）（previousSoundpreviousSound.length-mergeCount+i+thisSoundi）/2）;/ 播放前一个音素playSound（previousSound）;

9、/ 把经过截短的当前音素作为前一个音素byte newSound=new bytethisSound.length-mergeCount;for （int ii=0; iinewSoundii=thisSoundii+mergeCount;previousSound=newSound;elsepreviousSound=thisSound;/ 播放最后一个音素，清理声音通道drain（）;在sayPhoneWord（）的后面，你可以看到它调用playSound（）输出单个声音样本（即一个音素），然后调用drain（）清理声音通道。下面是playSound（）的代码：* 该方法播放一个声音样本p

10、rivate void playSound（byte data）if （data.length0） line.write（data, 0, data.length）;下面是drain（）的代码：* 该方法清理声音通道private void drain（）if （line!=null） line.drain（）;try Thread.sleep（100）; catch （Exception e）现在回过头来看sayPhoneWord（），这里还有一个方法我们没有分析，即getSound（）方法。getSound（）方法从一个au文件以字节数据的形式读入预先录制的声音样本。要了解读取数据、转换

11、音频格式、初始化声音输出行（SouceDataLine）以及构造字节数据的详细过程，请参考下面代码中的注释：* 该方法从文件读取一个音素，* 并把它转换成byte数组private byte getSound（String fileName）tryURL url=Talker.class.getResource（fileName）;AudioInputStream stream = AudioSystem.getAudioInputStream（url）;AudioFormat format = stream.getFormat（）;/ 把一个ALAW/ULAW声音转换成PCM以便回放if （

12、format.getEncoding（） = AudioFormat.Encoding.ULAW） |（format.getEncoding（） = AudioFormat.Encoding.ALAW）AudioFormat tmpFormat = new AudioFormat（AudioFormat.Encoding.PCM_SIGNED,format.getSampleRate（）, format.getSampleSizeInBits（） * 2,format.getChannels（）, format.getFrameSize（） * 2,format.getFrameRate（）,

13、 true）;stream = AudioSystem.getAudioInputStream（tmpFormat, stream）;format = tmpFormat;DataLine.Info info = new DataLine.Info（Clip.class, format,（int） stream.getFrameLength（） * format.getFrameSize（）;if （line=null）/ 输出线还没有实例化/ 是否能够找到合适的输出线类型？DataLine.Info outInfo = new DataLine.Info（SourceDataLine.cla

14、ss,format）;if （!AudioSystem.isLineSupported（outInfo）System.out.println（不支持匹配 + outInfo + 的输出线throw new Exception（/ 打开输出线line = （SourceDataLine） AudioSystem.getLine（outInfo）;line.open（format, 50000）;line.start（）;int frameSizeInBytes = format.getFrameSize（）;int bufferLengthInFrames = line.getBufferSiz

15、e（） / 8;int bufferLengthInBytes = bufferLengthInFrames * frameSizeInBytes;byte data=new bytebufferLengthInBytes;/ 读取字节数据，并计数int numBytesRead = 0;if （numBytesRead = stream.read（data） != -1）int numBytesRmaining = numBytesRead;/ 把字节数据切割成合适的大小byte newData=new bytenumBytesRead;newDatai=datai;return newDa

16、ta;catch （Exception e）return new byte0;这就是全部的代码，包括注释在内，一个大约150行代码的语音合成器。三、文本-语音转换以语音元素的格式指定待朗读的单词似乎过于复杂，如果要构造一个能够朗读文本（比如Web页面或Email）的应用，我们希望能够直接指定原始的文本。深入分析这个问题之后，我在本文后面的ZIP文件中提供了一个试验性的文本-语音转换类。运行这个类，它将显示出分析结果。文本-语音转换类可以从命令行执行，如下所示：java com.lotontech.speech.Converter hello there输出结果类如：hello - h|e|l|

17、oothere - dth|aer如果运行下面这个命令：I like to read JavaWorld则输出结果为：i -like - l|ii|kto - t|ouuread - r|ee|a|djava - j|a|v|aworld - w|err|l|d这个转换类是如何工作的呢？实际上，我的方法相当简单，转换过程就是以一定的次序应用一组文本替换规则。例如对于单词“ant”、“want”、“wanted”、“unwanted”和“unique”，则我们想要应用的替换规则可能依次为：用“|y|ou|n|ee|k|”替换“*unique*”用“|w|o|n|t|”替换“*want*”用“|a

18、|”替换“*a*”用“|e|”替换“*e*”用“|d|”替换“*d*”用“|n|”替换“*n*”用“|u|”替换“*u*”用“|t|”替换“*t*”对于“unwanted”，输出序列为：unwantedun|w|o|n|t|ed （规则2）|u|n|w|o|n|t|e|d| （规则4、5、6、7）u|n|w|o|n|t|e|d （删除多余的符之后）你将看到包含字母“wont”的单词和包含字母“ant”的单词以不同的方式发音，还将看到在特例规则的作用下，“unique”作为一个完整单词优先于其他规则，从而“unique”这个单词读作“y|ou.”而不是“u|n.”。结束语：本文提供了一个可以随时运行的、方便的语音引擎，你可以在自己的Java1.3应用中使用它。如果仔细分析一下代码，它还为你提供了一个用JavaSound API播放音频片断的实用教程。要让它变得真正有用，你应该考虑一下文本-语音转换技术，因为对于我前面提到的文本阅读应用来说，这是真正的支撑基础。要改善本文方案的效果，你必须构造出一个庞大的替换规则库，精心调整应用规则的优先次序。希望你比我更有毅力！

邮箱/手机：
温馨提示：	快捷下载时，用户名和密码都是您填写的邮箱或者手机号，方便查询和重复下载（系统自动生成）。如填写123，账号就是123，密码也是123。
特别说明：	请自助下载，系统不会自动发送文件的哦；如果您已付费，想二次下载，请登录后访问：我的下载记录
支付方式：
验证码：	换一换

账号：
密码：
验证码：	换一换
当日自动登录忘记密码？