分享
 
 
 

用Java实现语音引擎

王朝java/jsp·作者佚名  2008-05-31
窄屏简体版  字體: |||超大  

为应用程序加上语音能力有什么好处呢?粗略地讲,是为了趣味,它适合所有注重趣味的

应用,比如游戏。当然,从更严厉的角度来讲,它还涉及到应用的可用性问题。注重,这

里我考虑的不仅是可视化界面固有的不足,而且还有这样一些情形:一些时候,让双眼离

开当前的工作很不方便,甚至是不合法的。比如,假设有一个带语音功能的浏览器,你就

可以在外出散步或开车上班的同时,用听的方式浏览自己喜爱的网站。

从目前来看,邮件阅读器或许是语音技术更实际的应用,在JavaMail API的帮助下,

这一切已经可能。邮件阅读器可以定期地检查收件箱,然后用语音“You have new mail,

would you like me to read it to you?”引起你的注重。按照类似的思路,我们还可以

考虑一个带语音功能的提醒器,把它连接到一个日历应用:它会及时地提醒你“Don't

forget your meeting with the boss in 10 minutes!”。

也许你已经被这些主意吸引,或者有了自己更好的主意,现在让我们继续。首先我将

介绍如何启用本文提供的语音引擎,这样,假如你认为语音引擎的实现细节过于复杂,就

可以直接使用它而忽略其实现细节。

一、试用语音引擎

要使用这个语音引擎,你必须在CLASSPATH中加入本文提供的javatalk.jar文件,然后从

命令行运行(或者从Java程序调用)com.lotontech.speech.Talker类。假如从命令行运

行,则命令为:

java com.lotontech.speech.Talker "heloo"

假如从Java程序调用,则代码为:

com.lotontech.speech.Talker talker=new com.lotontech.speech.Talker();

talker.sayPhoneWord("heloo");

现在,对于在命令行上(或者调用sayPhoneword()方法时)提供的“heloo”字符串,你

或许有所不解。下面我就来解释一下。

语音引擎的工作原理是把细小的声音样本连接起来,每一个样本都是人的语言发音(英

语)的一个最小单位。这些声音样本称为音素(allophone)。每一个因素对应一个、二

个或者三个字母。从前面“hello”的语音表示可以看出,一些字母组合的发音显而易见,

还有一些却不是很明显:

h -- 读音显而易见

e -- 读音显而易见

l -- 读音显而易见,但注重两个“l”被简缩成了一个“l”。

OO -- 应该读作“hello”中的读音,不应读作“bot”、“too”中的读音。

下面是一个有效音素的清单:

a : 如cat

b : 如cab

c : 如cat

d : 如dot

e : 如bet

f : 如frog

g : 如frog

h : 如hog

i : 如pig

j : 如jig

k : 如keg

l : 如leg

m : 如met

n : 如begin

o : 如not

p : 如pot

r : 如rot

s : 如sat

t : 如sat

u : 如put

v : 如have

w : 如wet

y : 如yet

z : 如zoo

aa : 如fake

ay : 如hay

ee : 如bee

ii : 如high

oo : 如go

bb : b的变化形式,重音不同

dd : d的变化形式,重音不同

ggg : g的变化形式,重音不同

hh : h的变化形式,重音不同

ll : l的变化形式,重音不同

nn : n的变化形式,重音不同

rr : r的变化形式,重音不同

tt : t的变化形式,重音不同

yy : y的变化形式,重音不同

ar : 如car

aer : 如care

ch : 如which

ck : 如check

ear : 如beer

er : 如later

err : 如later (长音)

ng : 如feeding

or : 如law

ou : 如zoo

ouu : 如zoo (长音)

ow : 如cow

oy : 如boy

sh : 如shut

th : 如thing

dth : 如this

uh : u 的变化形式

wh : 如where

zh : 如Asian

人说话的时候,语音在整个句子之内起落变化。语调变化使得语音更自然、更富有感染

力,使得问句和陈述句能够相互区别。请考虑下面两个句子:

It is fake -- faak

Is it fake? -- fAAk

也许你已经猜想到,提高语调的方法是使用大写字母。

以上就是使用该软件时你需要了解的东西。假如你对其后台实现细节感爱好,请继续阅读。

二、实现语音引擎

语音引擎的实现只包括一个类,四个方法。它利用了J2SE 1.3包含的Java Sound API。在

这里,我不预备全面地介绍这个API,但你可以通过实例学习它的用法。Java Sound API

并不是一个非凡复杂的API,代码中的注释将告诉你必须了解的知识。

下面是Talker类的基本定义:

package com.lotontech.speech;

import javax.sound.sampled.*;

import java.io.*;

import java.util.*;

import java.net.*;

public class Talker

{

private SourceDataLine line=null;

}

假如从命令行执行Talker,下面的main()方法将作为入口点运行。main()方法获取第一个

命令行参数,然后把它传递给sayPhoneword()方法:

/*

* 读出在命令行中指定的表示读音的字符串

*/

public static void main(String args[])

{

Talker player=new Talker();

if (args.length>0) player.sayPhoneword(args[0]);

System.exit(0);

}

sayPhoneword()方法既可以通过上面的main()方法调用,也可以在Java程序中直接调用。

从表面上看, sayPhoneword()方法比较复杂,其实并非如此。实际上,它简单地遍历所

有单词的语音元素(在输入字符串中语音元素以“”分隔),通过一个声音输出通道一个

元素一个元素地播放出来。为了让声音更自然一些,我把每一个声音样本的结尾和下一个

声音样本的开头合并了起来:

/*

* 读出指定的语音字符串

*/

public void sayPhoneword(String word)

{

// 为上一个声音构造的模拟byte数组

byte[] previousSound=null;

// 把输入字符串分割成单独的音素

StringTokenizer st=new StringTokenizer(word,"",false);

while (st.hasMoreTokens())

{

// 为音素构造相应的文件名字

String thisPhoneFile=st.nextToken();

thisPhoneFile="/allophones/"+thisPhoneFile+".au";

// 从声音文件读取数据

byte[] thisSound=getSound(thisPhoneFile);

if (previousSound!=null)

{

// 假如可能的话,把前一个音素和当前音素合并

int mergeCount=0;

if (previousSound.length>=500 && thisSound.length>=500)

mergeCount=500;

for (int i=0; i

{

previousSound[previousSound.length-mergeCount+i]

=(byte)((previousSound[previousSound.length

-mergeCount+i]+thisSound[i])/2);

}

// 播放前一个音素

playSound(previousSound);

// 把经过截短的当前音素作为前一个音素

byte[] newSound=new byte[thisSound.length-mergeCount];

for (int ii=0; ii

newSound[ii]=thisSound[ii+mergeCount];

previousSound=newSound;

}

else

previousSound=thisSound;

}

// 播放最后一个音素,清理声音通道

playSound(previousSound);

drain();

}

在sayPhoneword()的后面,你可以看到它调用playSound()输出单个声音样本(即一个音

素),然后调用drain()清理声音通道。下面是playSound()的代码:

/*

* 该方法播放一个声音样本

*/

private void playSound(byte[] data)

{

if (data.length>0) line.write(data, 0, data.length);

}

下面是drain()的代码:

/*

* 该方法清理声音通道

*/

private void drain()

{

if (line!=null) line.drain();

try {Thread.sleep(100);} catch (Exception e) {}

}

现在回过头来看sayPhoneword(),这里还有一个方法我们没有分析,即getSound()方法。

getSound()方法从一个au文件以字节数据的形式读入预先录制的声音样

 
 
 
免责声明:本文为网络用户发布,其观点仅代表作者个人观点,与本站无关,本站仅提供信息存储服务。文中陈述内容未经本站证实,其真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
2023年上半年GDP全球前十五强
 百态   2023-10-24
美众议院议长启动对拜登的弹劾调查
 百态   2023-09-13
上海、济南、武汉等多地出现不明坠落物
 探索   2023-09-06
印度或要将国名改为“巴拉特”
 百态   2023-09-06
男子为女友送行,买票不登机被捕
 百态   2023-08-20
手机地震预警功能怎么开?
 干货   2023-08-06
女子4年卖2套房花700多万做美容:不但没变美脸,面部还出现变形
 百态   2023-08-04
住户一楼被水淹 还冲来8头猪
 百态   2023-07-31
女子体内爬出大量瓜子状活虫
 百态   2023-07-25
地球连续35年收到神秘规律性信号,网友:不要回答!
 探索   2023-07-21
全球镓价格本周大涨27%
 探索   2023-07-09
钱都流向了那些不缺钱的人,苦都留给了能吃苦的人
 探索   2023-07-02
倩女手游刀客魅者强控制(强混乱强眩晕强睡眠)和对应控制抗性的关系
 百态   2020-08-20
美国5月9日最新疫情:美国确诊人数突破131万
 百态   2020-05-09
荷兰政府宣布将集体辞职
 干货   2020-04-30
倩女幽魂手游师徒任务情义春秋猜成语答案逍遥观:鹏程万里
 干货   2019-11-12
倩女幽魂手游师徒任务情义春秋猜成语答案神机营:射石饮羽
 干货   2019-11-12
倩女幽魂手游师徒任务情义春秋猜成语答案昆仑山:拔刀相助
 干货   2019-11-12
倩女幽魂手游师徒任务情义春秋猜成语答案天工阁:鬼斧神工
 干货   2019-11-12
倩女幽魂手游师徒任务情义春秋猜成语答案丝路古道:单枪匹马
 干货   2019-11-12
倩女幽魂手游师徒任务情义春秋猜成语答案镇郊荒野:与虎谋皮
 干货   2019-11-12
倩女幽魂手游师徒任务情义春秋猜成语答案镇郊荒野:李代桃僵
 干货   2019-11-12
倩女幽魂手游师徒任务情义春秋猜成语答案镇郊荒野:指鹿为马
 干货   2019-11-12
倩女幽魂手游师徒任务情义春秋猜成语答案金陵:小鸟依人
 干货   2019-11-12
倩女幽魂手游师徒任务情义春秋猜成语答案金陵:千金买邻
 干货   2019-11-12
 
推荐阅读
 
 
 
>>返回首頁<<
 
靜靜地坐在廢墟上,四周的荒凉一望無際,忽然覺得,淒涼也很美
© 2005- 王朝網路 版權所有