AI語音已逐步滲透到了大眾的生活中,但是刻板的對話方式似乎還困擾著廣大用戶。
全雙工這個概念對人工智能行業(yè)從業(yè)者來講,并不陌生。談到全雙工,此前,谷歌Duplex幫助人們通過電話預(yù)約餐廳和理發(fā)師的功能,帶來了有趣的觀感體驗,在I/O 2019上,谷歌宣布對Duplex進(jìn)行重大擴(kuò)展。
谷歌Duplex
在推進(jìn)對話交互智能的市場化應(yīng)用過程中,思必馳同樣發(fā)現(xiàn),自然流暢的對話體驗、類人化的交互體驗成為了絕對的剛需。
因此,具備以上兩個特點(diǎn)的全雙工語音交互技術(shù),成為了關(guān)注的焦點(diǎn)。思必馳聯(lián)合創(chuàng)始人、首席科學(xué)家俞凱,早在劍橋大學(xué)期間主導(dǎo)開發(fā)了全雙工口語對話系統(tǒng),2010年參加國際對話系統(tǒng)研究挑戰(zhàn)賽時,獲得可控測試的冠軍,這也是世界上最早的全雙工端到端口語對話系統(tǒng)之一。區(qū)別在于,與現(xiàn)在廣泛作用于物聯(lián)網(wǎng)智能終端設(shè)備的全雙工交互系統(tǒng)相比,當(dāng)時的主要應(yīng)用,在基于電話信道的人機(jī)交互方面。
全雙工是個系統(tǒng)工程
作為系統(tǒng)工程,全雙工需要綜合利用語音語言技術(shù)的各個模塊,實(shí)現(xiàn)前后聯(lián)動,例如,其對前端信號處理、AEC回聲消除有強(qiáng)相關(guān)依賴,實(shí)時上傳的音頻對噪聲處理、音頻音質(zhì)要求較高,同時,作為系統(tǒng)工程,全雙工涉及到全鏈路語音交互的各個模塊,其同樣需要對識別后的識別信息、語義信息等進(jìn)行綜合判斷及處理,并做出決策。
半雙工&全雙工
因此,全雙工交互技術(shù)的提升涉及到對話系統(tǒng)的各個模塊,不僅各個模塊的功能需要提升,模塊間的配合能力更需要完善。
思必馳在推進(jìn)全雙工交互技術(shù)的市場落地過程中,發(fā)現(xiàn)了一個更有效的事情,“全雙工+語義拒識”讓交互體驗更加優(yōu)化。全雙工固然重要,但語義拒識算法,卻往往容易被人忽視。
語義拒識算法
受限于語音技術(shù)的發(fā)展,現(xiàn)有的對話系統(tǒng)受噪聲條件的影響非常明顯,缺乏穩(wěn)健性。在對話系統(tǒng)中,說話人的檢測和基于語義的拒識是其非常重要的組成部分。當(dāng)說話人的語音模糊不清或者語音數(shù)據(jù)不在已有訓(xùn)練集合中時,識別系統(tǒng)會產(chǎn)生識別錯誤,從而影響對話系統(tǒng)的識別和理解效果。
在半雙工狀態(tài)下,環(huán)境噪聲以及周圍人聲容易引起無效輸入,對話系統(tǒng)或錯誤響應(yīng),或給出“沒聽懂”的呆板播報,并且播報時不能打斷,十分影響交互效率。全雙工狀態(tài)下,對無實(shí)際語義的輸入則不會給出響應(yīng)。
拒識算法主要目的是去除沒有語義意義的音頻片段,節(jié)省后端處理的計算資源,提高整個對話系統(tǒng)的交互魯棒性,提升用戶使用體驗,避免錯誤的語義理解引發(fā)錯誤的反饋到用戶端。
思必馳語義拒識算法
思必馳拒識算法能夠解決的很多噪聲和無語義意義的問題,例如用戶無意義的嗯啊聲、背景噪聲與閑聊聲、純音樂聲、聲音幅度小、各種笑聲尖叫聲,無厘頭聲音等。
語義拒識對全雙工對話交互而言至關(guān)重要,可以說,拒識做不好,全雙工的效果往往也會差強(qiáng)人意。
思必馳全雙工交互技術(shù),更強(qiáng)的持續(xù)對話能力
思必馳全雙工交互技術(shù),讓更流暢的多輪對話成為常態(tài),說法更自由。
l連續(xù)交互免喚醒
過去,半雙工狀態(tài)下,用戶的跨領(lǐng)域交互每次交互都需要重新喚醒,于是,免喚醒技術(shù)成為改善體驗的焦點(diǎn)。近些年,免喚醒技術(shù)已不是新鮮方案,有的采用“便捷喚醒詞定制”,有的采用“喚醒+識別理解一體化”方案,但都存在著諸如“漏字”這類一系列的風(fēng)險:
“你好小馳明天天氣如何?”
漏字通常出現(xiàn)在喚醒詞和后面識別文本連接的地方,也就是句子中段。當(dāng)系統(tǒng)在識別過程中漏掉“明”字時,就會造成時間信息不清晰(“明天”還是“今天”?),系統(tǒng)無法明確用戶的真正時間指令。而現(xiàn)在,思必馳全雙工技術(shù)方案可實(shí)現(xiàn)一次喚醒,在多個領(lǐng)域持續(xù)交互,跨領(lǐng)域指代消解。
l動態(tài)斷句
在日常生活中,很多用戶說話會出現(xiàn)拖音現(xiàn)象,說話過程中,有思考/間斷的過程,因此會出現(xiàn)很多半截句,簡單粗暴的調(diào)整語音端點(diǎn)檢測閾值的做法往往會帶來對話卡頓的現(xiàn)象。
半雙工狀態(tài)下,對話系統(tǒng)設(shè)定了固定的停頓檢測時間,用戶還未表達(dá)完整句子稍微一猶豫/停頓,會被語音端點(diǎn)檢測系統(tǒng)誤斷句,造成輸入內(nèi)容不完整,機(jī)器無法理解。
思必馳全雙工交互技術(shù)則在云端根據(jù)用戶說話節(jié)奏和內(nèi)容,忽略無意義噪聲,動態(tài)斷句,既能保證用戶輸入的完整性,又能保證較快的響應(yīng)速度。在回復(fù)方面,則可以適時的回復(fù)“嗯”等接話話術(shù),系統(tǒng)打破了對用戶說話規(guī)則的要求,用戶可以按照自身的說話習(xí)慣來進(jìn)行交流,交互過程更加人性化。
l語義打斷,避免誤打斷
在半雙工狀態(tài)下,語音合成播放時很難進(jìn)行打斷,在一些終端設(shè)備上,行業(yè)內(nèi)普遍采用的打斷方式是“快捷喚醒詞打斷”,說法十分固定,無法泛化,需要定制多個喚醒詞,當(dāng)用戶想打斷的時候,必須要重復(fù)喚醒詞,容易發(fā)生誤打斷。同時,對話打斷對環(huán)境有較高要求,在有噪聲的時候,也容易被誤打斷。
思必馳全雙工交互技術(shù)可在對話的過程中,實(shí)時語義打斷,不容易出現(xiàn)誤打斷,同時,對沒有語義的輸入,則不會打斷語音合成播放。
這一技術(shù)在智能客服的領(lǐng)域?qū)蟠蟾纳葡M(fèi)者的體驗,消費(fèi)者可以隨時隨刻打斷機(jī)器人客服的無效對話信息,進(jìn)行信息咨詢。
如何判斷什么時候接話,什么時候反問,機(jī)器需要有智能決策的能力,這也是思必馳全雙工技術(shù)的一大特性:主動交互。根據(jù)用戶表達(dá)狀態(tài),如“正常說話”、“主動沉默”、“無意義表達(dá)”等狀態(tài),來給予相應(yīng)的主動反饋。
思必馳全雙工交互技術(shù)支持智能判斷,尤其是能夠主動打斷用戶的復(fù)雜冗長表達(dá),主動打破沉默僵局,實(shí)現(xiàn)流暢自然的用戶口語交流習(xí)慣。當(dāng)識別到用戶正常表達(dá)時,機(jī)器等待說完后答復(fù)反饋;當(dāng)用戶大段無意義輸入或表達(dá)過于復(fù)雜時,會主動打斷并提示反問;在交互過程中,當(dāng)用戶沉默時,則可以主動發(fā)起對話交互。
同時,經(jīng)過反復(fù)打磨和優(yōu)化,該技術(shù)對系統(tǒng)功耗幾乎無影響,實(shí)現(xiàn)低功耗下的最優(yōu)質(zhì)體驗。
思必馳全雙工語音交互
實(shí)踐,是檢驗真理的唯一標(biāo)準(zhǔn)
目前,思必馳全雙工交互技術(shù)已展開全線方案滲透,包括AIOT方案和企業(yè)信息智能服務(wù),深入作用汽車、家居、電子、教育、醫(yī)療、政務(wù)、金融、物流、酒店等場景。以音箱方案為例,接入全雙工系統(tǒng)后,這款“智能助理設(shè)備終端”將更似真人助理,更具備人類親和力的特質(zhì)和邏輯思維能力,整個對話體驗更加自然流暢。
思必馳業(yè)務(wù)場景
云端全雙工中控大腦持續(xù)優(yōu)化
針對全雙工交互技術(shù),思必馳將持續(xù)優(yōu)化云端全雙工中控大腦,持續(xù)進(jìn)行策略優(yōu)化、場景優(yōu)化、單點(diǎn)技術(shù)模塊優(yōu)化,將交互體驗做的更好。
未來,多模態(tài)交互將會讓全雙工交互技術(shù)發(fā)揮更大的能量,配合聲紋識別、圖像處理、虹膜識別等技術(shù),過濾無用信息,人機(jī)交互會變得更加貼合人性,或許不遠(yuǎn)的未來,你甚至分不清與你隔屏對話的,到底是人還是機(jī)器人。
申請創(chuàng)業(yè)報道,分享創(chuàng)業(yè)好點(diǎn)子。點(diǎn)擊此處,共同探討創(chuàng)業(yè)新機(jī)遇!
2023年7月6日,第六屆世界人工智能大會(WAIC2023)在上海開幕,“人工智能大模型”是本屆大會的備受矚目的話題,據(jù)悉,在昇騰AI大模型的創(chuàng)新研發(fā)中,華為聯(lián)手26家行業(yè)領(lǐng)軍企業(yè),組建了一支協(xié)同創(chuàng)新的“AI明星隊”,云天勵飛作為中國人工智能企業(yè)的杰出代表,和互聯(lián)網(wǎng)大廠、運(yùn)營商、科研院所等優(yōu)秀團(tuán)隊
這幾個月來,以ChatGPT為代表的生成式AI展現(xiàn)出的能力令世界驚嘆。自從2016年AlphaGo戰(zhàn)勝李世石掀起了一波AI浪潮后,AI仿佛已經(jīng)沉寂了很久,ChatGPT的橫空出世就如同一束耀眼的光芒,讓AI這個名詞重回C位。過去在AI1.0時代,主要通過訓(xùn)練模型來實(shí)現(xiàn)圖像識別、聲音識別、語言處理等特
文:互聯(lián)網(wǎng)江湖作者:志剛2023年的IoT需要一個新故事。6月29日,涂鴉智能在開發(fā)者大會上,發(fā)布了企業(yè)級戰(zhàn)略PaaS2.0,希望通過一個平臺+四大開發(fā)服務(wù),建立起IoT生態(tài)。對于這場發(fā)布會,市場的態(tài)度是積極的。美東時間6月29日收盤,涂鴉智能美股股價上漲5.6%,來到1.87美元/股。近日股價穩(wěn)定
美團(tuán)曾經(jīng)的二號人物王慧文對標(biāo)OpenAI的創(chuàng)業(yè)項目光年之外,以20億賣給美團(tuán),再度引發(fā)市場對大模型的熱議。
2020年底,王慧文在朋友圈寫下這句話時,外界本以為這位伴隨中國互聯(lián)網(wǎng)發(fā)展而持續(xù)創(chuàng)業(yè)20年的人物即將告別創(chuàng)業(yè)舞臺。但是,一個曾經(jīng)多次創(chuàng)業(yè),正值壯年的互聯(lián)網(wǎng)老將心中的創(chuàng)業(yè)熱情是難以熄滅的。
我覺得我們AI的目標(biāo)是:從芯片設(shè)計到軟件生態(tài),全鏈路自主開發(fā),建立可控的世界級AI體系。所以這是俺對未來5年中國AI圈的展望和判斷。(1)2026年,英偉達(dá)造車、國產(chǎn)開車26年國產(chǎn)芯片會在推理和垂直場景上發(fā)力。以DeepSeek為代表,大多數(shù)AI大模型會以軟件彌補(bǔ)硬件不足,所以訓(xùn)練和推理分開,訓(xùn)練就
文/道哥在深陷“后門”風(fēng)波、接受網(wǎng)信辦問詢之后,英偉達(dá)的“特供版”H20芯片,又有了新消息。近日,美國科技媒體《TheInformation》援引知情人士消息稱,英偉達(dá)已悄然向其關(guān)鍵供應(yīng)商——包括負(fù)責(zé)封裝的安靠科技、供應(yīng)高帶寬內(nèi)存的三星電子、以及承擔(dān)后端處理的富士康發(fā)出指令,要求暫停所有與H20AI
文/二風(fēng)來源/節(jié)點(diǎn)財經(jīng)一場關(guān)于“中國芯”的IPO審議,正把投資者們的目光鎖定在上交所。根據(jù)上交所發(fā)布的公告,上市審核委員會已定于9月26日審議摩爾線程的科創(chuàng)板首發(fā)申請。作為中國半導(dǎo)體自主化浪潮中最受矚目的“考生”之一,包括其創(chuàng)始人顯赫的英偉達(dá)背景、高達(dá)80億元人民幣的募資雄心,以及在國產(chǎn)GPU領(lǐng)域取
技術(shù)的進(jìn)步永無止境,繼創(chuàng)下TPC-C性能&性價比雙冠之后,阿里云PolarDB云原生數(shù)據(jù)庫再度實(shí)現(xiàn)關(guān)鍵突破。9月24日杭州云棲大會上,阿里云宣布推出全球首款基于CXL(ComputeExpressLink)2.0Switch技術(shù)的PolarDB數(shù)據(jù)庫專用服務(wù)器。在原有RDMA網(wǎng)絡(luò)的基礎(chǔ)上,Polar
2025年9月24日,在杭州舉辦的云棲大會上,阿里云正式發(fā)布全新一代服務(wù)器操作系統(tǒng)AlibabaCloudLinux4(簡稱Alinux4)。Alinux4基于Linux6.6內(nèi)核打造,是首個全面遵循龍蜥社區(qū)“開源生態(tài)合作倡議”規(guī)范的商業(yè)發(fā)行版。它不僅兼容主流開源社區(qū)生態(tài),更針對阿里云最新9代ECS
9月24日,杭州云棲大會技術(shù)主論壇上,阿里云重磅發(fā)布AI安全護(hù)欄,提供五項核心安全能力,護(hù)航AI安全。一方面為客戶提供融入AIAgent開發(fā)全鏈路的原生安全防護(hù),另一方面持續(xù)用AI賦能安全產(chǎn)品智能化升級,打造Agentic-SOC安全運(yùn)營,提升安全威脅檢測和響應(yīng)效率。在過去的一年,AIAgent正在
9月24日,魔搭社區(qū)舉辦了“全球協(xié)作?科學(xué)突破?創(chuàng)意無限”的專題論壇,并發(fā)布魔搭社區(qū)國際版、科學(xué)智能專區(qū)與AIGC創(chuàng)作引擎FlowBench,旨在連接全球開發(fā)者、加速科研范式創(chuàng)新、賦能創(chuàng)意表達(dá)。自2022年11月初成立至今,魔搭社區(qū)已成長為中國最大AI開源社區(qū),其模型數(shù)量已突破10萬,服務(wù)了全球20
9月24日,2025云棲大會現(xiàn)場,阿里云CTO周靖人接連發(fā)布了七款大模型技術(shù)產(chǎn)品。七款技術(shù)產(chǎn)品覆蓋語言、語音、視覺、多模態(tài)、代碼等模型領(lǐng)域,在模型智能水平、Agent工具調(diào)用以及Coding能力、深度推理、多模態(tài)等方面均實(shí)現(xiàn)突破。在大語言模型中,阿里通義旗艦?zāi)P蚎wen3-Max全新亮相,性能超過G
9月24日,阿里云在云棲大會上宣布新一輪全球基礎(chǔ)設(shè)施擴(kuò)建計劃:將在巴西、法國和荷蘭首次設(shè)立云計算地域節(jié)點(diǎn)(region),并將擴(kuò)建墨西哥、日本、韓國、馬來西亞和迪拜的數(shù)據(jù)中心,以便更好服務(wù)全球客戶日益增長的AI和云計算需求。目前,阿里云在全球29個地區(qū)運(yùn)營91個可用區(qū),是中國最大、亞太第一的云服務(wù)商