0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫(xiě)文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

未來(lái)機(jī)器智能時(shí)代:如何讓機(jī)器聽(tīng)懂世界

HOPE開(kāi)放創(chuàng)新平臺(tái) ? 2017-12-08 10:55 ? 次閱讀

語(yǔ)言承載了人類(lèi)文化,人類(lèi)需要通過(guò)語(yǔ)言學(xué)習(xí)知識(shí)和傳遞信息,這是人類(lèi)區(qū)別于動(dòng)物界最重要的特性之一。

因此,未來(lái)的機(jī)器智能時(shí)代,機(jī)器也必然需要通過(guò)語(yǔ)言實(shí)現(xiàn)與人類(lèi)之間的交互,似乎最近的科幻片都已經(jīng)暗示了這個(gè)問(wèn)題。

現(xiàn)在的科幻就是未來(lái)的現(xiàn)實(shí),因此,讓機(jī)器聽(tīng)懂世界,這是未來(lái)機(jī)器智能時(shí)代的關(guān)鍵問(wèn)題,也是人類(lèi)一個(gè)更大的夢(mèng)想,但是,我們距離人類(lèi)的這個(gè)夢(mèng)想還有多遠(yuǎn)呢?

01讓機(jī)器聽(tīng)懂世界承載了人類(lèi)千年夢(mèng)想

首先明確一個(gè)概念,讓機(jī)器聽(tīng)懂世界,這里面其實(shí)蘊(yùn)含了多個(gè)歷程,包括聽(tīng)懂人類(lèi)語(yǔ)言,進(jìn)而聽(tīng)懂動(dòng)物叫聲,甚至聽(tīng)懂自然聲音,亦或類(lèi)似地球的耳朵LIGO那樣聆聽(tīng)宇宙的“聲音”。

所有這些都是極其復(fù)雜的過(guò)程,因?yàn)槲覀內(nèi)祟?lèi)實(shí)際上也沒(méi)有達(dá)到這種能力,但是我們期望機(jī)器能夠延伸人類(lèi)的能力,從而實(shí)現(xiàn)人類(lèi)的夢(mèng)想。所以語(yǔ)音智能事實(shí)上承載的是幾千年來(lái)人類(lèi)的偉大夢(mèng)想。

那么,如何才能讓機(jī)器聽(tīng)懂人類(lèi)語(yǔ)言呢?這需要解決三個(gè)核心關(guān)鍵問(wèn)題:聽(tīng)見(jiàn)、聽(tīng)準(zhǔn)和聽(tīng)懂,從技術(shù)角度來(lái)看,就是拾音、識(shí)別和理解三個(gè)關(guān)鍵技術(shù)環(huán)節(jié)。

拾音是最為基礎(chǔ)的環(huán)節(jié),必須保證讓機(jī)器聽(tīng)得見(jiàn)聲音,這部分主要是聲學(xué)問(wèn)題;

識(shí)別是將符合要求的聲音轉(zhuǎn)化成文字,這部分主要是語(yǔ)音識(shí)別的問(wèn)題;

理解則是根據(jù)識(shí)別出來(lái)的文字,準(zhǔn)確理解人類(lèi)的指令甚或情感。

鑒于語(yǔ)音智能設(shè)備已經(jīng)大量出現(xiàn)在我們生活場(chǎng)景之中,當(dāng)前技術(shù)的核心關(guān)鍵就是聲學(xué)問(wèn)題和語(yǔ)義理解。

02近場(chǎng)語(yǔ)音是機(jī)器聽(tīng)懂人類(lèi)的率先嘗試

近場(chǎng)語(yǔ)音交互主要是指人類(lèi)距離機(jī)器不超過(guò)30厘米范圍的語(yǔ)音識(shí)別技術(shù),這項(xiàng)技術(shù)利用距離巧妙回避了真實(shí)場(chǎng)景下復(fù)雜的聲學(xué)問(wèn)題,可以理解為一種實(shí)驗(yàn)室理想環(huán)境下的語(yǔ)音交互技術(shù)。

近場(chǎng)語(yǔ)音識(shí)別從上世紀(jì)五十年代就開(kāi)始研究,但是長(zhǎng)期沒(méi)有實(shí)質(zhì)性進(jìn)展,直到蘋(píng)果在2010年推出Siri的應(yīng)用,這才引起了全球的關(guān)注。到現(xiàn)在為止,近場(chǎng)語(yǔ)音交互技術(shù)已經(jīng)比較成熟,平均識(shí)別率可以達(dá)到95%以上。

但是近場(chǎng)語(yǔ)音交互受到了真實(shí)場(chǎng)景的巨大制約,并沒(méi)有展現(xiàn)出來(lái)語(yǔ)音交互可以解放雙手的先進(jìn)性,因此在很多場(chǎng)景中,事實(shí)上近場(chǎng)語(yǔ)音交互都是雞肋一般的存在,并沒(méi)有發(fā)揮出真正的威力。

直到遠(yuǎn)場(chǎng)語(yǔ)音交互技術(shù)的出現(xiàn),成功解決了真實(shí)場(chǎng)景下的復(fù)雜聲學(xué)問(wèn)題以后,至少技術(shù)達(dá)到了用戶(hù)認(rèn)可的門(mén)檻,語(yǔ)音交互才真正出現(xiàn)了替代鍵盤(pán)鼠標(biāo)和觸摸屏的可能性。

03遠(yuǎn)場(chǎng)語(yǔ)音將語(yǔ)音智能落地到真實(shí)場(chǎng)景

遠(yuǎn)場(chǎng)語(yǔ)音交互主要解決30厘米到5米范圍內(nèi)的語(yǔ)音交互問(wèn)題,這個(gè)范圍事實(shí)上就是人類(lèi)之間溝通交流的最佳距離,距離太近容易觸發(fā)自我保護(hù)意識(shí),而距離太遠(yuǎn)則會(huì)增大交流難度。

注意語(yǔ)音交互并非只是語(yǔ)音問(wèn)題,人類(lèi)的交互其實(shí)是一個(gè)綜合的過(guò)程,包括了表情、眼神、肢體動(dòng)作等等一系列影響因素。

遠(yuǎn)場(chǎng)語(yǔ)音交互的歷史是比較短暫的,這項(xiàng)技術(shù)以前長(zhǎng)期沒(méi)有實(shí)質(zhì)性突破,直到2016年末,全球才真正開(kāi)始重視這項(xiàng)技術(shù),并且短短一年時(shí)間,引領(lǐng)全球市場(chǎng)都進(jìn)入了激烈博弈的階段。

遠(yuǎn)場(chǎng)語(yǔ)音交互的代表產(chǎn)品自然就是智能音箱,盤(pán)點(diǎn)一下全球巨頭在智能音箱的布局就可窺得一二。亞馬遜的Echo發(fā)布四年已然影響深遠(yuǎn),谷歌的Home劍走偏鋒以技術(shù)做博弈,微軟的Invoke則仍然堅(jiān)持工程師定義產(chǎn)品的文化......

注意,這里還是特別強(qiáng)調(diào)智能音箱只是遠(yuǎn)場(chǎng)語(yǔ)音交互的突破口,并非什么語(yǔ)音的唯一入口,因?yàn)槲磥?lái)的機(jī)器智能時(shí)代,比如電視、冰箱、汽車(chē)都有可能成為重要入口。但是智能音箱又是非常重要的,因?yàn)椴还墚a(chǎn)品形態(tài)怎樣變化,其本質(zhì)的核心其實(shí)還是智能音箱的技術(shù)架構(gòu)。

04聽(tīng)懂世界還有哪些必須解決的問(wèn)題?

若讓機(jī)器聽(tīng)懂世界,遠(yuǎn)場(chǎng)語(yǔ)音交互技術(shù)也僅是個(gè)嘗試而已,事實(shí)上遠(yuǎn)場(chǎng)語(yǔ)音技術(shù)本身也只是剛剛起步,即便5米以?xún)?nèi),其噪聲抑制、回聲抵消、混響去除、遠(yuǎn)場(chǎng)喚醒和遠(yuǎn)場(chǎng)識(shí)別等核心技術(shù)還存在諸多缺陷。

但是技術(shù)一直在迭代發(fā)展,特別是當(dāng)技術(shù)落地場(chǎng)景以后,源源不斷的真實(shí)數(shù)據(jù)和客戶(hù)需求將帶動(dòng)技術(shù)更加快速的發(fā)展。

從技術(shù)層面來(lái)看,讓機(jī)器聽(tīng)懂世界涉及了數(shù)學(xué)、物理學(xué)、語(yǔ)言學(xué)、醫(yī)學(xué)、計(jì)算機(jī)學(xué)等各學(xué)科的知識(shí),很難一一枚舉出來(lái),但是若從應(yīng)用場(chǎng)景來(lái)看,則相對(duì)比較簡(jiǎn)單,讓機(jī)器聽(tīng)懂世界包括了人類(lèi)語(yǔ)言、人類(lèi)情感、動(dòng)物聲音和自然聲音。

讓機(jī)器聽(tīng)懂世界的技術(shù)正在全球快速的演化,相信不久的將來(lái),我們肯定能看到更加智能的機(jī)器。

因此,既不要抨擊當(dāng)前的人工智能技術(shù),也不要盛贊現(xiàn)在的基礎(chǔ)科技技術(shù),保持一顆平靜的心,正確給予科技界和產(chǎn)業(yè)界的支持才是對(duì)于未來(lái)最大的投資。

聲明:本文內(nèi)容及配圖由入駐作者撰寫(xiě)或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • 機(jī)器人
    +關(guān)注

    關(guān)注

    211

    文章

    28578

    瀏覽量

    207799
  • 人工智能
    +關(guān)注

    關(guān)注

    1793

    文章

    47535

    瀏覽量

    239367
  • 智能語(yǔ)音
    +關(guān)注

    關(guān)注

    10

    文章

    789

    瀏覽量

    48831

原文標(biāo)題:讓機(jī)器聽(tīng)懂世界,觸及人類(lèi)夢(mèng)想還有多遠(yuǎn)?

文章出處:【微信號(hào):haierhope,微信公眾號(hào):HOPE開(kāi)放創(chuàng)新平臺(tái)】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。

收藏 人收藏

    評(píng)論

    相關(guān)推薦

    【「具身智能機(jī)器人系統(tǒng)」閱讀體驗(yàn)】2.具身智能機(jī)器人的基礎(chǔ)模塊

    非常重要的地位。 先說(shuō)這個(gè)自主機(jī)器人的計(jì)算系統(tǒng)。計(jì)算系統(tǒng)是自主機(jī)器人的關(guān)鍵部件。自主機(jī)器人通過(guò)智能計(jì)算系統(tǒng)與物理世界交互,自主地完成任務(wù)。通
    發(fā)表于 01-04 19:22

    【「具身智能機(jī)器人系統(tǒng)」閱讀體驗(yàn)】2.具身智能機(jī)器人大模型

    中取得了令人矚目的效果。 閱讀感悟 從傳統(tǒng)的手動(dòng)編程到借助大模型實(shí)現(xiàn)智能化、自主化,從單一模態(tài)的交互到多模態(tài)信息的深度融合,再到擴(kuò)散模型的應(yīng)用,機(jī)器人控制技術(shù)正在以驚人的速度進(jìn)化。這不僅機(jī)器
    發(fā)表于 12-29 23:04

    【「具身智能機(jī)器人系統(tǒng)」閱讀體驗(yàn)】1.初步理解具身智能

    對(duì)人工智能、機(jī)器人技術(shù)和計(jì)算系統(tǒng)交叉領(lǐng)域感興趣的讀者來(lái)說(shuō)不可或缺的書(shū)。這本書(shū)深入探討了具身智能這一結(jié)合物理機(jī)器人和智能算法的領(lǐng)域,該領(lǐng)域正在
    發(fā)表于 12-28 21:12

    【「具身智能機(jī)器人系統(tǒng)」閱讀體驗(yàn)】1.全書(shū)概覽與第一章學(xué)習(xí)

    非常感謝電子發(fā)燒友提供的這次書(shū)籍測(cè)評(píng)活動(dòng)!最近,我一直在學(xué)習(xí)大模型和人工智能的相關(guān)知識(shí),深刻體會(huì)到機(jī)器人技術(shù)是一個(gè)極具潛力的未來(lái)方向,甚至可以說(shuō)是推動(dòng)時(shí)代變革的重要力量。能參與這次活動(dòng)
    發(fā)表于 12-27 14:50

    《具身智能機(jī)器人系統(tǒng)》第7-9章閱讀心得之具身智能機(jī)器人與大模型

    研讀《具身智能機(jī)器人系統(tǒng)》第7-9章,我被書(shū)中對(duì)大模型與機(jī)器人技術(shù)融合的深入分析所吸引。第7章詳細(xì)闡述了ChatGPT for Robotics的核心技術(shù)創(chuàng)新:它摒棄了傳統(tǒng)的分層控制架構(gòu),創(chuàng)造性地
    發(fā)表于 12-24 15:03

    【「具身智能機(jī)器人系統(tǒng)」閱讀體驗(yàn)】+數(shù)據(jù)在具身人工智能中的價(jià)值

    嵌入式人工智能(EAI)將人工智能集成到機(jī)器人等物理實(shí)體中,使它們能夠感知、學(xué)習(xí)環(huán)境并與之動(dòng)態(tài)交互。這種能力使此類(lèi)機(jī)器人能夠在人類(lèi)社會(huì)中有效地提供商品及服務(wù)。 數(shù)據(jù)是一種貨幣化工具 數(shù)
    發(fā)表于 12-24 00:33

    【「具身智能機(jī)器人系統(tǒng)」閱讀體驗(yàn)】+初品的體驗(yàn)

    的快速發(fā)展,相關(guān)人才的需求也在不斷增加,通過(guò)閱讀該書(shū)可以幫助大家系統(tǒng)性地了解和分析當(dāng)前具身智能機(jī)器人系統(tǒng)的發(fā)展現(xiàn)狀和前沿研究,為未來(lái)的研究和開(kāi)發(fā)工作提供指導(dǎo)。此外,本書(shū)還可以為研究人員和工程師提供具體
    發(fā)表于 12-20 19:17

    《具身智能機(jī)器人系統(tǒng)》第1-6章閱讀心得之具身智能機(jī)器人系統(tǒng)背景知識(shí)與基礎(chǔ)模塊

    意味著在“具身智能”領(lǐng)域,還沒(méi)有哪一個(gè)玩家能像O社那樣能站在AGI的制高點(diǎn)。 具身智能從字面上拆解為“具身+智能”,指的是一種將機(jī)器學(xué)習(xí)算法適配至物理實(shí)體,從而與物理
    發(fā)表于 12-19 22:26

    名單公布!【書(shū)籍評(píng)測(cè)活動(dòng)NO.51】具身智能機(jī)器人系統(tǒng) | 了解AI的下一個(gè)浪潮!

    試用評(píng)測(cè)資格! 早就聽(tīng)大佬們說(shuō),具身智能是人工智能的下一波浪潮,也是AI未來(lái)的趨勢(shì)! 最近,具身智能的概念更是炙手可熱,備受矚目! 不論是這幾天稚暉君開(kāi)源人形
    發(fā)表于 11-11 10:20

    軟通動(dòng)力與智元機(jī)器人攜手亮相世界機(jī)器人大會(huì)

    北京2024年8月22日?/美通社/ -- 8月21日,以"共育新質(zhì)生產(chǎn)力?共享智能未來(lái)"為主題的2024世界機(jī)器人大會(huì)在北京開(kāi)幕。作為數(shù)字技術(shù)產(chǎn)品和服務(wù)創(chuàng)新領(lǐng)導(dǎo)企業(yè)以及人形
    的頭像 發(fā)表于 08-22 13:12 ?480次閱讀
    軟通動(dòng)力與智元<b class='flag-5'>機(jī)器</b>人攜手亮相<b class='flag-5'>世界</b><b class='flag-5'>機(jī)器</b>人大會(huì)

    ROS機(jī)器人開(kāi)發(fā)更便捷,基于RK3568J+Debian系統(tǒng)發(fā)布!

    化的快速發(fā)展,智能機(jī)器人設(shè)備已成為工業(yè)自動(dòng)化體系的佼佼者,而智能機(jī)器人設(shè)備核心—ROS系統(tǒng),是機(jī)器人領(lǐng)域的集大成者,主要應(yīng)用于
    發(fā)表于 07-09 11:38

    特斯拉Optimus人形機(jī)器人再進(jìn)化,上海世界人工智能大會(huì)首秀引領(lǐng)未來(lái)

    在科技日新月異的今天,人工智能機(jī)器人技術(shù)的每一次飛躍都牽動(dòng)著全球的目光。近日,特斯拉官方宣布了一個(gè)振奮人心的消息:其精心研發(fā)的第二代Optimus人形機(jī)器人將于7月4日至7日在中國(guó)上海的世界
    的頭像 發(fā)表于 07-04 15:48 ?524次閱讀

    名單公布!【書(shū)籍評(píng)測(cè)活動(dòng)NO.35】如何用「時(shí)間序列與機(jī)器學(xué)習(xí)」解鎖未來(lái)

    的提升和數(shù)據(jù)可獲取性的增加,大模型已經(jīng)成為人工智能研究和應(yīng)用的一個(gè)重要趨勢(shì)。 這些模型在處理復(fù)雜任務(wù)時(shí),尤其是在自然語(yǔ)言處理(NLP)、計(jì)算機(jī)視覺(jué)、語(yǔ)音識(shí)別等領(lǐng)域,展現(xiàn)出非凡的能力。 大數(shù)據(jù)時(shí)代為訓(xùn)練復(fù)雜
    發(fā)表于 06-25 15:00

    富唯智能:打造未來(lái)機(jī)器人教育新標(biāo)桿

    隨著科技的飛速發(fā)展,機(jī)器人教育正逐漸成為培養(yǎng)未來(lái)人才的重要領(lǐng)域。富唯智能,作為業(yè)內(nèi)領(lǐng)先的機(jī)器人技術(shù)提供商,近日推出了一款全新的機(jī)器人教育實(shí)踐
    的頭像 發(fā)表于 04-23 16:45 ?392次閱讀

    AI算法的本質(zhì)是模擬人類(lèi)智能,機(jī)器實(shí)現(xiàn)智能

    視覺(jué)等領(lǐng)域。 ? AI 算法的核心是實(shí)現(xiàn)智能化的決策和行為 ? AI算法的本質(zhì)在于模擬人類(lèi)智能的能力,計(jì)算機(jī)能夠?qū)ΜF(xiàn)實(shí)世界進(jìn)行模擬和模仿,從而達(dá)到
    的頭像 發(fā)表于 02-07 00:07 ?5928次閱讀