2014 年之前,如果你去問(wèn)任何一個(gè)做視頻動(dòng)作識(shí)別的研究者"深度學(xué)習(xí)行不行",得到的答案大概率是"不太行"。
這句話(huà)現(xiàn)在聽(tīng)起來(lái)有點(diǎn)意外。畢竟就在兩年前,AlexNet 已經(jīng)在圖像識(shí)別上把傳統(tǒng)方法打得七零八落,深度學(xué)習(xí)幾乎是橫掃了整個(gè)計(jì)算機(jī)視覺(jué)圈子。但是換到視頻這個(gè)賽道上,情況完全不一樣。
【資料圖】
當(dāng)時(shí)最強(qiáng)的手工特征方法叫做密集軌跡
**密集軌跡**:一種手工設(shè)計(jì)的視頻特征提取方法,通過(guò)追蹤視頻中密集采樣的點(diǎn)在時(shí)間上的運(yùn)動(dòng)軌跡,再統(tǒng)計(jì)軌跡周?chē)膱D像和運(yùn)動(dòng)信息來(lái)描述動(dòng)作。
密集軌跡在幾個(gè)標(biāo)準(zhǔn)測(cè)試集上的表現(xiàn)相當(dāng)穩(wěn)。而基于深度學(xué)習(xí)的方法呢,反復(fù)嘗試,反復(fù)失敗,始終追不上密集軌跡的準(zhǔn)確率。這不是深度學(xué)習(xí)不努力,是視頻這個(gè)東西比靜態(tài)圖像難啃得多。一張圖片你看一眼就知道里面有沒(méi)有貓,可一段視頻里,貓可能在跑,可能在跳,畫(huà)面里同時(shí)混雜著"這是什么"和"它在做什么"兩種信息,神經(jīng)網(wǎng)絡(luò)一時(shí)不知道該抓哪頭。
這篇論文要解決的就是這個(gè)卡了兩年的難題。作者是 Karen Simonyan 和 Andrew Zisserman,牛津大學(xué) VGG 組的兩位研究者。有意思的是,幾個(gè)月后,這兩人又發(fā)表了另一篇論文,叫 VGGNet,后來(lái)成了圖像識(shí)別領(lǐng)域最經(jīng)典的網(wǎng)絡(luò)結(jié)構(gòu)之一。這兩篇論文其實(shí)是同期的工作,一篇解決視頻,一篇解決圖像,出自同一個(gè)實(shí)驗(yàn)室的同一批人。
問(wèn)題到底難在哪
先說(shuō)清楚,識(shí)別一個(gè)視頻里的動(dòng)作,和識(shí)別一張圖片里的物體,難度根本不是一個(gè)量級(jí)。
圖片識(shí)別只需要處理空間信息,一張圖有邊緣、顏色、紋理,網(wǎng)絡(luò)學(xué)會(huì)識(shí)別這些模式就夠了。視頻不一樣,視頻除了空間信息,還多了一個(gè)維度,時(shí)間。一個(gè)人揮手和一個(gè)人揮拳,靜止看某一幀,姿勢(shì)可能非常相似,真正區(qū)分它們的是動(dòng)作隨時(shí)間展開(kāi)的方式,是手臂移動(dòng)的速度和軌跡。
**手工特征**:不是通過(guò)網(wǎng)絡(luò)自動(dòng)學(xué)習(xí)出來(lái)的特征,而是研究者根據(jù)領(lǐng)域經(jīng)驗(yàn)人為設(shè)計(jì)的特征提取規(guī)則,比如密集軌跡里的運(yùn)動(dòng)統(tǒng)計(jì)量。
如果只靠一個(gè)普通的卷積神經(jīng)網(wǎng)絡(luò)去啃視頻,把每一幀當(dāng)圖片處理,再把結(jié)果拼起來(lái),會(huì)發(fā)生什么?網(wǎng)絡(luò)確實(shí)能學(xué)到一部分空間外觀信息,比如畫(huà)面里有沒(méi)有球、有沒(méi)有水,但它幾乎學(xué)不到運(yùn)動(dòng)本身的規(guī)律。這就是為什么早期直接把 CNN 搬到視頻上的嘗試,效果始終不如密集軌跡。
問(wèn)題的核心矛盾是,一個(gè)網(wǎng)絡(luò)很難同時(shí)兼顧"這個(gè)畫(huà)面里有什么"和"這個(gè)東西在往哪個(gè)方向、以多快速度移動(dòng)"這兩件事。這兩種信息的性質(zhì)完全不同,一個(gè)是靜態(tài)的視覺(jué)模式,一個(gè)是動(dòng)態(tài)的位移規(guī)律,硬塞進(jìn)同一個(gè)網(wǎng)絡(luò)里,網(wǎng)絡(luò)會(huì)顧此失彼。
雙流網(wǎng)絡(luò):把兩只眼睛分開(kāi)用
Simonyan 和 Zisserman 給出的答案很直接,既然一個(gè)網(wǎng)絡(luò)很難同時(shí)處理兩種信息,那就用兩個(gè)網(wǎng)絡(luò),一個(gè)專(zhuān)門(mén)看外觀,一個(gè)專(zhuān)門(mén)看運(yùn)動(dòng),最后把兩邊的判斷結(jié)果加權(quán)合并。
這個(gè)結(jié)構(gòu)叫做**雙流卷積網(wǎng)絡(luò)**
**雙流卷積網(wǎng)絡(luò)**:由兩條并行的卷積神經(jīng)網(wǎng)絡(luò)組成,一條輸入原始視頻幀處理空間外觀信息,另一條輸入光流場(chǎng)處理運(yùn)動(dòng)信息,兩條網(wǎng)絡(luò)分別做出預(yù)測(cè)后再融合。
空間流那條,輸入就是普通的視頻幀,和平時(shí)訓(xùn)練圖像分類(lèi)器沒(méi)什么區(qū)別,它負(fù)責(zé)回答"這個(gè)場(chǎng)景里有什么物體、什么背景"。運(yùn)動(dòng)流那條,輸入不是原始畫(huà)面,而是**光流場(chǎng)**
**光流場(chǎng)**:描述視頻中每個(gè)像素點(diǎn)在連續(xù)兩幀之間的運(yùn)動(dòng)方向和速度的一種圖像化表示,通常用兩個(gè)通道分別記錄水平和垂直方向的位移。
光流場(chǎng)這個(gè)東西你可以理解成把運(yùn)動(dòng)"翻譯"成了一張圖。原始視頻幀里有顏色、紋理這些和運(yùn)動(dòng)無(wú)關(guān)的干擾信息,光流場(chǎng)把這些全部剝離掉,只留下"這一點(diǎn)往哪個(gè)方向移動(dòng)了多遠(yuǎn)"。這樣一來(lái),運(yùn)動(dòng)流網(wǎng)絡(luò)看到的輸入本身就是純粹的運(yùn)動(dòng)信號(hào),不需要再費(fèi)力從畫(huà)面里分離運(yùn)動(dòng)和外觀,直接就能專(zhuān)心學(xué)習(xí)運(yùn)動(dòng)模式。
這里有一個(gè)日常生活里的類(lèi)比能幫你理解為什么要分成兩條線(xiàn)處理。想象你在觀看一場(chǎng)足球比賽的轉(zhuǎn)播,畫(huà)面里同時(shí)有解說(shuō)員的聲音和球場(chǎng)畫(huà)面的字幕信息。如果讓一個(gè)人同時(shí)聽(tīng)聲音、看字幕、還要判斷球員跑位,他大概會(huì)手忙腳亂,顧了這頭丟了那頭。但如果分成兩個(gè)人,一個(gè)專(zhuān)門(mén)聽(tīng)聲音判斷比賽進(jìn)程,一個(gè)專(zhuān)門(mén)看字幕和畫(huà)面判斷具體動(dòng)作,兩人各自把自己那部分做到最好,最后再交換意見(jiàn)綜合判斷,效果反而更好。雙流網(wǎng)絡(luò)就是這個(gè)思路,讓兩個(gè)專(zhuān)才網(wǎng)絡(luò)各自專(zhuān)注一件事,而不是逼一個(gè)網(wǎng)絡(luò)同時(shí)當(dāng)兩個(gè)專(zhuān)才。
如果不這樣拆開(kāi)會(huì)怎樣?論文里做了對(duì)照實(shí)驗(yàn)。只用空間流單獨(dú)跑,在 UCF-101 數(shù)據(jù)集上準(zhǔn)確率是 73%,只用運(yùn)動(dòng)流單獨(dú)跑,準(zhǔn)確率是 83.7%。而把兩條流融合起來(lái),準(zhǔn)確率跳到了 88%。單獨(dú)運(yùn)動(dòng)流已經(jīng)比單獨(dú)空間流高出十個(gè)百分點(diǎn),這說(shuō)明運(yùn)動(dòng)信息對(duì)動(dòng)作識(shí)別本身就比外觀信息更關(guān)鍵,而兩者結(jié)合后又比只用運(yùn)動(dòng)流高出四個(gè)多百分點(diǎn),說(shuō)明外觀信息也不是沒(méi)用,它能補(bǔ)充運(yùn)動(dòng)流漏掉的判斷線(xiàn)索,比如通過(guò)背景判斷這是在游泳池還是籃球場(chǎng),從而幫助區(qū)分那些動(dòng)作相似但場(chǎng)景不同的類(lèi)別。
光流怎么塞進(jìn)卷積網(wǎng)絡(luò)里
單獨(dú)看運(yùn)動(dòng)流這條網(wǎng)絡(luò),還有一個(gè)技術(shù)細(xì)節(jié)值得說(shuō)清楚,光流場(chǎng)到底是怎么變成網(wǎng)絡(luò)能吃的輸入的。
標(biāo)準(zhǔn)的光流計(jì)算方法給出的是每個(gè)像素點(diǎn)的位移向量,一個(gè)水平方向的分量和一個(gè)垂直方向的分量。論文的做法是把這兩個(gè)分量當(dāng)成兩張灰度圖疊在一起,再往前多疊幾幀的光流,一共堆成 20 張圖(10 幀光流,每幀 2 個(gè)方向分量),當(dāng)作一個(gè)多通道輸入喂給卷積網(wǎng)絡(luò)。
**光流堆疊**:把連續(xù)多幀計(jì)算出的光流場(chǎng)按時(shí)間順序疊加成一個(gè)多通道輸入,讓網(wǎng)絡(luò)能看到一段時(shí)間窗口內(nèi)的運(yùn)動(dòng)變化,而不只是相鄰兩幀的瞬時(shí)運(yùn)動(dòng)。
為什么要疊這么多幀,而不是只用一幀光流?因?yàn)橐粋€(gè)動(dòng)作往往不是一瞬間完成的,揮手這個(gè)動(dòng)作需要看到手臂連續(xù)幾幀內(nèi)的位移趨勢(shì),才能和隨便揮一下手臂做區(qū)分。只看一幀光流,信息量太單薄,網(wǎng)絡(luò)很難判斷這是一個(gè)完整動(dòng)作的起始、中段還是結(jié)束。堆疊多幀相當(dāng)于給網(wǎng)絡(luò)一個(gè)更長(zhǎng)的時(shí)間窗口去觀察運(yùn)動(dòng)的完整走勢(shì)。
論文里還專(zhuān)門(mén)測(cè)試了另一種方案,叫做**軌跡約束光流**,簡(jiǎn)單說(shuō)就是不再對(duì)整張畫(huà)面做光流統(tǒng)計(jì),而是沿著密集軌跡的路徑去采樣光流值。這個(gè)方法在某些情況下比普通光流稍好,但差距不大,說(shuō)明光流堆疊本身這個(gè)思路已經(jīng)足夠抓住運(yùn)動(dòng)的核心信息,不一定非要借用密集軌跡的采樣方式。
這里可以做一個(gè)類(lèi)比。你去看一段監(jiān)控錄像判斷有沒(méi)有人打架,只看一張靜止畫(huà)面很難判斷,兩個(gè)人站得近可能只是聊天。但如果給你連續(xù)十秒的畫(huà)面,你一眼就能看出這是拉扯還是擁抱。光流堆疊給網(wǎng)絡(luò)的就是這種"連續(xù)十秒"的信息量,而不是"一張照片"的信息量。如果只喂一幀光流,網(wǎng)絡(luò)的判斷力會(huì)像只看一張監(jiān)控截圖的保安一樣,經(jīng)常誤判。
數(shù)據(jù)不夠怎么辦:從圖像任務(wù)里借力
深度學(xué)習(xí)這時(shí)候還面臨一個(gè)更現(xiàn)實(shí)的問(wèn)題,數(shù)據(jù)不夠。
當(dāng)時(shí)最大的視頻動(dòng)作識(shí)別數(shù)據(jù)集也就幾千到一萬(wàn)多個(gè)視頻片段,和 ImageNet 那種上百萬(wàn)張圖片的規(guī)模比起來(lái),少得可憐。神經(jīng)網(wǎng)絡(luò)是數(shù)據(jù)饑渴的,數(shù)據(jù)不夠,網(wǎng)絡(luò)很容易過(guò)擬合,學(xué)到的是數(shù)據(jù)集里的噪聲而不是真正的動(dòng)作規(guī)律。
作者用了兩個(gè)辦法應(yīng)對(duì)這個(gè)問(wèn)題。第一個(gè)是**多任務(wù)學(xué)習(xí)**
**多任務(wù)學(xué)習(xí)**:讓一個(gè)網(wǎng)絡(luò)同時(shí)在多個(gè)相關(guān)數(shù)據(jù)集或多個(gè)標(biāo)簽體系上訓(xùn)練,共享大部分網(wǎng)絡(luò)參數(shù),只在最后輸出層區(qū)分不同任務(wù),這樣可以讓網(wǎng)絡(luò)從更多數(shù)據(jù)中受益,即便這些數(shù)據(jù)來(lái)自不同的任務(wù)定義。
具體來(lái)說(shuō),他們把兩個(gè)不同的動(dòng)作識(shí)別數(shù)據(jù)集放在一起訓(xùn)練同一個(gè)網(wǎng)絡(luò),網(wǎng)絡(luò)的絕大部分層是共享的,只在最后分類(lèi)那一層針對(duì)每個(gè)數(shù)據(jù)集單獨(dú)設(shè)一套輸出。這樣網(wǎng)絡(luò)能從兩份數(shù)據(jù)里一起學(xué)習(xí)通用的運(yùn)動(dòng)和外觀模式,即便兩個(gè)數(shù)據(jù)集的類(lèi)別定義完全不同。
第二個(gè)辦法更巧,空間流網(wǎng)絡(luò)的輸入畢竟就是普通圖片,那完全可以先在 ImageNet 那種超大規(guī)模的圖像數(shù)據(jù)集上做預(yù)訓(xùn)練,把學(xué)到的通用視覺(jué)特征直接遷移過(guò)來(lái),再用視頻數(shù)據(jù)做微調(diào)。這個(gè)做法現(xiàn)在聽(tīng)起來(lái)是常識(shí),當(dāng)年卻是解決視頻數(shù)據(jù)稀缺問(wèn)題的一個(gè)關(guān)鍵突破口。
這就好像一個(gè)學(xué)生想學(xué)習(xí)一門(mén)冷門(mén)語(yǔ)言,但教材數(shù)量有限。他可以先花大量時(shí)間把英語(yǔ)學(xué)到很扎實(shí),培養(yǎng)出對(duì)語(yǔ)言結(jié)構(gòu)、語(yǔ)法邏輯的敏感度,之后再轉(zhuǎn)去學(xué)那門(mén)冷門(mén)語(yǔ)言時(shí),即便教材少,他也能憑借已經(jīng)建立的語(yǔ)言直覺(jué)快速上手,不需要從零開(kāi)始摸索。空間流網(wǎng)絡(luò)借助 ImageNet 預(yù)訓(xùn)練,走的就是這條路,先在數(shù)據(jù)充足的任務(wù)上把"看懂圖像"這件事練扎實(shí),再遷移到數(shù)據(jù)稀缺的視頻任務(wù)上。
如果不做預(yù)訓(xùn)練,直接在幾千個(gè)視頻片段上從零訓(xùn)練一個(gè)卷積網(wǎng)絡(luò)會(huì)怎樣?網(wǎng)絡(luò)大概率會(huì)嚴(yán)重過(guò)擬合,記住了訓(xùn)練集里的特定場(chǎng)景和演員,卻學(xué)不到真正能泛化的動(dòng)作規(guī)律,測(cè)試時(shí)表現(xiàn)會(huì)明顯下降。
結(jié)果說(shuō)話(huà):準(zhǔn)確率追平并超過(guò)了手工特征
說(shuō)了這么多設(shè)計(jì)思路,最終效果到底怎樣?
論文在兩個(gè)標(biāo)準(zhǔn)數(shù)據(jù)集上做了測(cè)試,UCF-101 和 HMDB-51,這是當(dāng)時(shí)視頻動(dòng)作識(shí)別領(lǐng)域最主流的兩個(gè)基準(zhǔn)測(cè)試集。
| 方法 | UCF-101 準(zhǔn)確率 | HMDB-51 準(zhǔn)確率 |
| 密集軌跡(手工特征,當(dāng)時(shí)最強(qiáng)基線(xiàn)) | 87.9% | 57.2% |
| 僅空間流網(wǎng)絡(luò) | 73.0% | 40.5% |
| 僅運(yùn)動(dòng)流網(wǎng)絡(luò) | 83.7% | 54.6% |
| **雙流網(wǎng)絡(luò)融合** | **88.0%** | **59.4%** |
看這張表,幾個(gè)信息值得拆開(kāi)說(shuō)。
第一,單獨(dú)的空間流網(wǎng)絡(luò),準(zhǔn)確率只有 73%,比密集軌跡低了將近 15 個(gè)百分點(diǎn),這說(shuō)明單純把 CNN 套用到視頻幀上,效果確實(shí)不如手工特征,這也印證了前面說(shuō)的,視頻不是簡(jiǎn)單的圖片堆疊問(wèn)題。
第二,單獨(dú)的運(yùn)動(dòng)流網(wǎng)絡(luò),靠光流場(chǎng)這一項(xiàng)輸入,準(zhǔn)確率就沖到 83.7%,已經(jīng)和密集軌跡的 87.9% 相當(dāng)接近了,差距只有四個(gè)百分點(diǎn)。這說(shuō)明運(yùn)動(dòng)信息本身對(duì)動(dòng)作識(shí)別至關(guān)重要,而光流場(chǎng)這種表示方式確實(shí)抓住了運(yùn)動(dòng)的核心。
第三,兩條流融合之后,88.0% 這個(gè)數(shù)字第一次超過(guò)了密集軌跡的 87.9%。差距看起來(lái)很小,只有 0.1 個(gè)百分點(diǎn),但這 0.1 個(gè)百分點(diǎn)背后的意義完全不是數(shù)字本身能衡量的。這是深度學(xué)習(xí)方法在視頻動(dòng)作識(shí)別這個(gè)任務(wù)上第一次打贏手工特征,在此之前整整兩年,深度學(xué)習(xí)方法始終被密集軌跡壓著一頭。這個(gè) 0.1% 的反超,和 AlexNet 在圖像識(shí)別上的橫空出世,放在整個(gè)領(lǐng)域的歷史脈絡(luò)里,分量是相當(dāng)?shù)摹?/p>
而在 HMDB-51 這個(gè)更難的數(shù)據(jù)集上,雙流網(wǎng)絡(luò)的優(yōu)勢(shì)更明顯,59.4% 對(duì)比密集軌跡的 57.2%,領(lǐng)先了 2.2 個(gè)百分點(diǎn)。HMDB-51 數(shù)據(jù)集視頻質(zhì)量參差,動(dòng)作類(lèi)別之間區(qū)分度更小,雙流網(wǎng)絡(luò)在這種更困難的場(chǎng)景下反而拉開(kāi)了更大的優(yōu)勢(shì),說(shuō)明這個(gè)架構(gòu)的泛化能力確實(shí)更強(qiáng),不是靠在某一個(gè)數(shù)據(jù)集上撞運(yùn)氣撞出來(lái)的結(jié)果。
這篇論文之后發(fā)生了什么
雙流網(wǎng)絡(luò)這個(gè)思路一開(kāi)先河,后面幾年整個(gè)視頻理解領(lǐng)域幾乎是沿著這條路徑往前走的。
**3 年后**,Carreira 和 Zisserman(還是同一個(gè) Zisserman)在 2017 年發(fā)表了 I3D 網(wǎng)絡(luò),把雙流網(wǎng)絡(luò)里的 2D 卷積全部換成了 3D 卷積,讓網(wǎng)絡(luò)能直接從原始視頻幀里學(xué)習(xí)時(shí)空特征,不再依賴(lài)單獨(dú)計(jì)算光流。這個(gè)改動(dòng)大幅提升了準(zhǔn)確率,在 UCF-101 上做到了 98% 左右,同時(shí)也讓網(wǎng)絡(luò)結(jié)構(gòu)變得更統(tǒng)一,不需要像雙流網(wǎng)絡(luò)那樣單獨(dú)維護(hù)兩套網(wǎng)絡(luò)和一套光流計(jì)算流程。
**5 年后**,Facebook 的研究團(tuán)隊(duì)在 2019 年提出了 SlowFast 網(wǎng)絡(luò),這個(gè)設(shè)計(jì)其實(shí)是雙流網(wǎng)絡(luò)思路的一種延續(xù)和升華。它不再是"空間流加運(yùn)動(dòng)流"這種外觀和運(yùn)動(dòng)的分離,而是"慢速通路加快速通路",一條網(wǎng)絡(luò)用較低的幀率去捕捉穩(wěn)定的語(yǔ)義信息,另一條用較高的幀率去捕捉快速變化的運(yùn)動(dòng)細(xì)節(jié),本質(zhì)上還是"兩條視線(xiàn)各管一塊,再融合"的哲學(xué),只是分工方式從"外觀 vs 運(yùn)動(dòng)"換成了"慢 vs 快"。
這兩個(gè)后續(xù)工作都保留了雙流網(wǎng)絡(luò)最核心的那個(gè)洞察,視頻里的信息天然分成兩種不同性質(zhì)的成分,硬塞進(jìn)一個(gè)網(wǎng)絡(luò)里效果不好,分開(kāi)處理再融合效果更好。這個(gè)洞察活得比雙流網(wǎng)絡(luò)這個(gè)具體架構(gòu)本身還久。
寫(xiě)在后面
讀這篇論文時(shí)最讓我意外的一點(diǎn)是,光流場(chǎng)作為輸入這件事,現(xiàn)在聽(tīng)起來(lái)平平無(wú)奇,但在當(dāng)時(shí)是需要一點(diǎn)勇氣才能想到的。研究者選擇不直接信任神經(jīng)網(wǎng)絡(luò)能從原始像素里學(xué)會(huì)運(yùn)動(dòng)的概念,而是先用傳統(tǒng)方法把運(yùn)動(dòng)信息計(jì)算出來(lái),再喂給網(wǎng)絡(luò)。這其實(shí)是承認(rèn)了"深度學(xué)習(xí)不是萬(wàn)能的,有些先驗(yàn)知識(shí)提前給它,比讓它自己瞎摸索更高效"。
這種態(tài)度在后來(lái)的深度學(xué)習(xí)潮流里其實(shí)慢慢被沖淡了,大家越來(lái)越相信端到端訓(xùn)練,相信給網(wǎng)絡(luò)原始數(shù)據(jù)它自己就能學(xué)會(huì)一切。I3D 網(wǎng)絡(luò)用 3D 卷積取代光流輸入,某種程度上就是這種信念的勝利。但雙流網(wǎng)絡(luò)提醒我們,在數(shù)據(jù)不夠、算力有限的年代,給網(wǎng)絡(luò)一點(diǎn)"人工提示"往往是性?xún)r(jià)比更高的選擇。這個(gè)取舍今天做具身智能、機(jī)器人感知這些數(shù)據(jù)依然稀缺的領(lǐng)域時(shí),依然值得重新想一想。
Q&A
Q1:雙流卷積網(wǎng)絡(luò)是什么?
A:雙流卷積網(wǎng)絡(luò)是2014年由牛津大學(xué)Simonyan和Zisserman提出的視頻動(dòng)作識(shí)別方法,用兩條并行的卷積神經(jīng)網(wǎng)絡(luò)分別處理視頻的空間外觀信息和運(yùn)動(dòng)光流信息,再融合兩者的預(yù)測(cè)結(jié)果,是深度學(xué)習(xí)首次在該任務(wù)上超越手工特征方法。
Q2:雙流網(wǎng)絡(luò)為什么要分開(kāi)處理外觀和運(yùn)動(dòng)信息?
A:因?yàn)橐粋€(gè)網(wǎng)絡(luò)很難同時(shí)學(xué)好靜態(tài)視覺(jué)模式和動(dòng)態(tài)運(yùn)動(dòng)規(guī)律這兩種性質(zhì)完全不同的信息,分開(kāi)處理讓兩個(gè)網(wǎng)絡(luò)各自專(zhuān)注,最后融合效果比強(qiáng)行塞進(jìn)一個(gè)網(wǎng)絡(luò)里更好,實(shí)驗(yàn)顯示融合后準(zhǔn)確率從83.7%提升到88%。
Q3:雙流網(wǎng)絡(luò)之后有哪些改進(jìn)方法?
A:2017年Carreira和Zisserman提出I3D網(wǎng)絡(luò),用3D卷積直接學(xué)習(xí)時(shí)空特征取代光流計(jì)算;2019年Facebook團(tuán)隊(duì)提出SlowFast網(wǎng)絡(luò),用慢速和快速兩條通路替代外觀和運(yùn)動(dòng)兩條通路,都延續(xù)了雙流網(wǎng)絡(luò)"分開(kāi)處理再融合"的核心思路。
關(guān)鍵詞: 動(dòng)作 光流 卷積 手工 深度學(xué)習(xí) 神經(jīng)網(wǎng)絡(luò) 視頻識(shí)別







