識(shí)別及翻譯項(xiàng)目實(shí)戰(zhàn)系列--認(rèn)識(shí)CSL2018數(shù)據(jù)集)
文章目錄CSL2018數(shù)據(jù)集gloss-zip的項(xiàng)目結(jié)構(gòu)如下pose-gloss VS depth-glosscolor-gloss VS depth-glossCSL2018數(shù)據(jù)集gloss-zip代表的孤立詞語(yǔ)sentence-zip代表的是連續(xù)詞語(yǔ)識(shí)別gloss-zip的項(xiàng)目結(jié)構(gòu)如下CSL2018 這份gloss-zip里的幾個(gè)文件含義大致是color-gloss RGB 彩色視頻數(shù)據(jù) depth-gloss 深度視頻/深度模態(tài)數(shù)據(jù) pose-gloss 姿態(tài)關(guān)鍵點(diǎn)數(shù)據(jù) gloss_label.txt 500 個(gè)孤立詞類別名稱 readme.txt 文件命名規(guī)則和訓(xùn)練/測(cè)試劃分說(shuō)明gloss在這里可以理解為“孤立詞手語(yǔ)類別”也就是你現(xiàn)在做的孤立手語(yǔ)識(shí)別任務(wù)。readme.txt里給了一個(gè)例子P01_25_19_2._color.mp4它的解釋是P01 第 1 個(gè)表演者 25_19 類別編號(hào)計(jì)算方式(25-1)*2019 499 2 第 2 次表演 color RGB 視頻所以文件名中間兩段決定類別類別ID (前一段 - 1) * 20 后一段你的例子P01_01_00_0._body.txt計(jì)算類別(01 - 1) * 20 00 0所以它對(duì)應(yīng)gloss_label.txt的第1行也就是類別 ID 為0的詞。我已經(jīng)確認(rèn)gloss_label.txt是 UTF-8 編碼前幾行是0 情況 1 前途 2 形勢(shì) 3 局勢(shì) 4 動(dòng)態(tài)因此P01_01_00_0._body.txt對(duì)應(yīng)的確是情況更完整地拆開(kāi)P01 第 1 個(gè)表演者 01_00 類別編號(hào) 0對(duì)應(yīng) gloss_label.txt 第 1 行“情況” 0 第 0 次/某次重復(fù)表演 _body.txt 姿態(tài)關(guān)鍵點(diǎn)文本文件同一個(gè)動(dòng)作樣本在不同模態(tài)里可能有對(duì)應(yīng)文件例如概念上會(huì)有P01_01_00_0._color.mp4 RGB 視頻 P01_01_00_0._depth.mp4 深度視頻 P01_01_00_0._body.txt 姿態(tài)關(guān)鍵點(diǎn)你目前實(shí)驗(yàn)用的是pose-gloss所以模型輸入不是 RGB 視頻而是姿態(tài)關(guān)鍵點(diǎn)序列。如果你以后想做多模態(tài)可以考慮把color-gloss的 RGB 視頻、depth-gloss的深度視頻和pose-gloss的關(guān)鍵點(diǎn)融合起來(lái)。當(dāng)前第一版代碼可以只做 pose 模態(tài)。pose-gloss VS depth-glosspose-gloss里的關(guān)鍵點(diǎn)確實(shí)有第三維z可以看作帶三維空間信息。但它和depth-gloss不是同一種數(shù)據(jù)。可以這樣區(qū)分depth-gloss 原始/近原始的深度視頻 pose-gloss 從視頻或傳感器數(shù)據(jù)中提取出來(lái)的人體骨架關(guān)鍵點(diǎn)1. depth-gloss 是什么depth-gloss是深度視頻。它的每一幀通常是一張“深度圖”。普通 RGB 圖像每個(gè)像素是顏色R, G, B深度圖每個(gè)像素表示距離攝像頭的遠(yuǎn)近depth(x, y) 這個(gè)像素位置到攝像頭的距離所以 depth 視頻保留的是比較完整的空間表面信息。比如手、身體、背景中每個(gè)可見(jiàn)像素大概離攝像頭多遠(yuǎn)。它更像這樣第 t 幀H × W 的深度圖 整個(gè)視頻[T, H, W]或者編碼成視頻文件后存儲(chǔ)。2. pose-gloss 是什么pose-gloss是姿態(tài)關(guān)鍵點(diǎn)序列。它不是圖像而是每一幀只保留人體骨架上的若干個(gè)關(guān)鍵點(diǎn)。你現(xiàn)在用的_body.txt每一行是25 個(gè)關(guān)鍵點(diǎn) × 3 維坐標(biāo) 75 個(gè)數(shù)它更像這樣第 t 幀25 × 3 整個(gè)樣本[T, 25, 3]這里的第三維z可以表示空間第三維但它只描述這 25 個(gè)骨架點(diǎn)的位置不包含整張圖像的深度信息。關(guān)鍵區(qū)別depth-gloss: 保留每個(gè)像素的深度信息信息量大接近原始傳感器數(shù)據(jù)。 pose-gloss: 只保留人體關(guān)鍵點(diǎn)的三維坐標(biāo)信息量小是結(jié)構(gòu)化骨架數(shù)據(jù)。舉個(gè)直觀例子假設(shè)一幀畫面里有人在打手語(yǔ)。depth-gloss可能知道畫面中每個(gè)像素離攝像頭多遠(yuǎn) 手掌表面的大致形狀 身體輪廓 背景距離 手和臉之間的遮擋關(guān)系pose-gloss只知道頭、肩、肘、手腕、髖、膝等 25 個(gè)關(guān)鍵點(diǎn)的位置也就是說(shuō)depth-gloss 是“整張深度畫面” pose-gloss 是“從畫面中抽出來(lái)的骨架點(diǎn)”為什么 pose 里有 z還需要 depth因?yàn)閜ose里的z是關(guān)鍵點(diǎn)級(jí)別的三維坐標(biāo)只覆蓋 25 個(gè)點(diǎn)。而depth是像素級(jí)深度信息覆蓋整張圖像。它們的信息密度不同pose: 25 個(gè)點(diǎn) × 3 個(gè)數(shù) depth: 一整張圖每個(gè)像素一個(gè)深度值假設(shè)深度圖是512×424那一幀就有512 × 424 ≈ 217000 個(gè)深度值而 pose 一幀只有25 × 3 75 個(gè)數(shù)所以兩者不是重復(fù)關(guān)系而是“原始深度模態(tài)”和“結(jié)構(gòu)化姿態(tài)模態(tài)”的區(qū)別。一句話總結(jié)pose-gloss 里的 z 是“骨架關(guān)鍵點(diǎn)的深度/三維坐標(biāo)” depth-gloss 是“整幀圖像每個(gè)像素的深度視頻”。color-gloss VS depth-gloss磁盤里的color-gloss/depth-gloss通常是視頻文件或壓縮包不是直接保存成.npy形式的[T,H,W]數(shù)組。只有解碼后才可以把它們理解成張量。color-gloss: RGB 彩色視頻 解碼后概念形狀[T, H, W, 3]其中T 幀數(shù) H 圖像高度 W 圖像寬度 3 RGB 三個(gè)顏色通道每個(gè)像素類似[R, G, B]而depth-glossdepth-gloss: 深度視頻 理想情況下解碼后概念形狀[T, H, W]其中每個(gè)像素不是顏色而是深度值depth[y, x] 該像素位置距離攝像頭的遠(yuǎn)近所以可以這樣對(duì)比color-gloss 一幀H × W × 3 depth-gloss 一幀H × W pose-gloss 一幀25 × 3更直觀地說(shuō)color-gloss: 看“這個(gè)地方是什么顏色” depth-gloss: 看“這個(gè)地方離攝像頭多遠(yuǎn)” pose-gloss: 只看“人體關(guān)鍵點(diǎn)在哪里”不過(guò)實(shí)際處理中要注意一點(diǎn)有些數(shù)據(jù)集會(huì)把深度視頻編碼成普通視頻格式為了存儲(chǔ)方便讀出來(lái)時(shí)可能暫時(shí)表現(xiàn)為H × W × 3的圖像幀但這不代表它是 RGB 顏色信息。它可能是深度值經(jīng)過(guò)編碼、歸一化或偽彩色后的結(jié)果。真正用于模型前通常需要按數(shù)據(jù)集說(shuō)明或解碼方式還原/讀取深度信息。所以論文里建議寫得嚴(yán)謹(jǐn)一點(diǎn)CSL2018 提供 RGB、深度和姿態(tài)三種模態(tài)。其中 RGB 模態(tài)保留顏色與紋理信息深度模態(tài)描述像素級(jí)空間距離信息姿態(tài)模態(tài)將每幀手語(yǔ)動(dòng)作表示為人體關(guān)鍵點(diǎn)坐標(biāo)序列。本文僅采用 pose-gloss 模態(tài)即三維姿態(tài)關(guān)鍵點(diǎn)序列作為模型輸入。一句話總結(jié)你的理解方向是對(duì)的color 是像素級(jí)顏色視頻depth 是像素級(jí)深度視頻pose 是關(guān)鍵點(diǎn)級(jí)骨架序列。