Meta新模型“分割一切”:摳圖完成究極進化,計算機視覺迎來GPT-3時刻
2023-04-08 16:12:03 來源:雪球網(wǎng) 小 中
Meta 在論文中發(fā)布的新模型名叫 Segment Anything Model (SAM) 。他們在博客中介紹說,「SAM 已經(jīng)學(xué)會了關(guān)于物體的一般概念,并且它可以為任何圖像或視頻中的任何物體生成 mask,甚至包括在訓(xùn)練過程中沒有遇到過的物體和圖像類型。SAM 足夠通用,可以涵蓋廣泛的用例,并且可以在新的圖像『領(lǐng)域』上即開即用,無需額外的訓(xùn)練。」在深度學(xué)習(xí)領(lǐng)域,這種能力通常被稱為零樣本遷移,這也是 GPT-4 震驚世人的一大原因。
(資料圖)
論文地址:網(wǎng)頁鏈接
項目地址:網(wǎng)頁鏈接
Demo 地址:網(wǎng)頁鏈接
除了模型,Meta 還發(fā)布了一個圖像注釋數(shù)據(jù)集 Segment Anything 1-Billion (SA-1B),據(jù)稱這是有史以來最大的分割數(shù)據(jù)集。該數(shù)據(jù)集可用于研究目的,并且 Segment Anything Model 在開放許可 (Apache 2.0) 下可用。
雖然智能摳圖這件事并不算是個新鮮事物,但如果你嘗試過用P圖軟件來摳圖換背景,就會發(fā)現(xiàn)想把照片摳得快、摳得準(zhǔn)、摳得自然其實是一件費時又費力的事。
從技術(shù)的角度來說,數(shù)字圖像的“摳圖”一直就是計算機視覺領(lǐng)域的一項經(jīng)典且復(fù)雜的任務(wù),其中關(guān)鍵的難點在于識別的時間和精準(zhǔn)度。而Meta此次發(fā)布的SAM可以說給出了近乎完美的解決方案。
對于任何一張照片,Meta都可以快速識別照片中的所有物體,并智能地將其分割成不同的形狀和板塊。你可以點擊圖中的任意物品進行單獨處理。
而除了簡單的識別圖片中的物品之外,此次SAM還支持用戶使用各種交互性的方式來分離出想要的物體。
比如你可以通過將鼠標(biāo)懸浮在該物體之上,就能自動定位出物體的輪廓。即使是顏色非常相近或者有連人眼都很難快速分辨出的倒影的圖片之中,SAM都能非常準(zhǔn)確的找出輪廓邊線。
再比如,你也可以直接通過輸入文字查詢,AI就可以幫你找到并標(biāo)記出這個圖片中的你想找的這個文字對象。
不僅僅是靜態(tài)圖片,對于視頻中的物體,SAM也能準(zhǔn)確識別并且還能快速標(biāo)記出物品的種類、名字、大小,并自動用ID給這些物品進行記錄和分類。Meta表示未來這一技術(shù)會跟AR/AR頭顯進行廣泛結(jié)合。這聽上去是不是確實有點鋼鐵俠頭盔的味道了?
看到這里是不是已經(jīng)覺得很厲害了?別著急,Meta這次還有大招。
Meta發(fā)布了SAM之后,立刻吸引了大量關(guān)注,甚至在很多人工智能業(yè)內(nèi)人士的眼中,SAM的出現(xiàn)可以說是計算機視覺領(lǐng)域的GPT-3時刻。
英偉達人工智能科學(xué)家 Jim Fan 表示此次SAM最大的一點突破是它已經(jīng)基本能夠理解“物品”的一般概念,即使對于未知對象、不熟悉的場景(例如水下和顯微鏡里的細(xì)胞)它都能比較準(zhǔn)確的理解。因此他表示相信SAM的出現(xiàn)會是在計算機視覺領(lǐng)域里的GPT-3時刻。
不僅是Jim有這樣的觀點,一些AI研究專家甚至也表示,SAM之于計算機視覺,就像是GPT之于大語言模型。
而就在SAM昨天發(fā)布之后,很多人也在第一時間上手進行了實測。硅星人瀏覽了一圈,發(fā)現(xiàn)不僅基本滿屏都是驚嘆,一些網(wǎng)友還結(jié)合自身的工作領(lǐng)域打開了SAM更廣的應(yīng)用想象空間。
有人將包含了眾多復(fù)雜元素的圖片上傳之后,SAM識別起來毫無壓力,無論是近景還是遠(yuǎn)景,大量的復(fù)雜細(xì)微的元素都可以基本準(zhǔn)確找出。
有自然科學(xué)研究者將SAM和衛(wèi)星圖像結(jié)合在了一起,表示SAM能夠很好的識別和找到他標(biāo)記的風(fēng)貌類型。
有神經(jīng)外科影像學(xué)的專家將SAM用到了一個脊髓血管病的病例文件之中,認(rèn)為SAM在幫助判斷和分析病情上有很大幫助。
有生物學(xué)家輸入了一張顯微鏡下的組織圖片,即使圖中形狀特征毫無規(guī)律,但憑借著Zero-shot技術(shù),SAM也能夠自動識別多細(xì)胞結(jié)構(gòu)中的腺體、導(dǎo)管、動脈等。該生物學(xué)家認(rèn)為SAM的產(chǎn)出結(jié)果已經(jīng)非常接近完美,未來能夠節(jié)省大量手動注釋的時間。
還有有騎行愛好者將地圖和SAM結(jié)合起來,認(rèn)為能夠幫助自己未來更快更高效地給地圖做標(biāo)記。
總體來看,跟過去的一些計算機視覺模型相比,SAM 在幾個方面有著顯著的提升和不同。
首先,SAM 開創(chuàng)性地跟Prompt結(jié)合了起來。它可以接受各種輸入提示,例如點擊、框選或指定想要分割的對象,這種輸入并不是一次性指令,你可以不停地對圖像下達不同的指令達到最終的編輯效果,這也意味著此前在自然語言處理的Prompt模式也開始被應(yīng)用在了計算機視覺領(lǐng)域。
此外,SAM基于1100 萬張圖像和 11 億個掩碼的海量數(shù)據(jù)集上進行訓(xùn)練,這是迄今為止最大的分割數(shù)據(jù)集。該數(shù)據(jù)集涵蓋了廣泛的對象和類別,例如動物、植物、車輛、家具、食物等,這些圖像的分辨率達到了1500×2250 pixels,平均每張圖像約有100個掩碼。此次SAM采用了輕量級掩碼解碼器,可以在每次提示僅幾毫秒內(nèi)在網(wǎng)絡(luò)瀏覽器中運行。
SAM 在各種分割任務(wù)上具有很強的零樣本性能。零樣本意味著 SAM 可以在不對特定任務(wù)或領(lǐng)域進行任何額外訓(xùn)練或微調(diào)的情況下分割對象。例如,SAM 可以在沒有任何先驗知識或監(jiān)督的情況下分割人臉、手、頭發(fā)、衣服和配飾。SAM 還可以以不同的方式分割對象,例如紅外圖像或深度圖等。
SAM的訓(xùn)練數(shù)據(jù)集是OpenImage V5的6倍
Meta表示,目前公司內(nèi)部已經(jīng)開始使用SAM相關(guān)技術(shù),用于在Facbook、Instagram等社交平臺上照片的標(biāo)記、內(nèi)容審核和內(nèi)容推薦等。而之后,生成人工智能作為 "創(chuàng)意輔助工具 "也將被作為今年的重點優(yōu)先事項被納入到Meta更多的應(yīng)用程序中。
此次,可能最讓很多業(yè)內(nèi)人士驚喜的地方在于,無論是SAM模型還是巨大的訓(xùn)練數(shù)據(jù)集都是開源的!也就是說,目前任何人都可以在非商用許可下載和使用SAM及數(shù)據(jù)。
Meta表示,此舉是希望進一步加速整個行業(yè)對圖像分割以及更通用圖像與視頻理解的研究。‘Meta也預(yù)計,隨著SAM的演進和發(fā)展,該技術(shù)可能會成為未來AR/VR、內(nèi)容創(chuàng)作、設(shè)計更多領(lǐng)域的強大的輔助工具。
Meta的模型SAM至少涉及兩個方向,一是機器視覺,再一個是推動XR。
周五異動且比較正宗的標(biāo)的:
$凌云光(SH688400)$:公司的機器視覺已經(jīng)在消費電子、新型顯示、印刷包裝和新能源等眾多行業(yè)獲得廣泛應(yīng)用。在智能算法方面,公司自2005年啟動研發(fā)核心算法庫VisionWARE,到2021年,該算法庫迭代至5.0版本。截至目前,公司已具有基礎(chǔ)、定位、測量、檢測、識別、顏色、3D、深度學(xué)習(xí)和圖形用戶界面等9個技術(shù)模塊、18個算法庫和100余個算法工具包。公司算法功能的通用性強,經(jīng)過多年持續(xù)研發(fā)并快速迭代升級,在精度、效率及穩(wěn)定性三個性能指標(biāo)上具備較好優(yōu)勢。
而且凌云光參與開發(fā)與應(yīng)用北京智源的悟道大模型。
$大華股份(SZ002236)$:公司基于深度學(xué)習(xí)對視頻中人、車和物的檢測和各類屬性的提取,性能指標(biāo)已經(jīng)達到國際一流。公司的車身識別技術(shù)可以識別130種車輛品牌以及3,000多種的車型。公司2016年在人臉識別領(lǐng)域的LFW上取得排名第一;2017年,公司在文本檢測和識別領(lǐng)域的ICDAR上3項排名第一,在場景流識別領(lǐng)域的KITTI排名第一。
大華一直是賣方重點推薦的核心品種,強趨勢。
$虹軟科技(SH688088)$:致力于計算機視覺技術(shù)的研發(fā)和應(yīng)用,堅持以技術(shù)創(chuàng)新為核心驅(qū)動力,在全球范圍內(nèi)為智能手機、智能汽車、AIoT等智能設(shè)備提供一站式計算機視覺技術(shù)解決方案。
其他還有:云從科技、格林深瞳、奧普特、奧比中光等。
XR賣方推薦標(biāo)的:
蘋果MR相關(guān)標(biāo)的:
長盈精密/智立方/兆威機電/杰普特/歌爾股份/華興源創(chuàng)
非蘋果VR/AR標(biāo)的:
三利譜/紫建電子/聯(lián)合光電/國光電器
引用文章:網(wǎng)頁鏈接
關(guān)鍵詞:
相關(guān)文章
- 世界熱文:戴維斯十大投資原則
- 新易盛 股海神艦 十倍牛股_世界即時看
- Meta新模型“分割一切”:摳圖完成究極進化,計算機視覺迎來GPT-3時刻
- GPT-5不能停!吳恩達LeCun直播回懟馬斯克:汽車都還沒發(fā)明 要什么安全帶
- 最新消息:合肥:4月10日起恢復(fù)住房公積金異地貸款業(yè)務(wù)
- 安卓 14 將新增滑塊,用于調(diào)整 Material You 對比度
- 清華大學(xué)教授陶建華:AI大模型也存在技術(shù)風(fēng)險
- 歐洲科學(xué)院外籍院士焦李成:人工智能技術(shù)發(fā)展任重道遠(yuǎn),學(xué)術(shù)界要保持清醒的頭腦:每日訊息
- 【2023/04/07日記】還在箱體內(nèi)波動,下周面臨箱頂壓力:當(dāng)前訊息
- 下周,又見證歷史了!
- 堅定的持有沃森到1500億-2000億需要多久?:天天亮點
- 今日報丨市價6折的人才房將成歷史?深圳明確:將取消安居房和人才房
- 豬價回暖 個股集體上漲!“二師兄”的春天回來了:全球熱頭條
- 過去十年全球氣候投融資實現(xiàn)兩位數(shù)增長
- 看熱訊:買房送地、簽約送車位 房企花式促銷奮戰(zhàn)“小陽春”
- 久遠(yuǎn)銀海劍橋科技的地位_每日熱訊
- 微頭條丨比亞迪負(fù)債3700億還要擴張,誰在為王傳福續(xù)航?
- 民士達的個人分析:環(huán)球時訊
- 盛路通信:公司28G毫米波有源相控陣天線產(chǎn)品已實現(xiàn)應(yīng)用|天天速讀
- 665億解禁洪流下周來襲 解禁股年內(nèi)走勢穩(wěn)健 6股去年業(yè)績高增長|每日頭條
- 百度發(fā)打假聲明:目前文心一言無官方App 已對蘋果公司及相關(guān)開發(fā)者團隊發(fā)起訴訟
- 首項數(shù)字化供應(yīng)鏈國際標(biāo)準(zhǔn)在國際電聯(lián)正式發(fā)布|全球短訊
- 三星訂單包含4500萬部產(chǎn)品?聞泰科技:對市場傳言不作回應(yīng):當(dāng)前觀察
- 工信部:將研究制定系統(tǒng)深入推進智能制造的行動計劃:每日精選
- 璟
- 自己的健康自己養(yǎng),沃森生物的焦慮也要破
- 環(huán)球聚焦:市場波動及計劃20230408
- 世界報道:此刻,堅定看多長江電力和中國神華
- 丘成桐:人工智能對思考有幫助,但無法從觀念上改變數(shù)學(xué)發(fā)展_環(huán)球觀察
- 視焦點訊!元宇宙房產(chǎn)崩盤!暴跌近90% 知名歌手林俊杰被坑慘
熱文推薦
排行推薦
最新消息:合肥:4月10日起恢復(fù)住房公積金異地貸款業(yè)務(wù)
安卓 14 將新增滑塊,用于調(diào)整 Material You 對比度
清華大學(xué)教授陶建華:AI大模型也存在技術(shù)風(fēng)險



