Transcription
呼應一下今天的題目,暖化篇。其實我們自己的感觸還蠻深的,就是像我們把資料資料投入在農業當中,最近幾年比較深刻的感受是…其實你會發現,全球暖化這件事一直在發生。所有的種植帶哦,特別是熱帶的作物,像我們製作熱帶水果比較多,一直在往北移。像大家常在吃台灣很驕傲的鳳梨,就是以前,它是屬於那種熱帶性的作物,以前最多種到嘉義或是新竹,現在可以種到哪邊?種到新竹,越來越北了。然後呢,日本那邊也開始在種,就是你會發現說,奇怪,一個熱帶水果作物,為什麼連日本都可以種了?因為你會發現,其實它全部是在往北漂。
那在疫情發生前,我滿常跑東南亞的,那個時候,就是在現場觀察到一個趨勢是,就是那個東南亞雖然是熱帶國家,但他們有明顯的乾季跟雨季的狀況。然後你會發現,我當時在現場,我們在解決問題是,當所有的雨都開始在往北(方)飄(移)的時候,怎麼辦?你本來可以獲得足夠水源的地地區開始變得沒有水了,那但是我們的人跟我們種植的作物還在這片土地上的時候怎麼辦?所以其實在整個氣候變遷下,我們面對的是更多的挑戰是,如果我們不隨著氣候去遷徙,我們的人、我們的土地、我們作物還在這片這片土地上的時候,我們怎麼樣去面對這些氣候變遷的狀況?這個大概是我覺得,我們從數據去切入到農業中,這幾年來,就是除了讓這些農產品的品質、種植的更好之外,更多的其實是一個大環境的變化,讓我們不得不這樣做。
這張是我們在國外的田,那一樣,我們現在大概台灣跟國外都有在做,那這個是主要是幫助,就是南美洲,他們的國家怎麼樣去做更好的水果的種植還有外銷。我們大部分都是幫助這些外銷的農產品,去做標準、更精緻的這些科學化的耕種這樣。那相似的案例在其他地方都還有,不過今天談的會比較偏向是在台灣,因為台灣最近在談所謂的地方創生,那我們到底要怎麼樣切進去,讓我們的地方、我們的農村可以更好。
介紹一下,我基本上不是種田的,應該說,我不是種田起家,但現在對於農業應該還OK,就是基本上分析很多的作物跟做蠻多的研究,也在幫別人,就是用數據,怎麼樣能調整更好。那我是悠由數據的創辦人君孝,我們去年也會跟一些台南的一些小農村、青農們,我們弄一間合合作社在做這樣。所以等一下會以合作社的案例來說明,就是怎麼樣集合這些小農們,大家一起哦,做好科學化生產,然後共同的銷售這樣。那我自己本身是數據分析,也10幾年了這樣,然後大概以前因緣際會,就是那時候做蠻多中央部會的案子,然後後來到農委會去就幫他們做,做完之後就覺得,資料應該在傳統產業上有更多的…所以就出來做這樣。一晃眼也蠻多年的,還好是還在,就是只要你還在,基本上我覺得就可以做,創造出更多的那個可能性這樣子。
那如果以資料來講的話,這個是我當年2015年寫的一個資料科學發展的方法論。那為什麼會寫這個?其實是因為那個時候所謂的大數據剛開始,那很多人想做,大家覺得我好像只要講大數據,我就很fancy,我就很厲害哦,但是大家好像在談大數據,但大家都不知道大數據是什麼,所以那個時候就是非常的亂,就是很多人來找我做。那這個anyway,我講過蠻多次,不過還是再講一次好了。然後有一個比較經典的案例,就是那個時候行政院來找我,然後就講說,你這個東西,就是我們希望能夠發展出一套大數據分析的基礎,做什麼呢?做的東西就是說,我們就是有很多的這些政務的官員,每天都要上去備詢,那我明白什麼方式是在官員上去備詢的時候,可以透過所謂的大數據分析,去分析出今天的這些的,今天的這些立法委員會問什麼問題,出這種問題集,哇!超酷的有沒有?這我們可以透過,就是這種資料分析去做到。然後呢,更進階的是,那我知道了問題之後,你可不可以通過大數據分析自動產出這個問題的答案?= ="...如果真的可以發展出來,我們所有的官員都不用做,做都不用做事情的,非常的輕鬆。那個時候我就問說,看起來這道分析應該是能解,但是我就反問他,你們現在有什麼資料嗎?他說沒有,你可以透過大數據把它爬收哦,所以什麼東西只要冠關上大數據看起來就解了,那我就跟他講說,那你們現在做到的程度是什麼?他說沒有…現在就是從零哦,我們有一個想法,我認為這東西應該是可以做,那我就問他說,因為我們如果大家有在做一些科研計畫或者政府計畫,那一定會問到一個關鍵性的問題,時間,你的成果發表,你的KPI,你的時間是幾年?他說1年,哦。然後像這樣子案例其實非常的多,後來我真的受不了,我就寫了一個這種資料科學發展的方法論,目的是為要跟大家講說,大家如果有很好的問題,覺得資料可以解的,可以先認清楚我們在什麼樣的階段,循序漸進的做,這樣子其實可以避免很多的誤會,因為其實大數據發展到現在,你可以發現名詞不斷的在換,最早年我,大數據還沒起來之前叫什麼?叫資料處理,那時候非常早期,那時候我就在做,資料處理換成叫什麼?叫資料分析,資料分析之後叫大數據分析,再叫資料科學,再叫做是機器學習,深度學習,到現在大家在講人工智慧,可對我來講其實都是做相同的事情,但你發現這個詞一直換,為什麼?因為詞被玩爛了,所以就只能換。
那講話到這個稱,基本上就是帶大家去看說,假設我今天想開啟一個資料分析的專案,或者說我個題目希望資料分析去解的話,我可以怎麼做?我應該怎麼做?其實就是從底層開始,所以我在這邊大概切了一下,在下面這兩層叫做是大數據層,就是專門在處理資料跟所謂的資料的多樣性跟量大的,中間這些層是資料科學,它是一種就是去建構知識分析的方法,去產出我們希望的結果,那到最後一層才會到軟體系統去,也就是說,我們今天不是為了做大平台而大平台,我們今天是為了當這個東西的問題被資料分析解決出來之後,怎麼樣去搭載到一個系統上,讓它正常的運作,所以大概的層面是這樣。那我就從最頂端開始寫的,因為我們那年開始做的時候,大家都是雲端平台,所以坦白講,溝通的很痛苦,為什麼呢?因為其實資料的思維跟寫軟體架構思維是有差別的,資料思維是環繞在業務的層面上走,但軟體思維做的是框架,你就把它想像成是,軟體的思維是我做一個容器去裝東西,資料思維是我想辦法去填充容器內的東西,所以這兩個思維是並不相同的,但是因為當時太多人用軟體思維在詮釋事情的,所以我把箭頭畫得特別小,因為它沒有辦法解決問題,它是最後的1哩路,那我們要解決什麼?是下面的資料。那資料所謂的原始資料跟資料集,哎…我會不會講的太深?資料集就是我們各種可能可以收集到的資料,不管你用什麼方式去收,資料集是我今天先確定我要解決什麼問題,我再去從我的這個原始資料集裡面去萃取相應的東西出來做。我們大概在2012年到2014年這段時間,是一個大數據分析蓬勃發展,但是非常糟糕的時間點,為什麼?因為那個時候大家在討論是,我們收集很多的大數據資料,但是一直在垃圾資料進來,垃圾資料出去,因為你不知道要分析什麼。我當年大概在那幾年,常被交辦這樣的事情,比如說,那個時候有一些健康的資料,交通的資料,電力的資料,還有一些大家的使用者行為資料,全部都到我這裡來,他們也不知道要做什麼,他們只知道說我要做分析,所以那時候很經典的是,就是我那時候拿到了3億筆的資料,然後我發現大部分都是無效資料,因為他們連要做什麼都並不知道,然後我分析完了,發現根本連源頭就記錯,所以常會有這樣的狀狀況。所以基本上下面其實跟資料清洗,還有根據你的問題去設計你的資料集,這才是一個很重要的項目。那以一個資料科學發展專業來講,80%的時間其實全都在這裡,因為其實我們在面對資料平常在做的事情就是,處理跟清洗這些資料。那上面基本上分成是幾層,統計分析其實沒有不好,統計分析更常被使用的是,我們透過加減乘除統計的計算,標準差等等相關的,目的是為了觀察資料的分佈,要知道你這個資料是怎麼樣被收集,還有它的分佈的狀況,除了是為了我們後面分析去鋪路,更瞭解這些資料的狀況之外,第二是,有些問題真的不用機器去深度學習去解,你統計分析看完其實就行了,所以有時候是能夠解決問題的方法,其實就是好的方法,並不見得一定要多麼的高深。這大概是,我前幾年跟學界比較大的衝突應該是在這裡,因為很多時候,能夠解決問題就是一個好的方法了,為什麼要去討論一些不使用艱深的技術,所以有時候統計分析是很好用的。
那在探索型分析,探索分析型分析的重點在建立關係,也就是說a跟b之間有關係,那或者是說,今天大家坐的這個座位旁邊坐的是女生的機率高還是男生的幾率高,你(旁邊)坐的是誰,基本上就是建立關係,但是我們不探討因果關係,這個大概是很重要的觀念是,在所謂資料分析的世界裡面,探索性分析就是建立關係,關係只要建立出來,基本上大部分的狀態下都可以商用了。那因果關係這件事反而難,因為它需要經過非常多的假設跟實驗,它可能是一個常年性的探討,但是你要放在你的問題上,有些時候,我們面對問題,可能並不需要所謂的因果關係在,所以探索性分析重點是建立關係,然後再到所謂的預測型分析,這大概是我們公司現在比較常在做的,幾乎都是在建立未來事件的一些預測,那它可能就跟機器學習會比較有相關,它重點是在建立未來的預測。那現在人工智慧上面探討比較多的,可能是圖像的辨識,至少我們以前學的不是這樣,所謂的AI的圖像辨識對我們來講,叫做影像識別的課,那以前人工智慧學的是什麼?以前學的是,我根據現在狀況跟過去的狀況,我怎麼樣合理的去算,我接下來會發生的狀態跟未來的狀態是什麼,這個才是我們在學的,所以我覺得,可能我們要分清楚的是,圖像辨識叫做是判識,叫做是辨識,那我們在做未來性的預測,應該說未來性的判斷叫做是預測,大概會有這樣子的差別。那建議型分析是我們一直努力在做,但是即便到現在還是挺困難的,它最難就是用在我們的這些案例上面,就是我今天收集完所有的資料我資料分析完之後,那到底什麼時候要灌水,什麼時候要施肥,這些屬於建議型的行為,甚至來講是我們重新去整地,或者是去搭棚,像這些的建議型的分析。好,那最後才會是所謂系統的部分這樣。這個先給大家一個overview了,就是如果大家想要用資料去解決一個問題的話,那大概這些程序是,我們可以去判斷我們現在什麼樣的階段,還有是我們的一個發展的脈絡是什麼。
好,講到農業,我那個時候大概是2015年開始接觸農業,然後2017年出來創業,一直到現在了。那早年因為真的家裡也不是種田的,那農業應該是因為被氣到,所以就出來做這樣。那因為對農業也不是很熟,所以那個時候就辦了很多的活動,就是我去分享在田裡面收集資料,做了一些小小的心得,然後也分享一些跟資料科學相關的經驗,然後我也邀請了非常多人來去做這些農業上面的一些分享。那我覺得當年其實收穫非常多是,很多時候我們要做跨產業或者說是跨業合作,最重要的是交流,就是如果你不能open mined,基本上大家很難做一個好的合作,所以辦非常多的活動,然後去學習,然後並且瞭解問題是什麼。那我自己比較喜歡是這種,那時候辦在台南的一個比較小的場合,那他是不能錄音也不能錄錄影,他就是個小的場合,那我們那時候就是關起門來罵哦,這個台灣的農業為什麼是這樣哦,然後還有很多是大家可能看新聞,看農業的新聞,其實我現在就會把農業新聞關掉,因為它經常跟產地的事實是並不相符,所以我們常常會…算了啦。所以當今天是一個閉門會議的時候,說大家才能夠,啊其實他就是這樣啦~~就是大家就會臭罵這樣。
那好,我們想做什麼?基本上我們還是希望用資料科學去改變傳統產業,那重點是資料進去傳統產業後,怎麼樣去打造一條是有效率、有效率一個新式的服務形態,讓農業也可以跟其他開始接觸到數據的產業一樣,開始做根本的轉變。那我們的目標是世界第一的農產供應鏈的數據公司,那還是環繞在演算法上面,所以大概下面這部分是,我們是比較專注在作物的演算法上面,去做未來事件的預測。那我們服務客戶目前是像是農企業、農業採購商,或是這些國外的客戶等等相關的,那又接一些學員的一些委託的案子這樣。那主要還是在商業上比較多。那我們大概服務有3環,我們做比較久,其實是在大家看到左邊的生產端,大部分都在田裡面,那幫他們做整套的這種科學化的管理跟規劃,然後呢,去幫助他們從根本上,去提升他們的產值跟產量,這邊是做比較久了。那第二塊其實本來也不是我們想做,我們這些服務的農企業客戶後來又提說,既然能夠幫我提升產量了,你可不可以幫我算錢,什麼時候漲什麼時候跌,我什麼時候要種,什麼時候要收出來賣,所以我們的就再做。那一開始是服務這些農企業客戶,但我那時候的心願是,既然要做,其實如果資料可以透明化,讓大家都可以看得到,那不是一件更好的事情?所以後來就跟LINE合作這件事情。那大家基本上在LINE上面只要打AG INTELLER,或者是說你在那個官方帳號內,去找LINE的新創服務的話,基本上都可以找找都可以,那個找得到。這是一個悠由金錢報的服務,那上面可以看到所有,而應該說是,我們有服務的這些水果的價格,產地價、批發市場價跟終端零售價,還有一些進出口相關的價格,你都可以在上面很快速的看到,那過去的歷史結果跟最新的結果都是FREE的。那基本上就是希望說,讓大家慢慢接觸到資料的世界,就是我們很常在談交易價格的時候,應該不是在用喊的,就是說了算這樣,應該是有更客觀的資料去,去做佐證跟判斷。那這邊做完之後,後來其實我們會做到智慧零售端,是因為這兩年來疫情的關係,就是我們大部分服務都是這些外銷水果的客戶,那後來發現到,去年疫情爆發之後,我們這些外銷的單子,突然變得很不穩定,甚至有段時間是連續半年,沒有任何國外的單子來的,那這個時候基本上,我們服務這些農企業的客戶,他們就在想,那我到底應該要怎麼辦?所以我突然想到,那不然我們來做一條,就是數位交易的管道,讓大家可以在這個上面很快速的去定,那定的是什麼?定的是一般來講我們外銷到國外,但是國內吃不太到的水果的規格,所以我們就來做,大家從去年一直做到現在這樣子,然後大概是服務在這3環上面。那當然我們還有做一些像這些病蟲害的預測等等相關的,就是有時候還是會接一些的啦,就是大家可能在資料面上,沒有辦法處理的問題,那就會到我們這邊來這樣子。
那剛剛大概這個說明,那大家可以看,播個影片,大家可以看一下,我們大概到底在做的東西是什麼。in today's changing climate predicting crop results is key to the agriculture industry. Data Yoo provides innovative AI technology, we bring essential change in evolution to agriculture, we help analyze key crop growth parameters to precisely predict crop production periods and yields and even market prices of agricultural products. AI prediction can be used in agricultural supply chains to help optimize the operational efficiency.我們在整個業界屬於比較先進,那在資料的時候你還有在這個管理上面,都是要求比較精準的,我們所以我會選擇跟交流這間公司來合作,所以我們比較注重會是在一些資料收集跟後續的分析應用上,就是看看怎麼可以把我們目前毛豆的農業師傅,他腦袋裡面的一些經驗,可以比較具體的保存下來,然後讓我們可以生產出一個更好的,可能種植的經驗,那也可以順利的讓這個毛豆產業,他可以傳承給下一代。superior in AI and agriculture。那最後就是一個比較感性的影片,為什麼要做這件事情,那再耽誤一下大家的時間,看看看一下這樣。坦白說農業的資料很難收集,很困難,數據資料收集,真的在這個產業發酵的話,至少要蹲3年的,最終產出來效益才有可能逐漸放大。資料分析用在田間是一件相當辛苦的事情,事實上有非常多在從事資料分析產業的人,他們覺得這是一個薪水相當低,也是一個未來前景不是很看好的產業,但是我覺得,其實他會需要有人,真正的投入到農業中。我剛開始踏入這樣的產業的時候,在田間,所有生產者,大家也會覺得說我自己是最專業,那為什麼你可以跟我討論田間種植的事?農友,他們其實很難可以去看懂資料分析背後到底代表的含義到底是什麼。當我們可以用資料化方式去做產期、產量,還有就是規格品的預測,那當這3樣東西可以算的時候,大家會開始對於資料是,我願意去相信資料。那一套軟體,我們可以得知一些即時的狀況,讓我們在家裡,可拿著手機就可以去規劃工作安排。我們大概花了三年的時間,就去做所謂的精準灌溉,把符合採購商規格品的合格率從50%提升到80%,那這個其實是一個相當驚人的成果。從事鳳梨生產的時候,所有人在追求的都會是鼓聲果,原因是因為它的價差其實非常大,它大概差距在1.3到2.2倍有,真的在做國外銷售的時候,選擇的是鼓聲果,那要用什麼樣的方式去降低肉生果的生成,所以我們在鳳梨產季的過程當中,大家其實會最關心的是下雨,但是我們去年做完這道分析之後,有發現什麼樣環境的參數,跟你轉變成是這種肉生果的關係相當大的,土壤含水量跟夜溫,這兩個會是決定性的參數,晚上的溫度事實上在台灣是非常少人在討論的,但是真正到晚上的時候,才是鳳梨果實真正在發育的時間點。台灣的鳳梨算相當的盛產,但是我碰到很多是良率的差別相當大,他們沒有辦法有效的打入到國外的供應鏈市場,所以我們嘗試透過客觀的資料,把可以自動化計算的作物分析方式給建構出來,當今天氣候有改變的時候,我們就可以知道在這樣的時間點,我要做什麼樣子的操作,我才可以在最終收穫期時,讓他趨於是一個比較穩定的規格品的產量。我們可以藉由科技的儀器測到,我們的溫度過低的時候,我們可以預防什麼,讓鳳梨比較不會受到危害。今年寒流比較長的關係,所以今年台灣的鳳梨外銷要出貨的時候,鳳梨是處在一個還不夠甜也還不夠熟的狀態,在長期的外銷跟交易上,其實都會是傷害。假設我們可以透過資料分析的方式,去建構出精準跟穩定化生產的方式的話,我覺得那個對台灣的鳳梨產業將來要做一個更好的國際市場競爭力,會是更有幫助的。好,大概就是這樣,今天分享就到這邊。