2016年2月28日 星期日
2016年2月27日 星期六
2016年2月21日 星期日
[Python] Google Deep Learning TensorFlow課程(一)
Deep Lerning在現在硬體計算能力增長的現在又開始火紅了起來.比起一般的Machine Learngin,Deep Learning在圖形,聲音,影片的辨識上又更強大.Google大神也將Deep Learning的套件開源出來叫做TensorFlow.TensorFlow是一個Deep Learning套件,希望能讓Deep Learning的使用更方便,更有彈性,而且能輕易套在產品上面.
2015年12月18日 星期五
[Career] Why do you need a data science team instead of a single data scientist?
Why do you need a data science team instead of a single data scientist?
-
- Photo credit: jsgraphicdesign via Visual hunt / CC BY-NC-SA
When we talk about data scientist, maybe there is a superhero-like person appearing in your mind, because you have read a lot of magazine articles or columns about what a magical model they designed and how much value they could bring for business. I must admit that data science is really charming for business. When data become a kind of resource, data scientist is considered as a gold miner and is expected to extract something valuable from the data. However, whoever thinks a data scientist could do this ALONE is wrong.
2015年11月23日 星期一
[Spark] Why Use Apache Spark?
For today, I would like to switch the focus from programing or technical details, and share some of my experience and opinion with you from a Spark user’s perspective.
As a data analyst and data engineer specializing in BIG DATA, Hadoop cluster is always handy in saving data. When it comes to ETL processes or analysis, besides Spark, we have the following choices:
2015年11月9日 星期一
[Career] Why you should keep finding a job even though you are on the job
pic source: http://www.isironline.org/category/job-and-workshop-postings/
Hope my boss would not see this article.
Keeping finding a job is very important especially to who are in the IT industry. Why? Keep in step with market needs.
2015年9月19日 星期六
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境-- numpy 設定
之前設定完Docker和Spark後好不容易解決了一堆問題(請參考連結):
但是卻在在跑MLlib時發生了嚴重的問題!
天啊~真的是晴天霹靂.因為環境橫跨Jupyter-Docker-Master和Slave等環境,光確認每台的版本就花了很多時間...
相關文章:
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境--HiveContext設定
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境-- numpy 設定
2015年8月31日 星期一
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境--HiveContext設定
Spark在1.3.0之後發佈新的DataFrame,與Hive有更多的結合,預設也會啟動HiveContext,可以直接使用sql指令撈取hive中的資料.一般如果Spark與Hive放在同一個環境,只要將hive的hive-site.xml放到spark路徑/conf下面,就可以直接使用.但是現在當我們的環境放在docker裡面的話,設定上就要動點手腳.
相關文章:
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境--HiveContext設定
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境-- numpy 設定
2015年8月26日 星期三
[Linux] 駭人之心不可有,防人之心不可無,Ubuntu簡單防護

上禮拜拿到Softlayer的時候,因為是實體機,有朋友告知安全性的問題,都已經將防火牆架設列在todo list裡面,但是因為大家平常都各自有事情要忙,想說沒有重要資料就先擺著.沒想到今天一早就接到ibm大大的聯繫說有不明人士嘗試進入主機…orz 沒想到平常看人家笑話今天自己變成笑話,果然出來跑的總是要還,在網路上的遲早會被駭.
事情是這樣的:
2015年8月25日 星期二
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境
台灣Spark社群將在九月中的Hadoop Conference展開一系列的Spark課程(開放當天就已經額滿了XD),由於小弟我沒有負責任何課程,所以有時間來建課程環境.因為環境要考量比賽以及教學使用,所以架設上相對複雜一點.
相關文章:
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境--HiveContext設定
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境-- numpy 設定
2015年8月23日 星期日
[心得] Softlayer 使用心得-管理介面
2015年8月12日 星期三
[閒聊] 資料科學家的日常(外傳)
前幾個禮拜過去同事想了解傳說中的資料科學家到底平常在做什麼事情.報章媒體總是喧嘩的好像有資料科學家就能把大便變成黃金,但是身材其中就覺得根本不是這麼回事,就跟一般工作一樣有一堆鳥事要處理,所有神奇的東西都是血汗換來的.
直接放上投影片內容:
相關閱讀:
[Python] 資料科學家的日常(一) Read Data
[Python] 資料科學家的日常(二) Clean Data-清理HTML標籤 l.html
2015年8月7日 星期五
[Algorithm] [python] K-鄰近算法(KNN k-nearest neighbors) 實作
機器學習演算法通常分為監督式學習以及非監督式學習兩種,監督式學習指已知部分要分類的對象的分類結果(例如男性女性),用這些已知的部分來學習分類的模式,將未知的對象來做分類;非監督式學習則是單純從屬性差異來將對象分類.今天要介紹的KNN(K鄰近算法)屬於監督式學習的一種,透過已知的分類結果來給予未知對象分類.
2015年7月18日 星期六
[Python] 資料科學家的日常(二) Clean Data-清理HTML標籤

2015年7月12日 星期日
[Python] 資料科學家的日常(一) Read Data

資料科學家這個名字在這兩年紅到發黑,好像透過大數據和資料科學家能夠變成預言家,還可以憑空幫公司賺進數倍利潤,本系列文章將以實例揭露所謂資料科學家平常在做的事情,打破各位對這個職業的幻想XD 這次示範的資料來源來自Pixnet辦的hackthon其中的spam(辨識垃圾文章)的資料.
2015年6月23日 星期二
準確率(Precision)與召回率(Recall)

在評估預測模型好壞時,常用的到指標包括Precision, Recall, ROC Curve, AUC等等.但是先前唸書的時候,都只是傻傻背定義,對指標的實際意義沒有太多感觸,直到最近真正跑了幾個模型,開始認真的想要預測結果時,才更深入了解這幾個指標含義及精神.
2015年6月12日 星期五
[Python][教學] 網路爬蟲(crawler)進階實務 -- 頁中有頁(二)
上一回[Python][教學] 網路爬蟲(crawler)進階實務– 自動爬蟲(一)介紹了怎麼繼承已經寫好的CrawlSpider物件來達到根據規則自動爬網頁的效果,但是如果你要爬的分頁沒有特定的規則,或是只想抓取頁面中的特定連結又該如何處理呢?
例如我今天要抓這個網站的掛號資料可以透過網址比對找出類似的網址之後,再一層一層的解析這個表格:
2015年5月30日 星期六
[Python][教學] 網路爬蟲(crawler)進階實務-- 自動爬蟲(一)
圖片來源:http://www.richbank.com.tw/CashierAndRegistration.html
前面幾篇[Python][教學] 網路爬蟲(crawler)實務(上)–網頁元件解析和[Python][教學] 網路爬蟲(crawler)實務(下)–爬蟲策略以及設定介紹了撰寫爬蟲程式基本的觀察以及實作方式.這樣的方式爬一兩個小網站還可以,但是如果要爬比較複雜或是多個網站就比較難維護.因此實務上比較常使用Scrapy這個爬蟲框架來處理,這次將介紹更進階的使用方法給各位.
2015年5月17日 星期日
[DB] Teradata PPI(Partitioned Primary Index) 優化策略教學
2015年4月19日 星期日
[linux][教學] 用grep + awk+sed處理文字資料
資料來源:http://animals.oreilly.com/origin-of-species/
過去處理資料可能會使用像是R之類的工具,但是最近開始k些linux的指令後,認識了awk & sed,從此愛上他們.awk和sed是linux中處理使用串流方式處理字串的工具,特色是支援pipeline(亦即可以接其他資料來源,以及將處理完的資料丟給別人處理),正規表達式,而且速度極快!平常可以用awk & sed搭配像是grep等文字工具,來處理linux中的文件檔案(特別是log檔),做一些字串的篩選和判斷.這次將用網頁log資來作為範例.
訂閱:
文章 (Atom)











