顯示具有 Big Data 標籤的文章。 顯示所有文章
顯示具有 Big Data 標籤的文章。 顯示所有文章

2016年2月27日 星期六

2016年2月21日 星期日

[Python] Google Deep Learning TensorFlow課程(一)


Deep Lerning在現在硬體計算能力增長的現在又開始火紅了起來.比起一般的Machine Learngin,Deep Learning在圖形,聲音,影片的辨識上又更強大.Google大神也將Deep Learning的套件開源出來叫做TensorFlow.TensorFlow是一個Deep Learning套件,希望能讓Deep Learning的使用更方便,更有彈性,而且能輕易套在產品上面.

2015年12月18日 星期五

[Career] Why do you need a data science team instead of a single data scientist?

Why do you need a data science team instead of a single data scientist?

Photo credit: jsgraphicdesign via Visual hunt / CC BY-NC-SA
This article is also posted on ElasticMining

When we talk about data scientist, maybe there is a superhero-like person appearing in your mind, because you have read a lot of magazine articles or columns about what a magical model they designed and how much value they could bring for business. I must admit that data science is really charming for business. When data become a kind of resource, data scientist is considered as a gold miner and is expected to extract something valuable from the data. However, whoever thinks a data scientist could do this ALONE is wrong.

2015年11月23日 星期一

[Spark] Why Use Apache Spark?


For today, I would like to switch the focus from programing or technical details, and share some of my experience and opinion with you from a Spark user’s perspective.

As a data analyst and data engineer specializing in BIG DATA, Hadoop cluster is always handy in saving data. When it comes to ETL processes or analysis, besides Spark, we have the following choices:

2015年11月9日 星期一

[Career] Why you should keep finding a job even though you are on the job


enter image description here
pic source: http://www.isironline.org/category/job-and-workshop-postings/
Hope my boss would not see this article.

Keeping finding a job is very important especially to who are in the IT industry. Why? Keep in step with market needs.

2015年8月31日 星期一

[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境--HiveContext設定




Spark在1.3.0之後發佈新的DataFrame,與Hive有更多的結合,預設也會啟動HiveContext,可以直接使用sql指令撈取hive中的資料.一般如果Spark與Hive放在同一個環境,只要將hive的hive-site.xml放到spark路徑/conf下面,就可以直接使用.但是現在當我們的環境放在docker裡面的話,設定上就要動點手腳.
相關文章:
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境--HiveContext設定
[Apache Spark][Docker] 利用Jupyterhub打造隨開即用的spark教學環境-- numpy 設定

2015年8月26日 星期三

[Linux] 駭人之心不可有,防人之心不可無,Ubuntu簡單防護

enter image description here
上禮拜拿到Softlayer的時候,因為是實體機,有朋友告知安全性的問題,都已經將防火牆架設列在todo list裡面,但是因為大家平常都各自有事情要忙,想說沒有重要資料就先擺著.沒想到今天一早就接到ibm大大的聯繫說有不明人士嘗試進入主機…orz 沒想到平常看人家笑話今天自己變成笑話,果然出來跑的總是要還,在網路上的遲早會被駭.
事情是這樣的:

2015年8月23日 星期日

[心得] Softlayer 使用心得-管理介面


enter image description here
圖片來源:Softlayer



兩三個月前看到IBM有意願投入研究Spark,本來只是開玩笑性質說可以去拉贊助,沒想到IBM的大大就很主動來跟我們社群討論合作事宜.當時考量到我們一來參加比賽需要用到機器,二來想在Hadoop conference上開tutorial,所以希望能跟Softlayer租用機器.經過一些申請步驟和條件交換,機器終於下來了(感動).

2015年8月12日 星期三

[閒聊] 資料科學家的日常(外傳)


前幾個禮拜過去同事想了解傳說中的資料科學家到底平常在做什麼事情.報章媒體總是喧嘩的好像有資料科學家就能把大便變成黃金,但是身材其中就覺得根本不是這麼回事,就跟一般工作一樣有一堆鳥事要處理,所有神奇的東西都是血汗換來的.

直接放上投影片內容:

相關閱讀:
[Python] 資料科學家的日常(一) Read Data
[Python] 資料科學家的日常(二) Clean Data-清理HTML標籤 l.html

2015年8月7日 星期五

[Algorithm] [python] K-鄰近算法(KNN k-nearest neighbors) 實作


機器學習演算法通常分為監督式學習以及非監督式學習兩種,監督式學習指已知部分要分類的對象的分類結果(例如男性女性),用這些已知的部分來學習分類的模式,將未知的對象來做分類;非監督式學習則是單純從屬性差異來將對象分類.今天要介紹的KNN(K鄰近算法)屬於監督式學習的一種,透過已知的分類結果來給予未知對象分類.

2015年7月18日 星期六

[Python] 資料科學家的日常(二) Clean Data-清理HTML標籤

enter image description here
繼承上次提的Read Data,Read本身除了讀取之外也包含著閱讀的意思.當資料讀取進來前後,都要好好閱讀資料,決定之後的分析方向.通常把資料讀取進來後,就會進入清理資料的階段.Clean Data雖說是分析資料的基本功,但是當資料大到某種程度後,Clean Data也變成相當惱人而且很多坑的事情.

2015年7月12日 星期日

[Python] 資料科學家的日常(一) Read Data

enter image description here

        資料科學家這個名字在這兩年紅到發黑,好像透過大數據和資料科學家能夠變成預言家,還可以憑空幫公司賺進數倍利潤,本系列文章將以實例揭露所謂資料科學家平常在做的事情,打破各位對這個職業的幻想XD 這次示範的資料來源來自Pixnet辦的hackthon其中的spam(辨識垃圾文章)的資料.

2015年6月23日 星期二

準確率(Precision)與召回率(Recall)


enter image description here

在評估預測模型好壞時,常用的到指標包括Precision, Recall, ROC Curve, AUC等等.但是先前唸書的時候,都只是傻傻背定義,對指標的實際意義沒有太多感觸,直到最近真正跑了幾個模型,開始認真的想要預測結果時,才更深入了解這幾個指標含義及精神.

2015年6月12日 星期五

[Python][教學] 網路爬蟲(crawler)進階實務 -- 頁中有頁(二)

enter image description here
上一回[Python][教學] 網路爬蟲(crawler)進階實務– 自動爬蟲(一)介紹了怎麼繼承已經寫好的CrawlSpider物件來達到根據規則自動爬網頁的效果,但是如果你要爬的分頁沒有特定的規則,或是只想抓取頁面中的特定連結又該如何處理呢?
例如我今天要抓這個網站的掛號資料可以透過網址比對找出類似的網址之後,再一層一層的解析這個表格:

2015年5月30日 星期六

[Python][教學] 網路爬蟲(crawler)進階實務-- 自動爬蟲(一)

圖片來源:http://www.richbank.com.tw/CashierAndRegistration.html

前面幾篇[Python][教學] 網路爬蟲(crawler)實務(上)–網頁元件解析[Python][教學] 網路爬蟲(crawler)實務(下)–爬蟲策略以及設定介紹了撰寫爬蟲程式基本的觀察以及實作方式.這樣的方式爬一兩個小網站還可以,但是如果要爬比較複雜或是多個網站就比較難維護.因此實務上比較常使用Scrapy這個爬蟲框架來處理,這次將介紹更進階的使用方法給各位.

2015年5月17日 星期日

[DB] Teradata PPI(Partitioned Primary Index) 優化策略教學


        近日在使用Teradata時常感覺校能不如預期(前公司的TD太強了也是原因),但是硬體沒辦法改變,只好從其他地方調整校能。Teradata是分散式儲存的資料倉儲,一些index的方式和一班資料庫不同,沒有Primary Key而是使用Primary Index(簡稱PI)來決定資料散佈的方式,當PI值越離散,資料也會越平均的分布在每個AMP上,下Query時,可以每個AMP同時平行的的處理資料,來加快查詢速度。但是因為資料量時在太大,若要再加快存取時間,就要減少找尋資料的時間,避免Full Table Scan,因此另外使用PPI,來優化查詢過程。

2015年4月19日 星期日

[linux][教學] 用grep + awk+sed處理文字資料

enter image description here
資料來源:http://animals.oreilly.com/origin-of-species/
過去處理資料可能會使用像是R之類的工具,但是最近開始k些linux的指令後,認識了awk & sed,從此愛上他們.awk和sed是linux中處理使用串流方式處理字串的工具,特色是支援pipeline(亦即可以接其他資料來源,以及將處理完的資料丟給別人處理),正規表達式,而且速度極快!平常可以用awk & sed搭配像是grep等文字工具,來處理linux中的文件檔案(特別是log檔),做一些字串的篩選和判斷.這次將用網頁log資來作為範例.