顯示具有 data miming 標籤的文章。 顯示所有文章
顯示具有 data miming 標籤的文章。 顯示所有文章

2015年12月18日 星期五

[Career] Why do you need a data science team instead of a single data scientist?

Why do you need a data science team instead of a single data scientist?

Photo credit: jsgraphicdesign via Visual hunt / CC BY-NC-SA
This article is also posted on ElasticMining

When we talk about data scientist, maybe there is a superhero-like person appearing in your mind, because you have read a lot of magazine articles or columns about what a magical model they designed and how much value they could bring for business. I must admit that data science is really charming for business. When data become a kind of resource, data scientist is considered as a gold miner and is expected to extract something valuable from the data. However, whoever thinks a data scientist could do this ALONE is wrong.

2015年12月11日 星期五

[Spark] Spark TW 2015年最後一場活動


2015年的最後一場,也是SparkTW成立一週年,特別有意義的場子.不用特別報名,但是晚來就只能坐地板了!
2015年底最強壓軸檔 -- 時間:12/16號(三)晚上 7:30 -- 地點:大安站燦坤旁資策會九樓

非常有榮幸邀請到在Kaggle以及業界都相當有經驗的Mark Peng大大來跟我們分享他在參與比賽時的寶貴經驗.

2015年6月27日 星期六

[Python] Receiver operating characteristic (ROC) Curve 實作教學

enter image description here
        ROC Curve以及AUC(Area Under Curve)常被用來衡量預測模型的效果,但是因為之前不了解演算法只會套公式,所以趁空擋簡單實作了ROC演算法.

        ROC Curve主要是要將分類模型的效果視覺化,幫助研究人員選擇模型.ROC Curve適用於輸出為機率的分類(例如svm, logistic regression),計算在不同機率條件下,對於判斷結果的影響.

2015年6月23日 星期二

準確率(Precision)與召回率(Recall)


enter image description here

在評估預測模型好壞時,常用的到指標包括Precision, Recall, ROC Curve, AUC等等.但是先前唸書的時候,都只是傻傻背定義,對指標的實際意義沒有太多感觸,直到最近真正跑了幾個模型,開始認真的想要預測結果時,才更深入了解這幾個指標含義及精神.

2015年5月17日 星期日

[DB] Teradata PPI(Partitioned Primary Index) 優化策略教學


        近日在使用Teradata時常感覺校能不如預期(前公司的TD太強了也是原因),但是硬體沒辦法改變,只好從其他地方調整校能。Teradata是分散式儲存的資料倉儲,一些index的方式和一班資料庫不同,沒有Primary Key而是使用Primary Index(簡稱PI)來決定資料散佈的方式,當PI值越離散,資料也會越平均的分布在每個AMP上,下Query時,可以每個AMP同時平行的的處理資料,來加快查詢速度。但是因為資料量時在太大,若要再加快存取時間,就要減少找尋資料的時間,避免Full Table Scan,因此另外使用PPI,來優化查詢過程。

2015年2月9日 星期一

[R] 推薦系統實作(Item Base)

圖片來源:http://betanews.com/2013/09/25/twitter-updates-magicrecs-recommendation-system-for-mobile-users/

承繼上一篇文章[R] 推薦系統實作(User Base) 這篇要介紹的是使用Item Base的角度來推薦使用者物品.

2015年2月7日 星期六

[R] 推薦系統實作(User Base)


推薦系統目的在於根據使用者個人化的特質,推薦使用者喜好的商品或廣告,其中最常使用的演算法為協同式過濾(collaborative filtering).協同式過濾是根據已知的消費行為或是客戶對於商品評價,來猜測客戶對於未購買或未評價的商品可能的評價.協同式過濾中,又以User-base以及Item-base為主要的評價方法.

2014年12月30日 星期二

[Python] Google 經緯度查詢Api


        隨著圖資的開放和普及,GIS資料也越來越受到重視.要結合一般的資料和圖資資料之間一個關鍵就是地址和經緯度(這邊不討論不同座標標示系統的用法...)通常我們比較容易知道的是地址資料,經緯度就要透過握有圖資的單位才能查到(例如:
http://tgos.nat.gov.tw/tgos/web/tgos_home.aspx).但是政府查詢還要申請,使用上也有所限制,好險偉大的google大神也有開放API可以查詢(Orz),為了使用方便就寫了一個簡單的API跟Python接口:

2014年10月25日 星期六

[Python] K-means 分組 Script


        K-means是一種非監督式學習的分類方式,原理將向量空間中的點分成k群後,計算每個點到群組中心的距離,目的在於使點到群心的距離成為最小(參考資料:http://en.wikipedia.org/wiki/K-means_clusteringhttps://www.youtube.com/watch?v=aiJ8II94qck).K-means因為容易理解,所以業界中也很常使用,本篇主要不是講解演算法,而是利用python中的sikit-learn套件製作一個小程式,讓使用者可以輕鬆的使用k-means演算法.

2014年10月11日 星期六

[R] 相見太晚,回頭是岸,分析WOE和IV值的神器套件

        

        最近因為投入研究Spark,對於資料分析的東西比較沒時間琢磨,難得一個雙十假日又可以來體驗一下礦工的生活了.
        
        Data mining不管是用何種方式建立模型,從幾百個變項中選出幾個候選變項往往是整個資料採掘過程最耗人的一個過程,實務上常使用WOE和IV用於變項篩選和分析(特別是信用評分卡模型),並透過WOE將原始資料離散化並取代後放入logistic模型中進行二分變項(結果只有0或1)的分析.

2014年10月10日 星期五

[Apache Spark][開發] 建立第一個RDD物件,體驗in Memory Computing的威力(二)

        拖稿了一下,繼續來介紹SPARK的平行運算能力.前一篇[Spark] 建立第一個RDD物件,體驗平行運算的威力(一)我們透過python在SPARK上建立了第一個RDD物件,接著我們將開始對這個物件做一些操作.

2014年9月13日 星期六

[R] 讀取大資料檔的效率比較:read.table vs freed


        最近在玩Kaggle(https://www.kaggle.com/)上的資料,還沒開始分析就碰到了問題:檔案太大讀不進來.原始檔案約11G的CSV檔,我的電腦只有8g(ram),而R的特性偏偏又是要將檔案讀到記憶體中做運算,根本無法進入下一步.

2014年8月30日 星期六

資料科學愛好者年會開始囉!




今天是第一屆的資料科學愛好者年會http://twconf.data-sci.org票卷在九十分鐘內賣光,來不及報名的朋友可以來這裡看投影片和實況.
投影片在這裡:資料科學愛好者年會粉絲團 https://www.facebook.com/twdsconf?fref=ts
hackpad上的文字實況:https://hackpad.com/2014--yoCSWnghDWb


資料分析鍊金術(七)-insight?

圖片來源:http://www.cgma.org/Resources/Reports/Pages/insight-to-impact-big-data.aspx?TestCookiesEnabled=redirect

        這幾年除了Big Data被超級濫用之外,Insight也是個聽到爛掉的名詞。人們已經無法滿足於單純的分析,而是想更進一步取得Insight,像是Custimer Research變成Customer Insight、或是乾脆用Insight代替Analysis的說法也有。那到底什麼是Insight?

2014年8月25日 星期一

社會網絡分析(Social Network Analysis)--前言


        我們都知道資料科學或是統計科學就是在找X變項與Y變項之間的關係,而一般我們在做資料分析或統計分析的時候,資料都會以下圖的方式呈現:


圖片來源:http://pages.bangor.ac.uk/~pes004/resmeth/msc/spss10.htm

每一行(row)代表了一個調查對象(可能是人、家戶、消費者),每一列(column)代表的是調查單位的屬性(attribute),可能是年齡、性別、居住地區、購物次數等等。大多數的分析方式都研究變項之間的關係。像這樣資料紀錄的方式和分析方式,每個調查對象彼此之間都是獨立的
,看不到之間的關係,在資料分析上產生了盲點。

2014年7月19日 星期六

[Python] 自製N-Gram Analyst 文字探勘(text mining)軟體

       
        做質性調查的時候常需要從受訪者的文句中,挑出重要且關鍵的概念,這些重要概念可能是受訪者查掛在嘴邊,或是無意識間透露出的字句。資料處理上,我們會將受訪者的受訪內容透過文字,以逐字稿的方式呈現,研究者再從中觀察、解析重要的觀念。

2014年7月13日 星期日

[Python] 土炮自製文字探勘(TEXT MINING) N-GRAM演算法

        先前在做文字探勘的時候([R] TEXT MINING(文字探勘練習)),主要會用到tmcn以及Rwordseg這兩個套件,這兩個套件主要是運用字典檔的方式將字詞切開,然後再對於切出來的字詞作次數分配,這樣的作法雖然可以清楚切出常用的詞彙,但是也礙於字典檔的限制,無法一些新的、或特別的術語(例如PTT中的詞彙、或是一些講話的口頭禪)。

2014年7月9日 星期三

資料科學家線上自修課程-最近更新日期:2017-02-20


        現在線上免費的學習資源越來越多了!用本篇文章來整理有在使用的資源,有任何補充或推薦的網站也歡迎隨時留言,謝謝!