顯示具有 R 標籤的文章。 顯示所有文章
顯示具有 R 標籤的文章。 顯示所有文章

2015年2月24日 星期二

[R] Gradient Descent(SGD) 演算法實作

圖片來源:http://en.wikipedia.org/wiki/Gradient_descent

先前的[Algorithm] Stochastic gradient descent(梯度下降法)作為Online Learning Model(即時訓練模型)(一)提到使用SGD的方式來跑linear regression。本文嘗試使用R來實作這段過程(但是範例是batch作業,非即時):

2015年2月16日 星期一

[R] 各種相似性(Similarity) 演算法實作


在推薦系統或是文字探勘中,常常會需要比較兩個人或兩篇文章的相似性,相似性有許多種測量的方式,每種測量方式都有它的特性和適用的地方,本篇文章用R來實作並簡單比較幾種常用到的相似性.

2015年2月9日 星期一

[R] 推薦系統實作(Item Base)

圖片來源:http://betanews.com/2013/09/25/twitter-updates-magicrecs-recommendation-system-for-mobile-users/

承繼上一篇文章[R] 推薦系統實作(User Base) 這篇要介紹的是使用Item Base的角度來推薦使用者物品.

2015年2月7日 星期六

[R] 推薦系統實作(User Base)


推薦系統目的在於根據使用者個人化的特質,推薦使用者喜好的商品或廣告,其中最常使用的演算法為協同式過濾(collaborative filtering).協同式過濾是根據已知的消費行為或是客戶對於商品評價,來猜測客戶對於未購買或未評價的商品可能的評價.協同式過濾中,又以User-base以及Item-base為主要的評價方法.

2014年10月11日 星期六

[R] 相見太晚,回頭是岸,分析WOE和IV值的神器套件

        

        最近因為投入研究Spark,對於資料分析的東西比較沒時間琢磨,難得一個雙十假日又可以來體驗一下礦工的生活了.
        
        Data mining不管是用何種方式建立模型,從幾百個變項中選出幾個候選變項往往是整個資料採掘過程最耗人的一個過程,實務上常使用WOE和IV用於變項篩選和分析(特別是信用評分卡模型),並透過WOE將原始資料離散化並取代後放入logistic模型中進行二分變項(結果只有0或1)的分析.

2014年9月20日 星期六

[R] tm package version 0.6 大解析(text mining文字探勘套件)

        有在玩text mining的同好,最近不知道有沒有碰過類似的問題,就是很多以前用tm套件的程式跑不出來或有問題(先前文章[R] TEXT MINING(文字探勘、文本分析練習)就有使用這個套件)。這是因為tm套件在今年的6/1號升級到了0.6版(http://cran.r-project.org/web/packages/tm/index.html)改變了包裝corpus的方式(http://cran.r-project.org/web/packages/tm/news.html)很多東西都必須rebuild才能正常運作(其實這也是我個人的血淚經驗).


2014年9月13日 星期六

[R] 讀取大資料檔的效率比較:read.table vs freed


        最近在玩Kaggle(https://www.kaggle.com/)上的資料,還沒開始分析就碰到了問題:檔案太大讀不進來.原始檔案約11G的CSV檔,我的電腦只有8g(ram),而R的特性偏偏又是要將檔案讀到記憶體中做運算,根本無法進入下一步.

2014年9月7日 星期日

[R] 到底還有什麼可以吃!!!???以社會網絡分析(Social Network Analysis)觀察地溝油事件

在進入本文前,先讓我們看部影片

        所謂地溝油(http://zh.wikipedia.org/wiki/地沟油)就是廢物利用將使用過的油再次回收精煉使用的技術,技術層級超英趕美,是世界糧食的救星 ,本文的產生即是為了紀念這歷史性的一刻.

2014年8月30日 星期六

[R] PTT推文文化的社群網絡分析(Social Network Analysis),帶你一窺社群網絡中的互動情況




        PTT是台灣最大的社群網站(http://zh.wikipedia.org/wiki/批踢踢),很多人介紹過我就不多費脣舌,PTT中很特別的功能就是可以推文回應作者,畢竟回文相對來說比較正式,推文感覺更加閒聊的性質.Wxxxxd版相對PTT中的其他版來說,由於有每日發文限制,版友之間更頃向利用推文的方式來互動,而且因為男多女少的緣故,通常女生的推文比較多人推,男生(例如我)可能發文都沒人鳥,然後網友之間彼此也會利用推文互動,本文就是要以圖像化的方式來展現這種推文互動關係。


2014年8月18日 星期一

[R][翻譯] 快速計算統計資訊(使用dplyr 套件)

        dplyr是個實用好用的套件,主要功能是用來取代運算慢的SQL套件,來做變項的aggregate運算。(不過在我還是新手的時候SQL套件真的幫了我很多忙XD) 這篇文章的原文為:

Using R: quickly calculating summary statistics (with dplyr)

2014年7月30日 星期三

[R] SQLDF VS LAPPY效率測試


        剛開始學R的時候對於R的指令很不熟,所以大部分都習慣用sqldf來寫查詢指令。隨著對R的熟悉,最近也在嘗試用R內建的fnction來查詢資料,所以才想說來比較一下兩者的效能差異。俗話說時間就是金錢,在處理大量數據的時候,對於處理速度更是要斤斤計較。

2014年7月12日 星期六

[R] R3.1.1出來啦 !



        搶先報! R3.1.1(代號: Sock it to me!)釋出啦! 只要在R consle裡面輸入:
        install.packages("installr"); require(installr)
安裝完成後再輸入
updateR()
就可以無痛升級到最新版本啦!本次改變沒有太多重要的新功能,但是改了相當多的bug,詳細的更新項目可以參考:http://cran.rstudio.com/bin/windows/base/NEWS.R-3.1.1.html 因為相當多功能我也沒用過,也不知道從何翻起阿阿阿!!(其實就是懶而已)


資料與圖片來源:http://www.r-bloggers.com/r-3-1-1-is-released-and-how-to-quickly-update-it-on-windows-os/

2014年7月9日 星期三

[R] 以不變應萬變-SQL in R


        只要有用到資料庫,那一定會學到SQL(Structured Query Language-結構化查詢語言)的語法,SPSS和SAS也有類似的語法或套件,SAS EG更是大量使用SQL的語法。雖然版本很多,但是SQL的語法大同小異,在剛使用R的時候,由於對其他的指令還不熟悉,馬上就搜尋有無SQL的套件可以使用--有的,叫做SQLdf(http://cran.r-project.org/web/packages/sqldf/index.html)


資料科學家線上自修課程-最近更新日期:2017-02-20


        現在線上免費的學習資源越來越多了!用本篇文章來整理有在使用的資源,有任何補充或推薦的網站也歡迎隨時留言,謝謝!

2014年6月22日 星期日

[Python][教學] 現學現賣之網路爬蟲(Crawler)--以抓本BLOG為例

圖片來源:http://www.417marketing.com/how-do-web-crawlers-work/

        之前有透過R抓取網路資料([R]用R抓網頁資料),也透過R來進行文字探勘([R] TEXT MINING(文字探勘練習)),一直想結合這兩個東西來做些有趣的事情,例如分析我的BLOG,看看我平常到底最常用哪些字詞,或到底使用了哪些核心字彙。但是這件事一直拖著沒有做,因為BLOGGER的文章內容並不是那麼好爬,用R來寫可能相對困難。直到有一天,看到了這個資料科學計畫 資料爬理析 Python 實戰班 2 馬上二話不說報名參加,趁著今天剛上完課記憶火熱的時候,來寫的抓自己BLOG的爬蟲。

2014年6月19日 星期四

[R][翻譯]Reshape(transpose)! 資料的變形金剛

 

        今天的文章來自這裡
Reshape Package in R: Long Data format, to Wide, back to Long again 
        我們在做資料的時候,為了配合不同的演算法、公式、統計套件、或整理報表需求,我們常常需要將資料轉來轉去。最簡單的轉法就是行列交換(又稱轉置、transpose),但是實務上,這種轉置用途太小了,我們需要更複雜的變形。

2014年6月12日 星期四

[R][翻譯] apply、sapply、lapply之區別

原文:Using apply, sapply, lapply in R
        R和一般程式語言或統計軟體的不同在於進行迴圈運算時,可以使用向量的方式來處理,也就是本文主要要介紹的apply、sapply和lapply。這三個功能相似,卻有一點不同,今天無意中發現一篇好文章在比較這三者,因此將原文翻譯並摘要後與大家分享。

2014年6月7日 星期六

[R] TEXT MINING(文字探勘、文本分析練習)

        BIG DATA時代要說跟一般資料庫分析有什麼不一樣的地方,除了更多資料外,就是更多對於非結構化資料的蒐集了。網路媒體有別於傳統媒體,每個使用者都可以製造、生產訊息,網路上的訊息量比美國國會圖書館還多了N^N倍,這些資料都不是整理好的資料,甚至大多不是是數值資料,為了蒐集並且分析這些資料,TEXT MINING(文字探勘)成了近幾年的主流。

      一般文字探勘軟體都很貴...而且不支援中文文字探勘,因此在華人世界,R成為文字探勘者最主要的工具(畢竟免費),而且有大神在開發中文文字探勘R套件,讓R成為中文文字探勘神器。

2014年6月1日 星期日

[R]用R將資料依百分位數分組(Recode Data by Percentile) 連續型資料轉離散

        在資料分析中我們可以大致將資料類型分為離散型變項以及連續型變項兩種類別,以統計檢定來說,連續型資料的檢定力相對較強,結果也相對具有說服力。但是在真實社會環境中,第一很難確切的蒐集到那麼多連續型的變項;二來連續型變項之間的關係,由於檢定力強,反過來說就是除非兩者關係相當明確,否則很難證實相關性;若遇到這些情況,我們通常就會需要將連續型變項轉換成離散型變項,簡單來說就是將資料重新分組(或稱為recode)

2014年5月15日 星期四

[R]R的學習資源推薦

        R是統計分析或DATA MINING中目前使用者比例最高的軟體。但是國內相關的資源相對來說卻不如其他統計軟體(特別是SPSS),剛開始學R的時候花了很多時間和金錢報名課程和摸索。在這邊列出一些我常在使用或曾經使用過的線上資源供各位朋友參考。