顯示具有 文字探勘 標籤的文章。 顯示所有文章
顯示具有 文字探勘 標籤的文章。 顯示所有文章

2014年12月29日 星期一

[Python][教學] 網路爬蟲(crawler)實務(下)--爬蟲策略以及設定


       
        在知道目標之後,接著就要決定如何達成。網路爬蟲的概念很簡單,就是進入網頁之後,將網站中的原始碼擷取下來,透過Xpath或是Html節點的方式來找到目標字串。根據上次[Python][教學] 網路爬蟲(crawler)實務(上)--網頁元件解析分析的內容,我們的爬網策略大致上會是:

2014年12月17日 星期三

[Python][教學] Scrapy(Web Crawler) to PostgreSQL(二)postgreSQL資料庫連接設定


        上一篇[Python] Scrapy(Web Crawler) to PostgreSQL(一)簡介 & 爬蟲基本設定介紹了網路爬蟲的基本設定後,這篇就是要接著介紹如何設定postgreSQL.首先我們要先安裝PostgreSQL(這句好像有點廢話).到官方網站(http://www.postgresql.org)找到屬於自己作業系統的連結,Mac可以到(http://postgresapp.com)下載postgreapp,點開來安裝,單機版的設定相當簡單.如果習慣透過command line呼叫postgreSQL的話,還需要到http://postgresapp.com/documentation/cli-tools.html設定PATH.
        安裝好DB後,繼續回到Scrapy上.要連結並操作PostgreSQL,有幾個檔案需要設定,以下將一一介紹:

2014年11月22日 星期六

[R] 當Text Mining專案完成度達到99%之後...


       先前接下了一個號稱完成度99%的專案,只剩下一個小bug解決好就可以上線...故事由真人真事改編.故事背景是有個利用R來做text mining(文本分析)的專案要上線,這個專案使用了tm package和segmentCN兩個標準的配備(可以參考:[R] TEXT MINING(文字探勘、文本分析練習)).原本剩下這1%的問題在於開發環境和上線環境不同,導致結果的不一致.這個問題在當初我就有寫篇專文[R] tm package version 0.6 大解析(text mining文字探勘套件)來處理這個問題(使用了非常瑣碎的爛方法...有更好的方法請跟我說Orz).今天的故事是從這邊接下去開始...

2014年9月20日 星期六

[R] tm package version 0.6 大解析(text mining文字探勘套件)

        有在玩text mining的同好,最近不知道有沒有碰過類似的問題,就是很多以前用tm套件的程式跑不出來或有問題(先前文章[R] TEXT MINING(文字探勘、文本分析練習)就有使用這個套件)。這是因為tm套件在今年的6/1號升級到了0.6版(http://cran.r-project.org/web/packages/tm/index.html)改變了包裝corpus的方式(http://cran.r-project.org/web/packages/tm/news.html)很多東西都必須rebuild才能正常運作(其實這也是我個人的血淚經驗).


2014年7月19日 星期六

[Python] 自製N-Gram Analyst 文字探勘(text mining)軟體

       
        做質性調查的時候常需要從受訪者的文句中,挑出重要且關鍵的概念,這些重要概念可能是受訪者查掛在嘴邊,或是無意識間透露出的字句。資料處理上,我們會將受訪者的受訪內容透過文字,以逐字稿的方式呈現,研究者再從中觀察、解析重要的觀念。

2014年7月16日 星期三

[Python] 土砲N-GRAM(文字探勘、文本分析工具)演算法大升級! 加入長詞優先法與斷句系統


        上次很簡單做的N-gram演算法其實有幾個明顯缺點:
1. 標點符號一起加入計算
2. 有些字詞屬於長詞中的一部分,例如"拉熊"是"拉拉熊"的部分,兩者會重複計算,但其實"拉拉熊"才有意義
3. 中英數混合文章無法取得有意義分析

        本次的更新重點在於:
1. 以標點符號來切割句子,取得更有意義的結果
2. 以"長詞優先法"來優先計算詞句出現的次數,並刪除子詞


2014年7月13日 星期日

[Python] 土炮自製文字探勘(TEXT MINING) N-GRAM演算法

        先前在做文字探勘的時候([R] TEXT MINING(文字探勘練習)),主要會用到tmcn以及Rwordseg這兩個套件,這兩個套件主要是運用字典檔的方式將字詞切開,然後再對於切出來的字詞作次數分配,這樣的作法雖然可以清楚切出常用的詞彙,但是也礙於字典檔的限制,無法一些新的、或特別的術語(例如PTT中的詞彙、或是一些講話的口頭禪)。

2014年6月22日 星期日

[Python][教學] 現學現賣之網路爬蟲(Crawler)--以抓本BLOG為例

圖片來源:http://www.417marketing.com/how-do-web-crawlers-work/

        之前有透過R抓取網路資料([R]用R抓網頁資料),也透過R來進行文字探勘([R] TEXT MINING(文字探勘練習)),一直想結合這兩個東西來做些有趣的事情,例如分析我的BLOG,看看我平常到底最常用哪些字詞,或到底使用了哪些核心字彙。但是這件事一直拖著沒有做,因為BLOGGER的文章內容並不是那麼好爬,用R來寫可能相對困難。直到有一天,看到了這個資料科學計畫 資料爬理析 Python 實戰班 2 馬上二話不說報名參加,趁著今天剛上完課記憶火熱的時候,來寫的抓自己BLOG的爬蟲。

2014年6月7日 星期六

[R] TEXT MINING(文字探勘、文本分析練習)

        BIG DATA時代要說跟一般資料庫分析有什麼不一樣的地方,除了更多資料外,就是更多對於非結構化資料的蒐集了。網路媒體有別於傳統媒體,每個使用者都可以製造、生產訊息,網路上的訊息量比美國國會圖書館還多了N^N倍,這些資料都不是整理好的資料,甚至大多不是是數值資料,為了蒐集並且分析這些資料,TEXT MINING(文字探勘)成了近幾年的主流。

      一般文字探勘軟體都很貴...而且不支援中文文字探勘,因此在華人世界,R成為文字探勘者最主要的工具(畢竟免費),而且有大神在開發中文文字探勘R套件,讓R成為中文文字探勘神器。