一本大道久久香蕉成人网,国产成人无码精品久久久免费,精品综合久久久久久88小说

摘要：文本聚類是搜索引擎和語義web的基本技術(shù)，這次本蛙和大家一起學(xué)習(xí)一下簡單的文本聚類算法，可能不能直接用于實際應(yīng)用中，但對于想學(xué)搜索技術(shù)的初學(xué) 者還是有一定入門作用的。這里會用到TF/IDF權(quán)重，用余弦夾角計算文本相似度，用方差計算兩個數(shù)據(jù)間歐式距離，用k-means進(jìn)行數(shù)據(jù)聚類等數(shù)學(xué)和統(tǒng)計知識。關(guān)于這些概念可以去google，或者參考文本后的參考鏈接。

思路：計算兩篇文檔的相似度，最簡單的做法就是用提取文檔的TF/IDF權(quán)重，然后用余弦定理計算兩個多維向量的距離。能計算兩個文本間的距離后，用標(biāo)準(zhǔn)的k-means算法就可以實現(xiàn)文本聚類了。

測試：首先我們準(zhǔn)備以下數(shù)據(jù)
===================
奧運拳擊入場券基本分罄鄒市明奪冠對手浮出水面
股民要清楚自己的目的
印花稅之股民四季
杭州股民放鞭炮慶祝印花稅下調(diào)
殘疾女青年入圍奧運游泳比賽創(chuàng) 奧運歷史兩項第一
介紹一個 ASP.net MVC 系列教程
在 asp.net 中實現(xiàn) 觀察者模式，或有更好的方法（續(xù)）
輸大錢的股民給我們啟迪
Asp.Net 頁面執(zhí)行流程分析
運動員行李將 “后上先下” 奧運相關(guān) 人員行李實名制
asp.net 控件開發(fā) 顯示控件內(nèi)容
奧運票務(wù) 網(wǎng)上成功訂票后應(yīng) 及時到銀行代售網(wǎng)點付款
某心理健康站開張后首個咨詢者是位新股民
ASP.NET 自定義控件復(fù)雜屬性聲明持久性淺析
==================
很明顯以上數(shù)據(jù)可以分為三類：asp.net，奧運和股民，我們就寫程序來實現(xiàn)它，各種算法的原理網(wǎng)上都有，我就大概只貼代碼，聲明一下，部分代碼是從網(wǎng) 上直接抄的，k-means代碼是我從一篇文章的java示例代碼轉(zhuǎn)換過來的，我給代碼加了不少注釋，希望能幫助大家理解。

以下是入口函數(shù)

static void Main( string [] args)

{

// 1、獲取文檔輸入

string [] docs = getInputDocs( " input.txt " );

if (docs.Length < 1 )

{

Console.WriteLine( " 沒有文檔輸入 " );

Console.Read();

return ;

}

// 2、初始化TFIDF測量器，用來生產(chǎn)每個文檔的TFIDF權(quán)重

TFIDFMeasure tf = new TFIDFMeasure(docs, new Tokeniser());

int K = 3 ; // 聚成3個聚類

// 3、生成k-means的輸入數(shù)據(jù)，是一個聯(lián)合數(shù)組，第一維表示文檔個數(shù)，

// 第二維表示所有文檔分出來的所有詞

double [][] data = new double [docs.Length][];

int docCount = docs.Length; // 文檔個數(shù)

int dimension = tf.NumTerms; // 所有詞的數(shù)目

for ( int i = 0 ; i < docCount; i ++ )

{

for ( int j = 0 ; j < dimension; j ++ )

{

data[i] = tf.GetTermVector2(i); // 獲取第i個文檔的TFIDF權(quán)重向量

}

// 4、初始化k-means算法，第一個參數(shù)表示輸入數(shù)據(jù)，第二個參數(shù)表示要聚成幾個類

WawaKMeans kmeans = new WawaKMeans(data, K);

// 5、開始迭代

kmeans.Start();

// 6、獲取聚類結(jié)果并輸出

WawaCluster[] clusters = kmeans.Clusters;

foreach (WawaCluster cluster in clusters)

{

List < int > members = cluster.CurrentMembership;

Console.WriteLine( " ----------------- " );

foreach ( int i in members)

{

Console.WriteLine(docs[i]);

}

Console.Read();

}

以下是分詞器的主要代碼

/// <summary>

/// 以空白字符進(jìn)行簡單分詞，并忽略大小寫，

/// 實際情況中可以用其它中文分詞算法

/// </summary>

/// <param name="input"></param>

/// <returns></returns>

public IList < string > Partition( string input)

{

Regex r = new Regex( " ([ //t{}():;. /n]) " );

input = input.ToLower() ;

String [] tokens = r.Split(input);

List < string > filter = new List < string > () ;

for ( int i = 0 ; i < tokens.Length ; i ++ )

{

MatchCollection mc = r.Matches(tokens[i]);

if (mc.Count <= 0 && tokens[i].Trim().Length > 0

&& ! StopWordsHandler.IsStopword (tokens[i]) )

filter.Add(tokens[i]) ;

}

return filter.ToArray();

}

以下是kmeans算法的基本代碼

public class WawaKMeans

{

/// <summary>

/// 數(shù)據(jù)的數(shù)量

/// </summary>

readonly int _coordCount;

/// <summary>

/// 原始數(shù)據(jù)

/// </summary>

readonly double [][] _coordinates;

/// <summary>

/// 聚類的數(shù)量

/// </summary>

readonly int _k;

/// <summary>

/// 聚類

/// </summary>

private readonly WawaCluster[] _clusters;

internal WawaCluster[] Clusters

{

get { return _clusters; }

}

/// <summary>

/// 定義一個變量用于記錄和跟蹤每個資料點屬于哪個群聚類

/// _clusterAssignments[j]=i;// 表示第 j 個資料點對象屬于第 i 個群聚類

/// </summary>

readonly int [] _clusterAssignments;

/// <summary>

/// 定義一個變量用于記錄和跟蹤每個資料點離聚類最近

/// </summary>

private readonly int [] _nearestCluster;

/// <summary>

/// 定義一個變量，來表示資料點到中心點的距離,

/// 其中—_distanceCache[i][j]表示第i個資料點到第j個群聚對象中心點的距離；

/// </summary>

private readonly double [,] _distanceCache;

/// <summary>

/// 用來初始化的隨機(jī)種子

/// </summary>

private static readonly Random _rnd = new Random( 1 );

public WawaKMeans( double [][] data, int K)

{

_coordinates = data;

_coordCount = data.Length;

_k = K;

_clusters = new WawaCluster[K];

_clusterAssignments = new int [_coordCount];

_nearestCluster = new int [_coordCount];

_distanceCache = new double [_coordCount,data.Length];

InitRandom();

}

public void Start()

{

int iter = 0 ;

while ( true )

{

Console.WriteLine( " Iteration " + (iter ++ ) + "

" );

// 1、重新計算每個聚類的均值

for ( int i = 0 ; i < _k; i ++ )

{

_clusters[i].UpdateMean(_coordinates);

}

// 2、計算每個數(shù)據(jù)和每個聚類中心的距離

for ( int i = 0 ; i < _coordCount; i ++ )

{

for ( int j = 0 ; j < _k; j ++ )

{

double dist = getDistance(_coordinates[i], _clusters[j].Mean);

_distanceCache[i,j] = dist;

}

// 3、計算每個數(shù)據(jù)離哪個聚類最近

for ( int i = 0 ; i < _coordCount; i ++ )

{

_nearestCluster[i] = nearestCluster(i);

}

// 4、比較每個數(shù)據(jù)最近的聚類是否就是它所屬的聚類

// 如果全相等表示所有的點已經(jīng)是最佳距離了，直接返回；

int k = 0 ;

for ( int i = 0 ; i < _coordCount; i ++ )

{

if (_nearestCluster[i] == _clusterAssignments[i])

k ++ ;

}

if (k == _coordCount)

break ;

// 5、否則需要重新調(diào)整資料點和群聚類的關(guān)系，調(diào)整完畢后再重新開始循環(huán)；

// 需要修改每個聚類的成員和表示某個數(shù)據(jù)屬于哪個聚類的變量

for ( int j = 0 ; j < _k; j ++ )

{

_clusters[j].CurrentMembership.Clear();

}

for ( int i = 0 ; i < _coordCount; i ++ )

{

_clusters[_nearestCluster[i]].CurrentMembership.Add(i);

_clusterAssignments[i] = _nearestCluster[i];

}

/// <summary>

/// 計算某個數(shù)據(jù)離哪個聚類最近

/// </summary>

/// <param name="ndx"></param>

/// <returns></returns>

int nearestCluster( int ndx)

{

int nearest = - 1 ;

double min = Double.MaxValue;

for ( int c = 0 ; c < _k; c ++ )

{

double d = _distanceCache[ndx,c];

if (d < min)

{

min = d;

nearest = c;

}

if (nearest ==- 1 )

{

;

}

return nearest;

}

/// <summary>

/// 計算某數(shù)據(jù)離某聚類中心的距離

/// </summary>

/// <param name="coord"></param>

/// <param name="center"></param>

/// <returns></returns>

static double getDistance( double [] coord, double [] center)

{

// int len = coord.Length;

// double sumSquared = 0.0;

// for (int i = 0; i < len; i++)

// {

// double v = coord[i] - center[i];

// sumSquared += v * v; // 平方差

// }

// return Math.Sqrt(sumSquared);

// 也可以用余弦夾角來計算某數(shù)據(jù)離某聚類中心的距離

return 1 - TermVector.ComputeCosineSimilarity(coord, center);

}

/// <summary>

/// 隨機(jī)初始化k個聚類

/// </summary>

private void InitRandom()

{

for ( int i = 0 ; i < _k; i ++ )

{

int temp = _rnd.Next(_coordCount);

_clusterAssignments[temp] = i; // 記錄第temp個資料屬于第i個聚類

_clusters[i] = new WawaCluster(temp,_coordinates[temp]);

}

以下是聚類實體類的定義

internal class WawaCluster

{

public WawaCluster( int dataindex, double [] data)

{

CurrentMembership.Add(dataindex);

Mean = data;

}

/// <summary>

/// 該聚類的數(shù)據(jù)成員索引

/// </summary>

internal List < int > CurrentMembership = new List < int > ();

/// <summary>

/// 該聚類的中心

/// </summary>

internal double [] Mean;

/// <summary>

/// 該方法計算聚類對象的均值

/// </summary>

/// <param name="coordinates"></param>

public void UpdateMean( double [][] coordinates)

{

// 根據(jù) mCurrentMembership 取得原始資料點對象 coord ，該對象是 coordinates 的一個子集；

// 然后取出該子集的均值；取均值的算法很簡單，可以把 coordinates 想象成一個 m*n 的距陣 ,

// 每個均值就是每個縱向列的取和平均值 , // 該值保存在 mCenter 中

for ( int i = 0 ; i < CurrentMembership.Count; i ++ )

{

double [] coord = coordinates[CurrentMembership[i]];

for ( int j = 0 ; j < coord.Length; j ++ )

{

Mean[j] += coord[j]; // 得到每個縱向列的和；

}

for ( int k = 0 ; k < Mean.Length; k ++ )

{

Mean[k] /= coord.Length; // 對每個縱向列取平均值

}

計算TF/IDF和利用余弦定理計算相似度的代碼見完整版的代碼下載，那兩部分都是外國人寫的，里面有它的聯(lián)系方式，不懂的可以問他，反正我差不多懂了。

下面看看咱們的測試結(jié)果：
Iteration 0...
Iteration 1...
Iteration 2...
-----------------
奧運拳擊入場券基本分罄鄒市明奪冠對手浮出水面
杭州股民放鞭炮慶祝印花稅下調(diào)
殘疾女青年入圍奧運游泳比賽創(chuàng) 奧運歷史兩項第一
運動員行李將 “后上先下” 奧運相關(guān) 人員行李實名制
奧運票務(wù) 網(wǎng)上成功訂票后應(yīng) 及時到銀行代售網(wǎng)點付款
-----------------
股民要清楚自己的目的
印花稅之股民四季
輸大錢的股民給我們啟迪
某心理健康站開張后首個咨詢者是位新股民
-----------------
介紹一個 ASP.net MVC 系列教程
在 asp.net 中實現(xiàn) 觀察者模式，或有更好的方法（續(xù)）
Asp.Net 頁面執(zhí)行流程分析
asp.net 控件開發(fā) 顯示控件內(nèi)容
ASP.NET 自定義控件復(fù)雜屬性聲明持久性淺析聚類聚的非常準(zhǔn)確，而且只迭代了3次，模型就收斂了，當(dāng)然了這是最理想的效果，其實聚類的結(jié)果受好多種因素制約，提取特征的算法，隨機(jī)初始化函數(shù)，kmeans算法的實現(xiàn)等，都有優(yōu)化的地方，不信你把輸入的數(shù)據(jù)的順序改改，聚類結(jié)果就不一樣了，或者把隨機(jī)數(shù)的種子變一下，結(jié)果也不一樣，k- means算法加入一些變異系數(shù)的調(diào)整，結(jié)果也不一樣，提取特征的地方不用TF/IDF權(quán)重算法用別的，結(jié)果肯定也不一樣。
完整代碼里還有另一組測試數(shù)據(jù)，結(jié)果也很不錯，我的意思是我的算法不是針對一組測試數(shù)據(jù)，而是針對好多數(shù)據(jù)都有不錯的結(jié)果。

總結(jié)：數(shù)學(xué)和英語真是寫程序之根本呀，弄這個東西遇到了好多英語單詞不會，查還查不出來，也理解不了，最后google一看，是個數(shù)學(xué)專用詞，再搜索這個數(shù)學(xué)專用詞的中文解釋，發(fā)現(xiàn)還是理解不了那數(shù)學(xué)原理。所以還是得多學(xué)習(xí)數(shù)學(xué)和英語。

參考鏈接：
K-MEANS算法
http://beauty9235.javaeye.com/blog/161675
什么是變異系數(shù)
http://zhidao.baidu.com/question/15013015.html
TF/IDF實現(xiàn)
http://www.codeproject.com/KB/cs/tfidf.aspx

源碼下載：WawaTextCluster.zip

http://www.cnblogs.com/onlytiancai/archive/2008/05/10/1191557.html 《來源》

posted on 2012-04-01 07:57 Snape 閱讀(572) 評論(0) 編輯收藏引用所屬分類: C++ 轉(zhuǎn)載

只有注冊用戶登錄后才能發(fā)表評論。
【推薦】100%開源！大型工業(yè)跨平臺軟件C++源碼提供，建模，組態(tài)！

相關(guān)文章: 深入理解C語言(轉(zhuǎn)coolshell) 程序員的奮斗史（一）——淺談幾種主要編程語言(轉(zhuǎn)) 類間關(guān)系（轉(zhuǎn)）教你文本聚類（轉(zhuǎn)）字符串相似度算法介紹(整理)(轉(zhuǎn)) 【轉(zhuǎn)】面向?qū)ο笤O(shè)計中的經(jīng)驗原則關(guān)于默認(rèn)構(gòu)造函數(shù)的幾個錯誤認(rèn)識（四種情況下，編譯器會生成默認(rèn)構(gòu)造函數(shù)）如何學(xué)好C++語言（轉(zhuǎn)）一個類的實例化對象所占空間的大小 extern "C"

網(wǎng)站導(dǎo)航: 博客園 IT新聞 BlogJava 博問 Chat2DB 管理

chenglong7997

教你文本聚類（轉(zhuǎn)）

教你文本聚類

導(dǎo)航

統(tǒng)計

常用鏈接

留言簿

隨筆分類

隨筆檔案

文章分類

文章檔案

my

搜索

最新評論

閱讀排行榜

評論排行榜