中文字幕日韩一区二区_国产一区二区av_国产毛片av_久久久久国产一区_色婷婷电影_国产一区二区精品

PHPAnalysis中文分詞類詳解

phpAnalysis是目前廣泛使用的中文分詞類,使用反向匹配模式分詞,因此兼容編碼更廣泛,現(xiàn)將其變量與常用函數(shù)詳解如下:

一、比較重要的成員變量

$resultType   = 1        生成的分詞結果數(shù)據(jù)類型(1 為全部, 2為 詞典詞匯及單個中日韓簡繁字符及英文, 3 為詞典詞匯及英文)
                                    這個變量一般用 SetResultType( $rstype ) 這方法進行設置。
$notSplitLen  = 5        切分句子最短長度
$toLower      = false    把英文單詞全部轉小寫
$differMax    = false    使用最大切分模式對二元詞進行消岐
$unitWord     = true     嘗試合并單字(即是新詞識別)
$differFreq   = false    使用熱門詞優(yōu)先模式進行消岐

二、主要成員函數(shù)列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函數(shù)說明:構造函數(shù)
參數(shù)列表:
$source_charset      源字符串編碼
$target_charset      目錄字符串編碼
$load_all            是否完全加載詞典(此參數(shù)已經(jīng)作廢)
$source              源字符串
如果輸入輸出都是utf-8,實際上可以不必使用任何參數(shù)進行初始化,而是通過 SetSource 方法設置要操作的文本

2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函數(shù)說明:設置源字符串
參數(shù)列表:
$source              源字符串
$source_charset      源字符串編碼
$target_charset      目錄字符串編碼
返回值:bool

3、public function StartAnalysis($optimize=true)
函數(shù)說明:開始執(zhí)行分詞操作
參數(shù)列表:
$optimize            分詞后是否嘗試優(yōu)化結果
返回值:void
一個基本的分詞過程:
//////////////////////////////////////
$pa = new phpAnalysis();

$pa->SetSource('需要進行分詞的字符串');

//設置分詞屬性
$pa->resultType = 2;
$pa->differMax  = true;

$pa->StartAnalysis();

//獲取你想要的結果
$pa->GetFinallyIndex();
////////////////////////////////////////

4、public function SetResultType( $rstype )
函數(shù)說明:設置返回結果的類型
實際是對成員變量$resultType的操作
參數(shù) $rstype 值為:
1 為全部, 2為 詞典詞匯及單個中日韓簡繁字符及英文, 3 為詞典詞匯及英文
返回值:void

5、public function GetFinallyKeywords( $num = 10 )
函數(shù)說明:獲取出現(xiàn)頻率最高的指定詞條數(shù)(通常用于提取文檔關鍵字)
參數(shù)列表:
$num = 10  返回詞條個數(shù)
返回值:用","分隔的關鍵字列表

6、public function GetFinallyResult($spword=' ')
函數(shù)說明:獲得最終分詞結果
參數(shù)列表:
$spword    詞條之間的分隔符
返回值:string

7、public function GetSimpleResult()
函數(shù)說明:獲得粗分結果
返回值:array

8、public function GetSimpleResultAll()
函數(shù)說明:獲得包含屬性信息的粗分結果
屬性(1中文詞句、2 ANSI詞匯(包括全角),3 ANSI標點符號(包括全角),4數(shù)字(包括全角),5 中文標點或無法識別字符)
返回值:array

9、public function GetFinallyIndex()
函數(shù)說明:獲取hash索引數(shù)組
返回值:array('word'=>count,...) 按出現(xiàn)頻率排序

10、public function MakeDict( $source_file, $target_file='' )
函數(shù)說明:把文本文件詞庫編譯成詞典
參數(shù)列表:
$source_file   源文本文件
$target_file   目標文件(如果不指定,則為當前詞典)
返回值:void

11、public function ExportDict( $targetfile )
函數(shù)說明:導出當前詞典全部詞條為文本文件
參數(shù)列表:
$targetfile  目標文件
返回值:void

php技術PHPAnalysis中文分詞類詳解,轉載需保留來源!

鄭重聲明:本文版權歸原作者所有,轉載文章僅為傳播更多信息之目的,如作者信息標記有誤,請第一時間聯(lián)系我們修改或刪除,多謝。

主站蜘蛛池模板: 成人精品视频在线观看 | 羞羞视频网页 | 国产精品久久久久久二区 | 久久久久久久久国产成人免费 | 国产精品久久片 | 日韩视频在线免费观看 | 中文字幕日韩专区 | 国产区一区二区三区 | 国产在线一区二区 | 在线日韩 | 精品一区二区在线观看 | 中文字幕亚洲欧美 | 九九色综合 | 日韩中文字幕在线观看 | 成人免费视频 | 黄色网址大全在线观看 | 亚洲精彩视频在线观看 | 国产精品美女久久久久久久网站 | 黄色av网站免费看 | 日韩成人精品一区二区三区 | 国产激情免费视频 | 国产高清一二三区 | 国产精彩视频 | 国产精品久久久久久吹潮 | 在线国产视频 | 国产成人综合av | 日韩一区二区在线视频 | 黑人巨大精品 | 日韩欧美一区二区三区 | av三级在线观看 | 自拍偷拍一区二区三区 | 日本天堂视频 | 91精品国产91综合久久蜜臀 | 亚洲国产精品激情在线观看 | 中文字幕精品视频在线观看 | 精品成人免费一区二区在线播放 | 亚洲精品一区二区三区蜜桃久 | 午夜免费网站 | 中文字幕免费在线 | 一级片在线观看 | 欧美一区二区精品 |