phpanalysis中文分詞類詳解
來源:易賢網(wǎng) 閱讀:722 次 日期:2014-10-08 13:16:22
溫馨提示:易賢網(wǎng)小編為您整理了“phpanalysis中文分詞類詳解”,方便廣大網(wǎng)友查閱!

phpanalysis是目前廣泛使用的中文分詞類,使用反向匹配模式分詞,因此兼容編碼更廣泛,現(xiàn)將其變量與常用函數(shù)詳解如下:

一、比較重要的成員變量

$resulttype = 1 生成的分詞結(jié)果數(shù)據(jù)類型(1 為全部, 2為 詞典詞匯及單個中日韓簡繁字符及英文, 3 為詞典詞匯及英文)

這個變量一般用 setresulttype( $rstype ) 這方法進行設置。

$notsplitlen = 5 切分句子最短長度

$tolower = false 把英文單詞全部轉(zhuǎn)小寫

$differmax = false 使用最大切分模式對二元詞進行消岐

$unitword = true 嘗試合并單字(即是新詞識別)

$differfreq = false 使用熱門詞優(yōu)先模式進行消岐

二、主要成員函數(shù)列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')

函數(shù)說明:構(gòu)造函數(shù)

參數(shù)列表:

$source_charset 源字符串編碼

$target_charset 目錄字符串編碼

$load_all 是否完全加載詞典(此參數(shù)已經(jīng)作廢)

$source 源字符串

如果輸入輸出都是utf-8,實際上可以不必使用任何參數(shù)進行初始化,而是通過 setsource 方法設置要操作的文本

2、public function setsource( $source, $source_charset='utf-8', $target_charset='utf-8' )

函數(shù)說明:設置源字符串

參數(shù)列表:

$source 源字符串

$source_charset 源字符串編碼

$target_charset 目錄字符串編碼

返回值:bool

3、public function startanalysis($optimize=true)

函數(shù)說明:開始執(zhí)行分詞操作

參數(shù)列表:

$optimize 分詞后是否嘗試優(yōu)化結(jié)果

返回值:void

一個基本的分詞過程:

//////////////////////////////////////

$pa = new phpanalysis();

$pa->setsource('需要進行分詞的字符串');

//設置分詞屬性

$pa->resulttype = 2;

$pa->differmax = true;

$pa->startanalysis();

//獲取你想要的結(jié)果

$pa->getfinallyindex();

////////////////////////////////////////

4、public function setresulttype( $rstype )

函數(shù)說明:設置返回結(jié)果的類型

實際是對成員變量$resulttype的操作

參數(shù) $rstype 值為:

1 為全部, 2為 詞典詞匯及單個中日韓簡繁字符及英文, 3 為詞典詞匯及英文

返回值:void

5、public function getfinallykeywords( $num = 10 )

函數(shù)說明:獲取出現(xiàn)頻率最高的指定詞條數(shù)(通常用于提取文檔關鍵字)

參數(shù)列表:

$num = 10 返回詞條個數(shù)

返回值:用,分隔的關鍵字列表

6、public function getfinallyresult($spword=' ')

函數(shù)說明:獲得最終分詞結(jié)果

參數(shù)列表:

$spword 詞條之間的分隔符

返回值:string

7、public function getsimpleresult()

函數(shù)說明:獲得粗分結(jié)果

返回值:array

8、public function getsimpleresultall()

函數(shù)說明:獲得包含屬性信息的粗分結(jié)果

屬性(1中文詞句、2 ansi詞匯(包括全角),3 ansi標點符號(包括全角),4數(shù)字(包括全角),5 中文標點或無法識別字符)

返回值:array

9、public function getfinallyindex()

函數(shù)說明:獲取hash索引數(shù)組

返回值:array('word'=>count,...) 按出現(xiàn)頻率排序

10、public function makedict( $source_file, $target_file='' )

函數(shù)說明:把文本文件詞庫編譯成詞典

參數(shù)列表:

$source_file 源文本文件

$target_file 目標文件(如果不指定,則為當前詞典)

返回值:void

11、public function exportdict( $targetfile )

函數(shù)說明:導出當前詞典全部詞條為文本文件

參數(shù)列表:

$targetfile 目標文件

返回值:void

更多信息請查看IT技術專欄

更多信息請查看腳本欄目
易賢網(wǎng)手機網(wǎng)站地址:phpanalysis中文分詞類詳解

2025國考·省考課程試聽報名

  • 報班類型
  • 姓名
  • 手機號
  • 驗證碼
關于我們 | 聯(lián)系我們 | 人才招聘 | 網(wǎng)站聲明 | 網(wǎng)站幫助 | 非正式的簡要咨詢 | 簡要咨詢須知 | 加入群交流 | 手機站點 | 投訴建議
工業(yè)和信息化部備案號:滇ICP備2023014141號-1 云南省教育廳備案號:云教ICP備0901021 滇公網(wǎng)安備53010202001879號 人力資源服務許可證:(云)人服證字(2023)第0102001523號
聯(lián)系電話:0871-65099533/13759567129 獲取招聘考試信息及咨詢關注公眾號:hfpxwx
咨詢QQ:526150442(9:00—18:00)版權(quán)所有:易賢網(wǎng)