您好,欢迎访问一九零五行业门户网

php中文分词与自动获取关键词的方法

set_dict(app_root.'/scws/dict.utf8.xdb');$pscws->set_rule(app_root.'/scws/rules.utf8.ini');$pscws->set_ignore(true);$pscws->send_text($title);$words = $pscws->get_tops(5);$tags = array();foreach ($words as $val) {$tags[] = $val['word'];}$pscws->close();return $tags;}print_r(get_tags_arr($test));//=--------------------------------function get_keywords_str($content){require(app_root.'/phpanalysis.class.php');phpanalysis::$loadinit = false;$pa = new phpanalysis('utf-8', 'utf-8', false);$pa->loaddict();$pa->setsource($content);$pa->startanalysis( false );$tags = $pa->getfinallyresult();return $tags;}print(get_keywords_str($test));
复制代码
scws – 简易中文分词系统
scws 在概念上并无创新成分,采用的是自行采集的词频词典,并辅以一定程度上的专有名称、人名、地名、数字年代等规则集,经小范围测试大概准确率在 90% ~ 95% 之间,已能基本满足一些中小型搜索引擎、关键字提取等场合运用。 scws 采用纯 c 代码开发,以 unix-like os 为主要平台环境,提供共享函数库,方便植入各种现有软件系统。此外它支持 gbk,utf-8,big5 等汉字编码,切词效率高。
系统平台:windows/unix开发语言:c使用方式:php扩展
演示网址:http://www.ftphp.com/scws/demo.php开源官网:http://www.ftphp.com/scws/
注:作为php扩展,容易与现有的基于php架构的web系统继续集成,是其一大优势。
phpanalysis - php无组件分词系统
phpanalysis分词系统是基于字符串匹配的分词方法 ,这种方法又叫做机械分词方法,它是按照一定的策略将待分析的汉字串与一个“充分大的”机器词典中的词条进行配,若在词典中找到某个字符串,则匹配成功(识别出一个词)。按照扫描方向的不同,串匹配分词方法可以分为正向匹配 和逆向匹配;按照不同长度优先匹配的情况,可以分为最大(最长)匹配和最小(最短)匹配;按照是否与词性标注过程相结合,又可以分为单纯分词方法和分词与标注相结合的一体化方法。
系统平台:php环境
开发语言:php
使用方式:http服务
演示网址:http://www.itgrass.com/phpanalysis/开源官网:http://www.itgrass.com/phpanalysis/
注:实现简单,容易使用,能做一些简单应用,但大数据量的计算效率不如前几种。试用了几个系统,基本分词功能都没什么问题,只是在个别一些词的划分上存在一些差异;对于词性的确定,系统间有所不同。
其它类似信息

推荐信息