运行界面如图所示:
牵扯的技术有:分词,统计词频,踢出网页中一些特殊字符(用正则表达式),还有需要提取培训集等等!!
结果分析的思想:就是把得到的词频与建立的词库里每一类进行比较,如果存在一个最大匹配程度,就去这个类作为结果,如果存在多个最大值,那么就去词库里特征词最少的一个!!
源程序下载地址:
本帖隐藏的内容
中文网页自动分类
说明:开发集成软件NetBeans6.5
原帖地址:http://www.phpjava.org/forum.php?mod=redirect&tid=13&goto=lastpost#lastpost
本文来自: PHP&Java论坛|技术交流社区[www.phpjava.org]

牵扯的技术有:分词,统计词频,踢出网页中一些特殊字符(用正则表达式),还有需要提取培训集等等!!
结果分析的思想:就是把得到的词频与建立的词库里每一类进行比较,如果存在一个最大匹配程度,就去这个类作为结果,如果存在多个最大值,那么就去词库里特征词最少的一个!!
源程序下载地址:
本帖隐藏的内容
中文网页自动分类
说明:开发集成软件NetBeans6.5
原帖地址:http://www.phpjava.org/forum.php?mod=redirect&tid=13&goto=lastpost#lastpost
本文来自: PHP&Java论坛|技术交流社区[www.phpjava.org]