ubuntu下使用pycharm调用Hanlp自然语言处理包

简介:

首先点击File,选择Settings,在Project 下点击Project Interpreter,并通过点击右边的加号:

搜索JPype,根据python版本选择你需要的JPype版本安装。

之后,在https://github.com/hankcs/HanLP/releases

网站下载hanlp.jar包、模型data包、配置文件hanlp.properties,新建一个文件夹Hanlp,

把hanlp.jar和hanlp.properties放进去:

 

之后需要再新建一个文件夹hanlp,并将data放进去:

 

修改Hanlp下的路径为当前data的路径,由于我将data放在/home/javawork/hanlp下,因此:root=/home/javawork/hanlp/

接下来新建一个文件demo_hanlp.py,代码如下:

! /usr/bin/env python2.7

coding=utf-8

from jpype import *

startJVM(getDefaultJVMPath(), "-Djava.class.path=home/javawork/Hanlp/hanlp-1.2.7.jar;home/javawork/Hanlp/", "-Xms1g", "-Xmx1g")

startJVM(getDefaultJVMPath(), "-Djava.class.path=/home/qinghua/javawork/Hanlp/hanlp-1.2.7.jar:/home/qinghua/javawork/Hanlp")
HanLP = JClass('com.hankcs.hanlp.HanLP')

中文分词

print(HanLP.segment('你好,欢迎在Python中调用HanLP的API'))
testCases = [

"商品和服务",
"结婚的和尚未结婚的确实在干扰分词啊",
"买水果然后来世博园最后去世博会"]

for sentence in testCases: print(HanLP.segment(sentence))

命名实体识别与词性标注

NLPTokenizer = JClass('com.hankcs.hanlp.tokenizer.NLPTokenizer')
print(NLPTokenizer.segment('中国科学院计算技术研究所的宗成庆教授正在教授自然语言处理课程'))

关键词提取

document = "水利部水资源司司长陈明忠9月29日在国务院新闻办举行的新闻发布会上透露," \

       "根据刚刚完成了水资源管理制度的考核,有部分省接近了红线的指标," \
       "有部分省超过红线的指标。对一些超过红线的地方,陈明忠表示,对一些取用水项目进行区域的限批," \
       "严格地进行水资源论证和取水许可的批准。"

print(HanLP.extractKeyword(document, 2))

自动摘要

print(HanLP.extractSummary(document, 3))

依存句法分析

print(HanLP.parseDependency("徐先生还具体帮助他确定了把画雄鹰、松鼠和麻雀作为主攻目标。"))
shutdownJVM()

需要注意的是ubuntu的路径分割符为”:”,而window 为” ; ”

另附hanlp调用常见问题集:

https://github.com/hankcs/HanLP/issues?page=3&q=is%3Aissue+is%3Aopen

文章来源于erfect00的博客

相关文章
|
5月前
|
Python
pycharm安装汉化包失败解决方法
pycharm安装汉化包失败解决方法
744 0
|
Oracle Ubuntu 关系型数据库
Ubuntu安装MySQL(RPM包安装)
Ubuntu安装MySQL(RPM包安装)
617 0
|
8月前
|
Ubuntu Perl
Ubuntu已删除包的残余文件删除命令
Ubuntu已删除包的残余文件删除命令
90 0
|
自然语言处理
自然语言处理hanlp------3java调用hanlp
提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档
自然语言处理hanlp------3java调用hanlp
|
Python
Pycharm开发环境下创建python运行的虚拟环境(自动执行安装依赖包)
Pycharm开发环境下创建python运行的虚拟环境(自动执行安装依赖包)
684 0
Pycharm开发环境下创建python运行的虚拟环境(自动执行安装依赖包)
|
自然语言处理 算法 Java
NLP快速入门:手把手教你用HanLP做中文分词
NLP快速入门:手把手教你用HanLP做中文分词
903 0
NLP快速入门:手把手教你用HanLP做中文分词
|
Python
Pycharm使用教程(四)-安装python依赖包(非常详细,非常实用)
Pycharm使用教程(四)-安装python依赖包(非常详细,非常实用)
2438 0
Pycharm使用教程(四)-安装python依赖包(非常详细,非常实用)
|
Ubuntu Linux Python
Ubuntu 安装 Pycharm
Ubuntu 安装 Pycharm
210 0
Ubuntu 安装 Pycharm
|
IDE 测试技术 开发工具
PyCharm设置中文(无需下载中文汉化包)
PyCharm设置中文(无需下载中文汉化包)
171 0
PyCharm设置中文(无需下载中文汉化包)
|
Ubuntu IDE Linux
Ubuntu安装Pycharm
Ubuntu安装Pycharm
181 0
Ubuntu安装Pycharm