海力源码logo图片
400电话图片
热门关键词:  响应式网站    设计网站    营销型网站   
源码资讯
当前位置:首页 > 源码资讯 > 行业动态Python进行网页文本处理

行业动态Python进行网页文本处理

资讯来源:海力源码    点击次数:400    更新时间:6/3/2022 9:15:48 AM
网页文本中的中英文处理的区别在于中文需要额外加入分词处理过程。所谓分词就是将一段文本文字分成一个个词组的过程。 具体处理流程为:加载jieba分词包进行中文分词;将分词后的词组去掉停用词及一个字符的词后, 输出训练文本中的常用分词和熟悉的词组;在训练文本的数据训练及情感词典的归档中将爬取获得的网页数据的客观性文本分词后放入变量中, 主观类情感文本放入另一变量中;为自动得到网页文本中重要的关键词组, 过滤掉对网页文本意义贡献不大的常用词组, 在chi2模块的特征选择下, 采用词频-逆文本频率 (TF-IDF) 概念将分词词组变量转换为tf-idf向量形式, 输出分词向量矩阵, 为下一阶段的网页文本情感分析做准备。
  • 海力源码手机版
  •  联系网站客服
  • 本站图片等部分资料来源于网上,部分未能与原作者取得联系,若涉及版权问题,请联系我们删除!
  • Copyright www.hailiym.com © 2026 All Rights Reserved 海力源码 版权所有 模板标签
  • 联系地址:广东省东莞市南城区莞太路  源码技术支持QQ:42805021
  •    计算机软件著作权登记号:2019SR1008471