Ubuntu如何实现词频统计

Ubuntu如何实现词频统计

Ubuntu实现词频统计的示例:

使用shell实现简单的词频统计,例如:统计如下中第二列单词出现的次数。

1,huabingood,100

2,haha,200

3,huabingood,300

4,haha,100

5,haha,200

实现代码命令:

cat a.txt | awk -F "," '{print $2}' | sort | uniq -c | sort -nrk 1

代码解释:

awk -F "," '{print $2}' # 将数据按照逗号进行分割,并取出第二列的内容

sort  # 将取出的内容进行排序。因为uniq统计时,如果重复的数据不连续,就会被认为时两个不同内容的行

uniq -c  # 统计重复行出现的次数

sort -nrk 1  # 按照第一列重复的次数,按照数字顺序进行降序排列

版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 [email protected] 举报,一经查实,本站将立刻删除。

相关推荐