1、创建文件data.txt,向文件写入1000行数据,每行存放一个1~100之间的整数
import random
with open("data.txt","w+") as fw:
for i in range(1000):
fw.write(str(random.randint(1,100)))
fw.write('\n')
2、统计白居易的《长恨歌》中“长”“君王”出现的次数。
#引用jieba之前必须在终端安装jieba,安装代码为pip install jieba
#将中文的文件进行词频统计,输出数量前十的单词及其个数
#1.打开读取内容
import jieba
with open("C:\\Users\\Administrator\\Desktop\\长恨歌.txt","r") as fr:
txt=fr.read()
#2.数据预处理
for chr in '!"#$&()*+,-./:;:,。\n <=>?@[\\]^_`{|}~' :
txt=txt.replace(chr,"")
words=jieba.lcut(txt,cut_all=True)
counts={}
for word in words:
counts[word]=counts.get(word,0)+1#
items=list(counts.items())#
items.sort(key=lambda x:x[1],reverse=True)
for word,count in items:
if word in ['长','君王']:
print(f"{word}:{count}")
8711

被折叠的 条评论
为什么被折叠?



