Python 텍스트 통계 기능 의 서유기 용 글자 통계 조작 예시

본 고의 실례 는 Python 텍스트 통계 기능 의 서유기 용자 통계 조작 을 서술 하 였 다.여러분 께 참고 하도록 공유 하 겠 습 니 다.구체 적 으로 는 다음 과 같 습 니 다.
데이터
xyj.txt,서유기 의 텍스트,2.2MB
오 승 은 스님,4020 행(단)에 게 경 의 를 표 합 니 다.
목표
통계 에서:
1.모두 몇 개의 다른 한자 가 나 타 났 습 니까?
2.한자 마다 몇 번 나 타 났 습 니까?
3.가장 자주 등장 하 는 한자 가 있다.
3.관련 내용:
1.파일 읽 기;
2.사전 사용;
3.사전 의 정렬;
4.파일 쓰기
효과

소스 코드


# coding:utf8
import sys
reload(sys)
sys.setdefaultencoding("utf8")
fr = open('xyj.txt', 'r')
characters = []
stat = {}
for line in fr:
  #           
  line = line.strip()
  #             
  if len(line) == 0:
    continue
  #      unicode，      
  line = unicode(line)
  #          
  for x in xrange(0, len(line)):
    #           
    if line[x] in [' ','', '\t', '
', '。', '，', '(', ')', '（', '）', '：', '□', '？', '！', '《', '》', '、', '；', '“', '”', '……']:
      continue
    #      characters 
    if not line[x] in characters:
      characters.append(line[x])
    #      stat 
    if not stat.has_key(line[x]):
      stat[line[x]] = 0
    #        1
    stat[line[x]] += 1
print len(characters)
print len(stat)
# lambda        
# d           ，d[0] key，d[1] value
# reverse True      
stat = sorted(stat.items(), key=lambda d:d[1], reverse=True)
fw = open('result.csv', 'w')
for item in stat:
  #          ，   int  str
  fw.write(item[0] + ',' + str(item[1]) + '
')
fr.close()
fw.close()

PS:여기 서 여러분 께 매우 편리 한 통계 도구 2 가 지 를 추천 합 니 다.참고 하 시기 바 랍 니 다.
온라인 글자 수 통계 도구:
http://tools.jb51.net/code/zishutongji
온라인 문자 통계 및 편집 도구:
http://tools.jb51.net/code/char_tongji
Python 관련 내용 에 관심 이 있 는 독자 들 은 본 사이트 의 주 제 를 볼 수 있 습 니 다.
본 논문 에서 말 한 것 이 여러분 의 Python 프로 그래 밍 에 도움 이 되 기 를 바 랍 니 다.

이 내용에 흥미가 있습니까?

현재 기사가 여러분의 문제를 해결하지 못하는 경우 AI 엔진은 머신러닝 분석(스마트 모델이 방금 만들어져 부정확한 경우가 있을 수 있음)을 통해 가장 유사한 기사를 추천합니다:

Python의 None과 NULL의 차이점 상세 정보

그래서 대상 = 속성 + 방법 (사실 방법도 하나의 속성, 데이터 속성과 구별되는 호출 가능한 속성 같은 속성과 방법을 가진 대상을 클래스, 즉 Classl로 분류할 수 있다.클래스는 하나의 청사진과 같아서 하나의 ...

텍스트를 자유롭게 공유하거나 복사할 수 있습니다.하지만 이 문서의 URL은 참조 URL로 남겨 두십시오.

CC BY-SA 2.5, CC BY-SA 3.0 및 CC BY-SA 4.0에 따라 라이센스가 부여됩니다.

좋은 웹페이지 즐겨찾기

개발자 우수 사이트 수집

개발자가 알아야 할 필수 사이트 100선 추천 우리는 당신을 위해 100개의 자주 사용하는 개발자 학습 사이트를 정리했습니다