soynlp. 한국어 자연어처리를 위한 파이썬 라이브러리입니다. 단어 추출/ 토크나이저 / 품사판별/ 전처리의 기능을 제공합니다.
986KR-WordRank. 비지도학습 방법으로 한국어 텍스트에서 단어/키워드를 자동으로 추출하는 라이브러리입니다
354textmining-tutorial. (한국어) 텍스트 마이닝을 위한 공부거리들
201soyspacing. 띄어쓰기 오류 교정 라이브러리입니다. CRF 와 같은 머신러닝 알고리즘이 아닌, 직관적인 접근법으로 띄어쓰기를 교정합니다.
149customized_konlpy. Customized KoNLPy - Korean Natural Language Processing Toolkit KoNLPy wrapping code
126textrank. Implementation TextRank and related utils
85KoBERTScore. BERTScore for Korean
81fastcampus_textml_blogs. 패스트캠퍼스, 자연어처리를 위한 머신러닝, 수업관련 포스트 입니다.
70huggingface_konlpy. Training Transformers of Huggingface with KoNLPy
68WordPieceModel. Word Piece Model python light version with functions tokenize/save/load
64namuwikitext. Wikitext format dataset of Namuwiki (Most famous Korean wikipedia)
53soy. Python
50naver_news_search_scraper. 검색어 기준으로 네이버뉴스와 댓글을 수집하는 파이썬 코드
47korean_lemmatizer. 한국어 용언 분석기 (원형 복원, 용언 형태소 분석)
43python_ml4nlp. 패스트캠퍼스 자연어처리를 위한 머신러닝 실습 자료실
41clustering4docs. Clustering algorithm library. Implemented spherical kmeans
40soykeyword. Python library for keyword extraction
39textmining_dataset. 텍스트마이닝 실습을 위한 데이터셋 핸들러
38sejong_corpus_cleaner. 세종 말뭉치 데이터를 정제하기 위한 utils
37naver_movie_scraper. 네이버 영화 정보 및 사용자 작성 영화평/평점 데이터 수집기
30kmrd. Synthetic dataset for recommender system created from Naver Movie rating system
26python_ml_intro. 패스트캠퍼스, 파이썬을 이용한 머신러닝 입문 실습 코드
21levenshtein_finder. Similar string search in Levenshtein distance
21python_ml4tm. 패스트캠퍼스 텍스트마이닝을 위한 머신러닝 실습 자료실
19kowikitext. Python
19petitions_dataset. 청와대 국민청원 게시판으로부터 수집된 데이터
17petitions_archive. 청와대 국민청원 데이터 아카이브
16synthetic_dataset. Synthetic data generator for machine learning
16petitions_scraper. 청와대 국민청원 게시판의 데이터를 수집하는 스크래퍼
15sejong_corpus. 세종말뭉치 가공데이터 Repository
14pycrfsuite_spacing. python-crfsuite를 이용한 한국어 띄어쓰기 교정기
14crf_postagger. Korean Part-of-Speech Tagger using Conditional Random Field (CRF)
12kmeans_to_pyLDAvis. Visualizing k-means using pyLDAvis
11komoran3py. Komoran 3 in Python
11hmm_postagger. Korean Morphological Analyzer using Hidden Markov Model (HMM)
10flask_api_tutorial. Flask 로 API 를 만들기 위한 튜토리얼
10kmeans_ensemble. Python k-means ensemble package & tutorials
9text_embedding. Inferring vector of unseen words
7text-dedup. Python package for memory-friendly text de-duplication
6joint_visualization_of_words_and_docs. (Demo) Joint visualization for representation of words and docs trained from Doc2Vec
6archive_carblog_analysis. Carblog dataset (github.com/lovit/carblog_dataset) 의 분석 코드입니다
6ppomppu_scraper. 뽐뿌게시판 본문, 제목, 스크래퍼
6ekmeans. Epsilon constrained k-means for document clustering with noise removal
5topic_embedding. Embedding words to topic space
5pagerank. PageRank
5open-review2. 구관이 명관인 데이터마이닝 알고리즘들
5lovit.github.io. HTML
4rnnspace. Space Correction using Character-level Recurrent Neural Network (RNN, LSTM, GRU, etc)
4washingtonpost_scraper. Washington Post Search Scraper
3soygraph. Graph similarity & ranking algorithms
3s3-log-parser. AWS S3 access log parser
2korean_autumn_hmm. "한국의 봄 가을은 짧아지고 있는가? 김동현, 신하용, 대한산업공학회지 2013" 논문의 재현
2ie_openseminar_1_from_text_to_doc2vec_tsne. Openseminar #1 From scraping to Word2vec, Doc2Vec visualization with t-SNE
2wsj_scraper. Scrapping thumbnails of search result in WSJ
1tokenizers. 💥 Fast State-of-the-Art Tokenizers optimized for Research and Production
1reddit_scraper. Reddit scraper. Get latest posts from Reddit
1latex_sample. Latex 으로 문서 작업을 하고, git 으로 버전관리를 하는 것을 설명하기 위한 sample repository 입니다.
1