This is your work, valued

Hyunjoong Kim

Elite
@lovit

글과 코드로 이야기를 하고 싶은 ML/NLP 를 하는 데이터분석가 입니다.

soynlp. 한국어 자연어처리를 위한 파이썬 라이브러리입니다. 단어 추출/ 토크나이저 / 품사판별/ 전처리의 기능을 제공합니다.

986

KR-WordRank. 비지도학습 방법으로 한국어 텍스트에서 단어/키워드를 자동으로 추출하는 라이브러리입니다

354

textmining-tutorial. (한국어) 텍스트 마이닝을 위한 공부거리들

201

soyspacing. 띄어쓰기 오류 교정 라이브러리입니다. CRF 와 같은 머신러닝 알고리즘이 아닌, 직관적인 접근법으로 띄어쓰기를 교정합니다.

149

customized_konlpy. Customized KoNLPy - Korean Natural Language Processing Toolkit KoNLPy wrapping code

126

textrank. Implementation TextRank and related utils

85

KoBERTScore. BERTScore for Korean

81

fastcampus_textml_blogs. 패스트캠퍼스, 자연어처리를 위한 머신러닝, 수업관련 포스트 입니다.

70

huggingface_konlpy. Training Transformers of Huggingface with KoNLPy

68

WordPieceModel. Word Piece Model python light version with functions tokenize/save/load

64

namuwikitext. Wikitext format dataset of Namuwiki (Most famous Korean wikipedia)

53

soy. Python

50

naver_news_search_scraper. 검색어 기준으로 네이버뉴스와 댓글을 수집하는 파이썬 코드

47

korean_lemmatizer. 한국어 용언 분석기 (원형 복원, 용언 형태소 분석)

43

python_ml4nlp. 패스트캠퍼스 자연어처리를 위한 머신러닝 실습 자료실

41

clustering4docs. Clustering algorithm library. Implemented spherical kmeans

40

soykeyword. Python library for keyword extraction

39

textmining_dataset. 텍스트마이닝 실습을 위한 데이터셋 핸들러

38

sejong_corpus_cleaner. 세종 말뭉치 데이터를 정제하기 위한 utils

37

naver_movie_scraper. 네이버 영화 정보 및 사용자 작성 영화평/평점 데이터 수집기

30

kmrd. Synthetic dataset for recommender system created from Naver Movie rating system

26

python_ml_intro. 패스트캠퍼스, 파이썬을 이용한 머신러닝 입문 실습 코드

21

levenshtein_finder. Similar string search in Levenshtein distance

21

python_ml4tm. 패스트캠퍼스 텍스트마이닝을 위한 머신러닝 실습 자료실

19

kowikitext. Python

19

petitions_dataset. 청와대 국민청원 게시판으로부터 수집된 데이터

17

petitions_archive. 청와대 국민청원 데이터 아카이브

16

synthetic_dataset. Synthetic data generator for machine learning

16

petitions_scraper. 청와대 국민청원 게시판의 데이터를 수집하는 스크래퍼

15

sejong_corpus. 세종말뭉치 가공데이터 Repository

14

pycrfsuite_spacing. python-crfsuite를 이용한 한국어 띄어쓰기 교정기

14

crf_postagger. Korean Part-of-Speech Tagger using Conditional Random Field (CRF)

12

kmeans_to_pyLDAvis. Visualizing k-means using pyLDAvis

11

komoran3py. Komoran 3 in Python

11

hmm_postagger. Korean Morphological Analyzer using Hidden Markov Model (HMM)

10

flask_api_tutorial. Flask 로 API 를 만들기 위한 튜토리얼

10

kmeans_ensemble. Python k-means ensemble package & tutorials

9

text_embedding. Inferring vector of unseen words

7

text-dedup. Python package for memory-friendly text de-duplication

6

joint_visualization_of_words_and_docs. (Demo) Joint visualization for representation of words and docs trained from Doc2Vec

6

archive_carblog_analysis. Carblog dataset (github.com/lovit/carblog_dataset) 의 분석 코드입니다

6

ppomppu_scraper. 뽐뿌게시판 본문, 제목, 스크래퍼

6

ekmeans. Epsilon constrained k-means for document clustering with noise removal

5

topic_embedding. Embedding words to topic space

5

pagerank. PageRank

5

open-review2. 구관이 명관인 데이터마이닝 알고리즘들

5

lovit.github.io. HTML

4

rnnspace. Space Correction using Character-level Recurrent Neural Network (RNN, LSTM, GRU, etc)

4

washingtonpost_scraper. Washington Post Search Scraper

3

soygraph. Graph similarity & ranking algorithms

3

s3-log-parser. AWS S3 access log parser

2

korean_autumn_hmm. "한국의 봄 가을은 짧아지고 있는가? 김동현, 신하용, 대한산업공학회지 2013" 논문의 재현

2

ie_openseminar_1_from_text_to_doc2vec_tsne. Openseminar #1 From scraping to Word2vec, Doc2Vec visualization with t-SNE

2

wsj_scraper. Scrapping thumbnails of search result in WSJ

1

tokenizers. 💥 Fast State-of-the-Art Tokenizers optimized for Research and Production

1

reddit_scraper. Reddit scraper. Get latest posts from Reddit

1

latex_sample. Latex 으로 문서 작업을 하고, git 으로 버전관리를 하는 것을 설명하기 위한 sample repository 입니다.

1