관성을 이기는 데이터

  • 홈
  • 태그
  • 방명록

tfidf 1

TF-IDF 행렬의 특이값 분해를 통한 LSA(Latent Semantic Analysis)의 구현과 빈도 기반 토픽 모델의 한계

Step 1. 토픽모델링이란 토픽모델링은 특정 문서의 확률적 카테고리를 나누는 비지도학습 방법론이며 기본적인 컨셉은 다음과 같다. 문서는 단어의 조합이다. 문서 내 함께 등장하는 단어는 서로 연관성이 있다. 모든 문서에서 자주 등장하는 단어는 특수한 의미를 내포하지 않는다. 반면, 그렇지 않은 단어는 특수한 의미를 내포한다. 즉, 모든 문서에서 자주 등장하지 않으면서 특정 단어들과 함께 등장하는 단어들은 서로 유사한 의미를 내포한다. 그러므로 단어의 조합인 문서는 의미가 있는 단어들의 비중에 따라 카테고리(Topic)가 결정된다. 우리는 이러한 컨셉의 프로세스에 따라 1.문서를 단어 조합으로 가공하고, 2~5.문서 내 각 단어들의 의미를 부여한 다음, 6.문서의 토픽을 결정해보도록 하자. Step 2. ..

3. 튜토리얼/자연어 처리 및 텍스트 분석 방법론 2023.02.17
1
더보기
프로필사진

7년차 개발 PO. 생산성 향상을 위한 데이터 프로덕트를 만들어요.

  • 분류 전체보기 (112)
    • 1. 기술 (66)
      • 인프라, 네트워크 (0)
      • 서버, 데이터, 클라우드 (20)
      • 웹, 자바스크립트 (15)
      • 머신러닝, 딥러닝 (24)
      • 통계, 시계열 (7)
    • 2. 도메인 (9)
      • 금융 (6)
      • 비즈니스 (2)
      • 자산운용 (1)
    • 3. 튜토리얼 (29)
      • 금융 분석 프로그래밍 기초 (6)
      • 금융 분석 프로그래밍 응용 (11)
      • 비즈니스 통계 분석 프로그래밍 (6)
      • 시계열 예측 및 계량 분석 방법론 (4)
      • 자연어 처리 및 텍스트 분석 방법론 (2)
    • 4. 실전 (8)
      • 글로벌 매크로 분석 (5)
      • 계량 투자 분석 (3)

Tag

주식데이터, 데이터분석, 프로그래밍, 파이썬, 퀀트투자, 통계, 사이킷런, Javascript, 금융데이터, 기계학습, 자바스크립트, StarGAN, 시계열분석, Django, Python, sklearn, 머신러닝, 판다스, 데이터사이언스, 딥러닝,

최근글

인기글

최근댓글

Archives

Calendar

«   2026/08   »
일 월 화 수 목 금 토
1
2 3 4 5 6 7 8
9 10 11 12 13 14 15
16 17 18 19 20 21 22
23 24 25 26 27 28 29
30 31

방문자수Total

  • Today :
  • Yesterday :

Copyright © Daum Corp. All rights reserved.

티스토리툴바