관성을 이기는 데이터

  • 홈
  • 태그
  • 방명록

텍스트마이닝 1

단어의 의미를 고려한 문장 유사도 측정 방법 - 기저 벡터와 선형 변환

Step 1. 문장의 유사도를 구하는 방법 두 문서의 유사성은 어떻게 측정할 수 있을까? 문장의 길이? 아니면 주어, 동사, 목적어 등의 문법 구조? 그것보다는 얼마나 공통 '단어'를 많이 포함하고 있는가? 가 더 합리적으로 보인다. 실제로 수많은 전통적인 텍스트마이닝 방법론들은 이러한 단어 기반 유사도 측정 방식을 따르며, 현재 딥러닝, AI 시대에도 역시 문장 구조와 속성을 분석할 때 단어는 핵심 요소다. 이렇게 단어를 기준으로 문장 유사도를 구하기 위해서는 단어를 숫자로 변환해 줄 필요가 있다. 즉, 유사도 혹은 거리를 수학적으로 계산하기 위해 문장을 일종의 좌표평면 상에 놓을 수 있어야 하고 문장이 좌표평면에 놓이기 위해서는 문장을 구성하고 있는 단어들을 스칼라 혹은 벡터값으로 변환해줘야 하는 것..

3. 튜토리얼/자연어 처리 및 텍스트 분석 방법론 2023.02.11
1
더보기
프로필사진

7년차 개발 PO. 생산성 향상을 위한 데이터 프로덕트를 만들어요.

  • 분류 전체보기 (112)
    • 1. 기술 (66)
      • 인프라, 네트워크 (0)
      • 서버, 데이터, 클라우드 (20)
      • 웹, 자바스크립트 (15)
      • 머신러닝, 딥러닝 (24)
      • 통계, 시계열 (7)
    • 2. 도메인 (9)
      • 금융 (6)
      • 비즈니스 (2)
      • 자산운용 (1)
    • 3. 튜토리얼 (29)
      • 금융 분석 프로그래밍 기초 (6)
      • 금융 분석 프로그래밍 응용 (11)
      • 비즈니스 통계 분석 프로그래밍 (6)
      • 시계열 예측 및 계량 분석 방법론 (4)
      • 자연어 처리 및 텍스트 분석 방법론 (2)
    • 4. 실전 (8)
      • 글로벌 매크로 분석 (5)
      • 계량 투자 분석 (3)

Tag

딥러닝, 주식데이터, Javascript, 퀀트투자, StarGAN, 데이터분석, 금융데이터, Python, sklearn, 프로그래밍, 기계학습, 통계, 시계열분석, 데이터사이언스, 판다스, 사이킷런, Django, 자바스크립트, 파이썬, 머신러닝,

최근글

인기글

최근댓글

Archives

Calendar

«   2026/08   »
일 월 화 수 목 금 토
1
2 3 4 5 6 7 8
9 10 11 12 13 14 15
16 17 18 19 20 21 22
23 24 25 26 27 28 29
30 31

방문자수Total

  • Today :
  • Yesterday :

Copyright © Daum Corp. All rights reserved.

티스토리툴바