본문 바로가기

전체 글

(16)
AI 영상 생성 프로젝트 안녕하세요. 아주아주 오랜만에 글을 씁니다.저는 지금 하루 만에(사실 아님 n시간 만에) AI 영상을 생성해야 합니다.4주 동안 AI 이미지, 영상, 음성 생성을 위한 교육을 들었고, 내일(수, 사실 아닙니다. 12시 지나서 오늘입니다.) 생성한 영상의 시연회가 진행될 예정입니다.문제는 오늘(화, 네. 어제입니다.) 저녁에 마지막 수업이 진행되어서 내일 저녁에 진행될 시연회를 위해 당장 영상을 생성해야 된다는 겁니다!새벽이고, 급한 마음에 평소에 쓰던 정갈하고 다듬어진 문체가 아닐 수 있는 점 양해 부탁드리며 시작해보겠습니다.이 글은 거의 실시간으로 쓰이고 있습니다.'빨리 영상이나 만들지 뭐하냐' 하는 생각이 드실 것 같은데요, 생성하는 데 시간이 조금 걸려서 중간에 시간이 비어서 중간에 조금조금씩 쓰고..
HOG | HONV 정리 Detecting Hand Posture in Piano Playing Using Depth Data피아노를 연주하는 자세 중 올바른 자세와 올바르지 않은 자세를 분류하는 프로젝트를 제안한 논문인데, 손 자세 추정을 위해 HOG(Histograms of Oriented Gradients)와 HONV(histograms of normal vectors)라 불리는 특징 추출기를 이용하여 비교하였다. 논문과 진행하고자 하는 프로젝트와 연관성이 그리 높지는 않지만, HOG와 HONV에 대해 정리하고 넘어가면 좋을 것 같아 방법론 위주로 간단하게 정리해보려고 한다. Histograms of Oriented Gradients (HOG)HOG는 저번 보행자 검출을 위해 공부를 하다가 처음으로 마주쳤는데, 이번 han..
영상 처리 기초 정리 영상의 표현영상좌표계- 원점이 왼쪽에 위치- 좌표 표현 : x = (y,x) or x = (j, i) -> (j or y) : 수직 방향 / (i or x) : 수평 방향(행렬에서 원소의 좌표를 표현하는 방식과 동일) - j축 방향 화소 개수 = M -> j범위 : [0, M-1]- i축 방향 화소 개수 = N -> i범위 : [0, N-1] - 화소(pixel) : (j, i)로 지정되는 한 점- 해상도(resolution) : 영상의 크기를 나타내는 M x N- 영상 f가 가질 수 있는 명암값의 범위  [0, L-1]  -> 보통 화소 하나에 1바이트 > L=256  -> L = 2 : 0(흑) / 1(백) 두 가지 값만 가능한 이진 영상(binary image)- 컬러 영상 : 한 화소가 R, G,..
BlazePalm 모델 정리 MediaPipe 모델은 hand pose estimation에서 우수한 실시간 성능으로 많이 쓰이는 모델 중 하나이다. 논문을 간단히 정리하자면, 하나의 RGB 카메라로 손바닥을 통한 손 bounding box 생성 → 손의 골격 예측간단한 구조로 모바일 GPU에서도 실시간 추론 속도🙆‍♀️ 아키텍쳐는손 bounding box를 통해 손바닥을 찾는 손바닥 검출기장점 : 데이터 증강의 필요성 줄고 랜드마크의 좌표를 찾는 곳에 집중 & 모든 프레임에서 bounding box 찾을 필요 없음(이전 프레임의 랜드마크 예측을 이용하기 때문)1.의 결과를 통해 2.5D 랜드마크를 반환하는 손 랜드마크 모델로 구성되어 있다.이때 손바닥 검출기로 이용되는 모델이 바로 BlazePalm 모델이다. BlazePalm ..
[논문 리뷰] Neural Feedback Text Clustering with BiLSTM-CNN-Kmeans_2 저번 포스트에서 논문의 내용에 대해 간단하게 정리했다면 이번 포스트에서는 수식을 포함해서 자세한 개념들을 정리해보고자 한다! 먼저 저번 포스트에서 생략했던 LCK-NFC 알고리즘의 CNN 부분에 대해서 살펴보자.CNN Layer CNN layer는 Pre-trained word embedding, Convolutional layer, Max-pooling layer, Fully-connected layer with dropout으로 구성 되어 있다.     1) Word EmbeddingPre-trained word embedding에서는 Word2Vec를 이용한다. 텍스트 즉 문장이 단어 벡터의 연결 혹은 합성으로 표현되기 때문에 k차원의 벡터로 표현된 단어 벡터를 연결 하여 텍스트를 표현한다. 2) ..
[논문 리뷰] Neural Feedback Text Clustering with BiLSTM-CNN-Kmeans 논문 속 수식이나 Related Works를 제외하고 핵심만 정리해봤다!기회가 된다면 다음 포스트에서 정리하는 걸로...ㅎ간단하게 논문을 정리하자면?::Neural Feedback Text Clustering with BiLSTM-CNN-Kmeans::BiLSTM과 CNN을 이용해서 특징을 추출하여 장, 단기 문맥 정보를 학습! ::Neural Feedback Text Clustering with BiLSTM-CNN-Kmeans::K-means 알고리즘을 통한 클러스터링 결과를 피드백 정보로 활용하여 파라미터를 동적으로 최적화! ::Neural Feedback Text Clustering with BiLSTM-CNN-Kmeans::특징 추출과 클러스터링을 개별적인 과정이 아닌 하나의 통합된 과정으로 처리..
Video Classification 오늘은 전에 들었던 https://www.youtube.com/watch?v=ryHvvWLVH9w강의 내용 중 일부를 정리해봤다!Video Classification이란?주어진 비디오 클립을 일련의 라벨로 분류- 라벨은 '행동'에 중점을 둠!이미지 분류 라벨 > 대부분 시각적으로 식별 가능한 객체(object)비디오 분류 라벨 > 객체(objects) + 행동(actions)비디오 태스크의 문제점1. High Storage & Computationcal Cost가공되지 않은 비디오를 저장하려면 엄청난 저장 비용이 필요 - Video preprocessing압축 해제(Decompression)프레임 수 만큼의 추론 비용(pre-trained model을 사용한다고 해도)더욱 복잡한 모델링을 요구 2. Di..
[추천시스템] 행렬 분해 정리 추천알고리즘은 크게 사용자가 선호하는 정보를 기반으로 비슷한 아이템을 계산하여 추천하는 콘텐츠 기반 필터링과, 다른 사용자의 과거 행동 등을 통해 얻어진 기호 경향을 활용하여 추천하는 협업 필터링으로 나뉜다. 그 중 협업 필터링은 메모리 기반 방법과 모델 기반 방법으로 다시 한 번 나눌 수 있는데, 모델 기반 방법 중 다양한 행렬 분해 기법이 있다. 정리하자면,추천 알고리즘 - 콘텐츠 기반 필터링                      - 협업 필터링 - 메모리 기반 방법                                           - 모델 기반 방법 -> 행렬 분해로 설명할 수 있겠다. 오늘은 이러한 행렬 분해에 대하여 정리해보고자 한다. 추천 시스템에서의 행렬 분해란?평갓값 행렬을 저차원..