연속적인 소리 주파수 데이터를, 짧은 시간간격으로 윈도윙(커팅)한 후, 이산적인 데이터로 바꿔준다(샘플링 한다). 이때 사용하는 방법이 STFT(Short-Time Fourier Transform, 단시간 푸리에 변환)이다. 이렇게 얻어낸 디지털 오디오 데이터는, 아주 방대한 데이터를 품고 있다. 따라서 우리는 유용한 데이터만 추출할 필요가 있다. 이 단계를 Feature Extraction이라고 하며, 이때 사용할 방법으로 Chromagram과 MFCC(Mel Frequency Cepstral Coefficients)등이 있다. MFCC는 인간의 비선형적 소리인식의 한계를 모방하여 Mel-spectrogram으로 데이터를 변환한 후, DCT(Discrete Cosine Transform)를 통해 데이터를 cos함수의 합으로 분해한다. 일종의 역 푸리에 변환인 셈이다.