[행사/세미나] 인공지능세미나 초청 강연 안내(9/2 (수) 15:00 ~ 16:15)
- 소프트웨어융합대학
- 조회수978
- 2026-09-01
2026학년도 2학기 인공지능세미나 강연을 아래와 같이 개최하오니, 관심 있는 학생들의 많은 참여 바랍니다.
(본 세미나는 수업 외에도 지능형소프트웨어학과 학부생/대학원생 모두 참석 가능합니다.)
1. 세미나 개요
일시: 2026년 9월 2일(수) 15:00 ~ 16:15
장소: 85602 강의실
강연자: 고려대학교 김우찬 교수님
참석 대상: 지능형소프트웨어학과 학부생/대학원생 (관심 있는 구성원 누구나)
2. 강연 정보
강연 제목:
(국문) 음성 처리 기술의 멀티 모달 LLM으로의 진화
(영문) The Evolution of Speech Processing Technology toward Multimodal LLMs
Abstract :
음성 인식은 GMM-HMM 및 DNN-HMM 하이브리드로 대표되는, 음향 모델·발음 사전·언어 모델이 분리된 통계적 프레임워크에서 출발하였다. 이후 CTC 기반 encoder-only 구조, RNN-Transducer, attention 기반 encoder-decoder로 이어지는 종단간(end-to-end) 패러다임으로 전환되었고, wav2vec 2.0·HuBERT·WavLM의 자기지도 표현 학습과 Whisper 계열의 대규모 약지도 학습을 거치며 범용 음성 표현을 확보하였다.
음성 합성 또한 unit-selection 기반 concatenative 방식에서 HMM 기반 통계적 파라미터 합성(SPSS)으로, 다시 Tacotron·FastSpeech 계열의 sequence-to-sequence 음향 모델과 WaveNet·HiFi-GAN 계열 뉴럴 보코더를 결합한 2단 구조로 발전하였다. 두 분야는 서로 역방향의 문제임에도 각기 다른 목적 함수와 독립적인 파이프라인으로 최적화되어 왔다.
Large Language Model의 등장은 이러한 분리 구도를 근본적으로 바꾸고 있다. 텍스트 전용으로 설계된 LLM에 (i) 음성 인코더의 연속 표현을 projector 또는 Q-Former 형태의 모달리티 어댑터로 연결하거나, (ii) neural audio codec으로 얻은 이산 음성 토큰을 LLM 어휘에 편입하는 두 갈래 접근이 등장하였다. 여기에 모달리티 정렬 학습과 효율적 미세조정을 결합함으로써, 인식·이해·합성을 단일 next-token prediction 목적 함수 안에서 다루는 audio LLM 및 omni-modal LLM이 형성되었다.
본 발표에서는 전통적 음성 인식·합성 구조와 LLM의 기초를 정리한 뒤, SpeechGPT, Qwen2.5-Omni/Qwen3-Omni, Qwen3-ASR, Qwen3-TTS, CosyVoice, OmniVoice를 중심으로 최근 LLM 기반 음성 모델을 개관한다. 특히 이산 토큰 설계(semantic vs. acoustic), 자기회귀 LM과 masked diffusion LM·flow matching 등 비자기회귀 생성기의 대비, 그리고 실시간 스트리밍 및 full-duplex 상호작용 요구가 구조 선택에 미치는 영향을 함께 논의한다.
발전기금





