시각-언어 기억 모듈과 차등 가소성 학습을 활용한 지속 적응형 거대 시각-언어 모델 연구
관련링크
본문
거대 시각-언어 모델(Large Vision-Language Models, LVLM)은 이미지와 텍스트를 함께 이해하고 추론할 수 있는 멀티모달 인공지능 모델로, 최근 Agentic AI를 구현하기 위한 핵심 기술로 주목받고 있다. LVLM은 사용자의 지시를 이해하는 동시에 주변 장면을 분석하고 판단할 수 있어, 반도체 공정 검사, 산업 설비 점검, 의료 영상 판독, 로봇 제어 등 다양한 실제 환경에서 지능형 AI 에이전트로 활용될 수 있다. 그러나 현재 대부분의 LVLM은 사전 학습이 완료된 이후 모델의 파라미터를 변경하지 않는 정적 모델(Static Model)의 형태로 활용된다. 이러한 모델은 기존에 학습한 지식을 안정적으로 활용할 수 있다는 장점이 있지만, 배포된 환경에서 새롭게 등장하는 도메인 지식을 지속적으로 학습하거나 과거에 인지한 정보를 장기적으로 기억하기 어렵다는 한계를 가진다. 특히 장기간 변화하는 환경에서는 과거 작업 이력과 현재의 정보를 함께 고려해야 하므로, 단순히 입력 정보를 일시적으로 제공하는 방식에서 벗어나 모델 스스로 경험을 기억하고 새로운 지식을 지속적으로 축적하는 기술이 필요하다. 본 연구실은 이러한 한계를 극복하기 위해 배포 환경에 능동적으로 적응하면서 지식을 지속적으로 축적하고 고도화하는 지속 적응형 LVLM(Continuously Adaptable LVLM)을 연구한다. 모델이 경험한 시각·언어 정보를 신경망 내부에 실시간으로 압축하고 저장하는 기억 모듈을 개발하여 과거 경험을 현재의 추론에 효과적으로 활용하고, 동시에 모델 파라미터의 학습 정도를 차등화하는 차등 가소성(Differential Plasticity) 학습 기법을 통해 기존 지식을 보존하면서도 새로운 도메인의 지식을 빠르게 습득할 수 있는 연속 학습 기술을 개발한다.

그림 1. 시각-언어 기억 모듈 기반 모델의 전체 구조
● 신경망 기반 시각-언어 기억 모듈 연구
사람은 새로운 환경에서 경험한 정보를 기억하고, 이후 유사한 상황이 발생했을 때 과거 경험을 활용하여 보다 정확한 판단을 내린다. 반면 기존의 정적 LVLM은 추론 과정에서 새롭게 인지한 정보를 자신의 지식으로 축적하기 어렵기 때문에 장기간의 작업 이력을 필요로 하는 문제에서 한계를 보인다. 과거의 모든 정보를 다시 입력하는 In-Context Learning 방식도 사용할 수 있지만, 입력 길이가 증가할수록 추론 비용이 높아지고 중요한 정보를 효과적으로 선별하기 어렵다는 문제가 있다. 본 연구는 이러한 문제를 해결하기 위해 입력 영상과 사용자 지시를 모델 내부에 실시간으로 압축·저장할 수 있는 신경망 기반 시각-언어 기억 모듈을 연구한다. 기억 모듈은 시각 정보를 저장하는 시각 기억 모듈과 언어적 맥락을 저장하는 언어 기억 모듈로 구성된다. 시각 기억 모듈은 입력 영상을 메모리 텐서 형태로 인코딩한 뒤 Cross-Attention을 통해 기존 시각 토큰과 결합하고, 언어 기억 모듈은 사용자 지시에서 중요한 맥락 정보를 추출·압축하여 기존 언어 토큰과 연결한다. 또한 최근의 정보는 상대적으로 상세하게 유지하는 반면 오래된 정보는 점진적으로 압축하는 단기-장기 기억 병합 구조를 적용하여, 기억 용량의 증가를 억제하면서도 장기간 필요한 정보를 효과적으로 유지하는 방법을 연구한다. 이를 통해 모델이 과거 정보를 반복적으로 입력받지 않더라도 이전 작업의 경험을 현재의 추론에 활용할 수 있도록 하며, 반도체 공정 검사나 의료 영상 판독처럼 시간에 따른 변화와 장기적인 맥락의 이해가 중요한 응용 환경에서 보다 안정적인 추론을 수행할 수 있는 LVLM을 구현하고자 한다.

그림 2. 시각-언어 기억 모듈의 구성
● 차등 가소성 학습 기반 지속 적응형 LVLM 연구
인공지능 모델이 새로운 환경에 지속적으로 적응하기 위해서는 새로운 정보를 학습하는 동시에 기존에 학습한 지식을 안정적으로 유지할 수 있어야 한다. 그러나 기존 모델을 새로운 데이터로 반복적으로 학습할 경우 이전에 습득했던 지식이 손실되는 파멸적 망각(Catastrophic Forgetting)이 발생할 수 있다. 반대로 기존 지식을 지나치게 보존하면 새로운 도메인에 필요한 특화 지식을 충분히 습득하지 못하는 문제가 발생한다. 본 연구는 이러한 안정성과 적응성 사이의 균형을 해결하기 위해 모델의 파라미터가 새로운 지식을 수용하고 변화하는 정도를 서로 다르게 설정하는 차등 가소성(Differential Plasticity) 학습 기법을 연구한다. 이 기법의 핵심은 모델 내부의 파라미터를 동일하게 학습하는 대신, 기존의 범용 지식을 담당하는 부분과 새로운 환경의 특화 지식을 담당하는 부분에 서로 다른 학습 특성을 부여하는 데 있다. LVLM의 디코더를 구성하는 FFN(Feed-Forward Network) 레이어를 저가소성·중가소성·고가소성 레이어로 구성하고, 각각의 레이어에 독립적인 학습률, 모멘텀, 가중치 감쇠 등을 적용한다. 저가소성 레이어는 낮은 빈도로 업데이트하여 사전 학습된 범용 지식을 안정적으로 유지하고, 고가소성 레이어는 새로운 작업 데이터를 빈번하게 학습하여 배포 환경의 특성을 빠르게 반영하도록 한다. 또한 작업 청크(Chunk), 청크 집합, 에피소드(Episode)와 같이 서로 다른 시간 규모에 따라 학습 단위를 조절함으로써, 장기간 유지해야 하는 지식과 빠르게 변화하는 정보를 서로 다른 속도로 학습하도록 한다. 이러한 차등 가소성 학습을 통해 모델이 기존 능력을 유지하면서도 새로운 도메인에 연속적으로 적응할 수 있는 지속 적응형 LVLM을 개발하고자 한다.

그림 3. 차등 가소성 학습 과정
● 자기 평가 기반 기억-적응 통합 학습 연구
실제 환경에서 동작하는 AI 에이전트는 수많은 데이터를 지속적으로 경험하지만, 모든 경험이 동일한 학습 가치를 가지는 것은 아니다. 성공적인 작업 결과는 향후 유사한 상황에서 활용할 수 있는 중요한 경험이 될 수 있으며, 반대로 실패한 사례 역시 모델의 잘못된 판단을 교정하기 위한 유용한 학습 정보가 될 수 있다. 따라서 배포 환경에서 생성되는 다양한 경험 가운데 어떤 정보를 기억하고 학습해야 하는지를 모델 스스로 판단하는 기술이 필요하다. 본 연구는 모델이 작업 과정에서 획득하는 입력 영상과 사용자 지시, 모델의 출력, 환경의 응답 및 사용자 피드백 등의 상호작용 데이터를 수집하고, LVLM 자체의 판단을 이용하여 각 데이터의 학습 가치를 평가하는 방법을 연구한다. 학습 가치가 높은 데이터는 향후 행동을 강화하기 위한 학습 대상으로 활용하고, 가치가 낮더라도 학습적으로 의미가 있는 실패 사례는 잘못된 행동을 억제하기 위한 학습 대상으로 선별한다. 최종적으로 선별된 강화·억제 학습 데이터를 학습 쌍으로 구성하고 대비적 강화학습 알고리즘을 적용하여, 앞서 개발한 시각-언어 기억 모듈과 차등 가소성 레이어를 함께 업데이트하는 통합 학습 체계를 구축한다. 이를 통해 모델이 경험을 단순히 저장하는 것을 넘어 중요한 경험을 스스로 판단하여 기억하고, 그 경험을 바탕으로 자신의 지식을 지속적으로 변화시키는 기억-적응 통합형 LVLM을 완성하는 것을 목표로 한다. 이러한 기술은 반도체·제조·인프라 점검·로봇 제어 등 장기간의 경험 축적과 지속적인 환경 적응이 필요한 다양한 산업 분야의 지능형 AI 에이전트에 활용될 수 있다.

그림 4. 지속 적응형 거대 시각-언어 모델의 적용 결과
