안녕하세요. 임지훈 전문가입니다.
1.임베딩 및 공유 공간 정렬
텍스트, 이미지, 음성 데이터를 개별 인코더로 특징 벡터화한 뒤, 선형 투영을 통해 하나의 동일한 고차원 벡터 공간으로 정렬해요
2.교차 주의집중 및 융합
트랜스포머 기반 메커니즘을 사용해 서로 다른 모달리티 간의 정보 상관관계를 계산하고 실시간으로 참조 및 결합해요.
3.통합 표현 학습
대규모 다중 모달 데이터를 대조 학습 및 마스킹 예측방식으로 공동 학습시켜, 모달리티의 구분이 없는 단일 통합 표현 벡터를 완성합니다.