llmfeed

Inkling-Small, 공개 가중치로 배포되는 멀티모달 모델 공개

씽킹머신스
  • Inkling-Small은 텍스트, 이미지, 오디오를 입력받아 텍스트를 출력하는 멀티모달 모델로 공개 가중치와 함께 배포된다.
  • 42계층 트랜스포머에 희소 전문가 혼합(MoE) 구조를 적용했다.
모델Inkling-Small
저장소thinkingmachines/Inkling-Small
개방성오픈형
라이선스 Apache-2.0
  • Inkling-Small은 텍스트, 이미지, 오디오 입력을 받아 텍스트 출력을 생성하는 범용 멀티모달 모델이다.
  • 이 모델은 연구, 파인튜닝, 그리고 다운스트림 개발자의 제3자 제품 통합을 지원하기 위해 공개 가중치와 함께 배포된다.
  • 42계층 디코더 전용 트랜스포머로, 희소 전문가 혼합(MoE) 순전파 백본을 갖는다.
  • 각 토큰은 256개의 전문가 중 6개로 라우팅되며, 모든 토큰에서 활성화되는 공유 전문가 2개가 추가된다.
  • 이 모델은 네이티브 멀티모달로서, 이미지는 계층적 패치 인코더를 통해 인코딩되고 오디오는 이산 토큰 인코딩을 통해 인코딩된다.
  • 모든 모달리티는 공유 은닉 공간으로 투영되어 디코더에서 함께 처리된다.
  • 학습 데이터에는 텍스트, 이미지, 오디오, 비디오를 포함한 다양한 유형의 콘텐츠가 포함된다.
  • 이 모델의 학습 데이터는 공개적으로 이용 가능한 소스에서 가져오거나, 제3자로부터 취득하거나, 합성적으로 생성되거나 증강되었다.

원문