llmfeed

Convai Innovations, 판단 전용 System One 모델 Laya 체크포인트 셋 공개

Convai
  • Convai Innovations가 System One 모델 Laya를 공개했다.
  • 영어·다국어·타입 판단 미세조정 체크포인트 셋으로, 글 대신 정해진 타입의 답과 확률을 한 번의 계산으로 돌려준다.
  • 가중치는 Apache 2.0으로 풀렸다.
모델laya
저장소convaiinnovations/laya
모델laya-multilingual
저장소convaiinnovations/laya-multilingual
모델laya-typed-decisions
저장소convaiinnovations/laya-typed-decisions
개방성오픈형
라이선스 Apache-2.0

무엇이 나왔나

  • Convai Innovations가 System One 모델 Laya를 Hugging Face에 공개했다.
  • Laya는 글을 쓰지 않는 판단 모델이다.
  • 글·이메일·티켓·JSON 같은 상태(state)와 타입이 정해진 질문을 받으면, 타입에 맞는 답을 확률과 함께 돌려준다.
  • 회사는 한 번의 순전파(약 33ms)로 100개 넘는 언어에서 답한다고 밝혔다.
  • 글을 생성하지 않으므로 출력을 따로 해석할 필요가 없다고 회사는 설명했다.
  • 질문 타입은 여러 선택지 중 하나를 고르는 choice, 순서가 있는 단계로 점수를 매기는 score, 예/아니오 확률을 내는 noul 이다.
  • 답할 선택지는 요청할 때 정하므로 새 스키마를 쓰려고 다시 학습할 필요가 없다.

저장소 하나에 체크포인트 셋이 함께 들어 있고, 요청한 것만 내려받는다.

  • laya(저장소 루트): 영어 전용이다. 회사는 영어 글, 가드레일, 이메일 분류에 맞다고 밝혔다.
  • laya-multilingual: 100개 넘는 언어를 다루며 영어판보다 약 2.2배 빠르다고 회사는 밝혔다. max_len=8192를 주면 8,192토큰까지 읽는다.
  • laya-typed-decisions: 네 가지 타입 판단 업무 흐름에 맞춰 미세조정한 체크포인트다.
  • 회사가 권하는 쓰는 방식은 내장된 Router다.
  • 입력의 문자 체계와 언어를 0.5ms 안에 알아내 영어는 laya로, 나머지는 laya-multilingual로 보낸다.
  • 결과에는 어느 체크포인트를 왜 골랐는지가 함께 담긴다.
  • 이미 쓰는 언어 판별 모델이 있으면 lang_guess로 그 답을 넘길 수 있다.
  • 직접 띄우는 HTTP 서버 laya-serve도 함께 나왔다.
  • TypeSafe Jev와 같은 POST /v1/systemone 요청·응답 꼴을 쓰므로, 기존 TypeSafe 클라이언트는 기본 주소만 바꾸면 그대로 쓸 수 있다고 회사는 밝혔다.
  • LAYA_API_KEY를 설정하지 않으면 인증 없이 열린다.

규모와 구조

  • laya와 laya-typed-decisions는 ModernBERT-large(3억 9,500만 파라미터, 양방향, 전체 미세조정) 위에 처음부터 학습한 판단 머리를 얹었다. 판단 머리는 트랜스포머 층 2개, 선택지 표지 채점기, 실행/상위 보고(act/escalate) 머리로 이뤄진다. 합쳐서 4억 2,100만 파라미터다.
  • laya-multilingual은 mmBERT-base(22층, 어휘 25만 6,000개)를 쓰며 합쳐서 3억 2,200만 파라미터다.
  • 각 선택지는 자기 [MASK] 토큰 자리에서 점수를 받고, 그 질문의 선택지끼리 소프트맥스로 확률이 된다.
  • 기본 컨텍스트는 laya가 512토큰, laya-multilingual과 laya-typed-decisions가 1,024토큰이다. 이 가운데 선택지 설명에 쓰는 몫(head_max_len)이 영어판 192토큰, 나머지 둘은 256토큰이다.
  • 한 번의 호출에 담긴 질문은 모두 한 번의 순전파로 답한다.
  • 가중치는 Apache 2.0으로 공개돼 사내 설치로도 쓸 수 있다.

학습 방식

  • 회사는 이 학습법을 RLCD(Reinforcement Learning for Calibrated Decisions)라고 부른다.
  • 모델이 확률 분포를 내면, 탐색을 위해 로짓에 평균이 0인 가우스 잡음을 더하고, 엄밀하게 적정한 채점 규칙(로그 점수와 구면 점수, 순서형 질문에는 순위 확률 점수를 더함)으로 보상을 준다.
  • 기대 보상은 정직한 확률을 낼 때만 가장 커진다고 회사는 설명했다.
  • 갱신은 그룹 평균을 기준선으로 쓰는 REINFORCE(GRPO 방식)이고, 여러 차례 오가는 대화에는 앞부분 조각마다 TD(λ=1.0)를 쓴다.

회사가 밝힌 수치

  • Tesla T4 한 장에서 질문 1개에 laya 39.5ms, laya-multilingual 32.8ms가 걸렸다. 질문 10개를 묶으면 각각 158.6ms, 72.3ms, 50개면 771ms, 337ms다. 묶어서 처리하면 초당 103~332개 질문을 답한다고 회사는 밝혔다.
  • 회사는 TypeSafe Jev가 제3자 측정에서 중앙값 236~276ms였다며, Laya가 질문 하나를 6~8배 빠르게 답한다고 밝혔다.
  • 51개 언어 가운데 무작위의 3배를 넘어 쓸 만한 언어는 laya 23개, laya-multilingual과 Router 45개였다.
  • 영어 체크포인트는 라틴 문자가 아닌 글에서 무너진다. 크메르어에서 정확도 0.000에 확신도 0.952를 냈다. 틀리면서도 확신하므로 확신도로 걸러낼 수 없고, 그래서 Router로 언어를 먼저 가른다고 회사는 설명했다.
  • laya-multilingual은 긴 문서에서 약 4,000토큰까지는 20건 중 16~18건을 맞혔다. 그보다 길면 20건 중 8~17건으로 들쭉날쭉했다. 4,000토큰 입력은 Apple GPU에서 약 1.7초 걸렸다.
  • 타입 판단 벤치마크(2,000건 판단, 업무 흐름 넷)에서 laya-typed-decisions는 정확도 0.766이었다. 같은 문제에서 기본 영어 체크포인트는 0.362, laya-multilingual은 0.342였다. 업무별로는 청구서 처리 0.804, 보안 사고 0.766, 고객 응대 0.764, 에이전트 실행 기록 관찰 0.730이다. 질문 타입별로는 noul 0.857, choice 0.733, score 0.723이다.
  • 보정 오차(ECE)는 온도 보정 뒤 0.081로, Jev의 0.246보다 낮았다고 회사는 밝혔다.

한계로 밝힌 점

  • 기본 체크포인트는 타입 판단 문제를 미세조정 없이 풀면 거의 우연 수준이다(0.362, 다국어 0.352. 무작위 0.318, 최다 답 기준 0.461). 0.766은 그 벤치마크의 학습 데이터로 미세조정한 체크포인트의 점수다. 회사는 Laya를 미세조정 없이 쓰는 판단 엔진이 아니라, 빠르게 특화시킬 바탕 모델이라고 밝혔다. 자기 분야의 판단 데이터로 미세조정하라고 권했다.
  • 선택지가 20개를 넘으면 약하다. Banking77에서 Jev는 0.870, Laya는 0.425였다. 선택지들이 정해진 토큰 몫을 나눠 쓰기 때문에, 77개면 선택지 하나에 3~4토큰밖에 돌아가지 않는다. 회사는 50개 넘는 선택지를 한 번에 물을 때는 Jev가 아직 낫다고 밝혔다. Laya로 물으려면 head_max_len과 max_len을 키우거나, 큰 선택지를 거친 단계와 세부 단계로 나눠 두 번 물으라고 권했다.
  • 교사 모델의 확률 분포와 얼마나 맞는지 보는 부드러운 정확도는 Jev가 높다(0.580 대 0.471). 온도 보정 전 원래 보정 오차도 Jev가 낮다(0.144 대 0.213).
  • 순서형 score 질문이 가장 약하다(SST-5 0.372).
  • noul은 특히 영어 체크포인트에서 입력보다 선택지 이름을 따라가, 뚜렷이 긍정인 입력에 확신에 찬 '아니오'를 내기도 한다. 회사는 이럴 때 중립적인 이름을 붙인 두 선택지 choice로 바꿔 물으라고 권했다.
  • action.act_probability는 아직 쓸 만한 신호가 없다. 거의 모든 입력에서 1.0이 나온다. 회사는 대신 confidence로 거르라고 권했다(같은 항목에서 AUROC 0.77).
  • 출고 상태에서는 확률이 지나치게 확신에 차 있다. 질문 타입과 선택지 수마다 온도를 다시 맞추면 평균 ECE가 laya 0.466에서 0.081로, laya-multilingual 0.314에서 0.106으로 내려간다. 회사는 확률을 믿기 전에 자기 데이터로 먼저 이 보정을 하라고 권했다.
  • 루트의 laya는 영어 전용이다. 영어가 아닌 글에는 laya-multilingual을 쓰라고 회사는 권했다.

벤치마크

벤치마크 무엇을 재나 Laya (라우팅) (—) TypeSafe Jev 1.13.0 (—)
typed-decisions, 2,000 decisions 업무 흐름 넷의 타입 판단 정확도 0.766 0.727
AG News, 4 labels 뉴스 기사 주제 분류 0.950 0.910
DAIR Emotion, 6 labels 글에 담긴 감정 분류 0.595 0.480
Banking77 (72 vs 77 labels) 은행 고객 문의 의도 분류 0.425 0.870
MASSIVE intent, English 영어 발화 의도 분류 0.783 —
MASSIVE intent, 13 other languages 다국어 발화 의도 분류 0.451 —
XNLI, English 영어 문장 함의 판단 0.860 —
XNLI, 14 other languages 다국어 문장 함의 판단 0.731 —
  • Laya 수치는 Tesla T4에서 잰 Router 결과다.
  • Jev 수치는 회사가 직접 재지 않은 제3자 공개값이고, 표본 크기와 질문 문구가 다르다.
  • Banking77은 Jev가 72개, Laya가 77개 선택지로 쟀다.

원문