모델 출시
Convai Innovations, 판단 전용 System One 모델 Laya 체크포인트 셋 공개
- Convai Innovations가 System One 모델 Laya를 공개했다.
- 영어·다국어·타입 판단 미세조정 체크포인트 셋으로, 글 대신 정해진 타입의 답과 확률을 한 번의 계산으로 돌려준다.
- 가중치는 Apache 2.0으로 풀렸다.
| 모델 | laya |
|---|---|
| 저장소 | convaiinnovations/laya |
| 모델 | laya-multilingual |
| 저장소 | convaiinnovations/laya-multilingual |
| 모델 | laya-typed-decisions |
| 저장소 | convaiinnovations/laya-typed-decisions |
| 개방성 | 오픈형 |
| 라이선스 | Apache-2.0 |
무엇이 나왔나
- Convai Innovations가 System One 모델 Laya를 Hugging Face에 공개했다.
- Laya는 글을 쓰지 않는 판단 모델이다.
- 글·이메일·티켓·JSON 같은 상태(state)와 타입이 정해진 질문을 받으면, 타입에 맞는 답을 확률과 함께 돌려준다.
- 회사는 한 번의 순전파(약 33ms)로 100개 넘는 언어에서 답한다고 밝혔다.
- 글을 생성하지 않으므로 출력을 따로 해석할 필요가 없다고 회사는 설명했다.
- 질문 타입은 여러 선택지 중 하나를 고르는
choice, 순서가 있는 단계로 점수를 매기는score, 예/아니오 확률을 내는noul이다. - 답할 선택지는 요청할 때 정하므로 새 스키마를 쓰려고 다시 학습할 필요가 없다.
저장소 하나에 체크포인트 셋이 함께 들어 있고, 요청한 것만 내려받는다.
laya(저장소 루트): 영어 전용이다. 회사는 영어 글, 가드레일, 이메일 분류에 맞다고 밝혔다.laya-multilingual: 100개 넘는 언어를 다루며 영어판보다 약 2.2배 빠르다고 회사는 밝혔다.max_len=8192를 주면 8,192토큰까지 읽는다.laya-typed-decisions: 네 가지 타입 판단 업무 흐름에 맞춰 미세조정한 체크포인트다.
- 회사가 권하는 쓰는 방식은 내장된
Router다. - 입력의 문자 체계와 언어를 0.5ms 안에 알아내 영어는
laya로, 나머지는laya-multilingual로 보낸다. - 결과에는 어느 체크포인트를 왜 골랐는지가 함께 담긴다.
- 이미 쓰는 언어 판별 모델이 있으면
lang_guess로 그 답을 넘길 수 있다.
- 직접 띄우는 HTTP 서버
laya-serve도 함께 나왔다. - TypeSafe Jev와 같은
POST /v1/systemone요청·응답 꼴을 쓰므로, 기존 TypeSafe 클라이언트는 기본 주소만 바꾸면 그대로 쓸 수 있다고 회사는 밝혔다. LAYA_API_KEY를 설정하지 않으면 인증 없이 열린다.
규모와 구조
laya와laya-typed-decisions는 ModernBERT-large(3억 9,500만 파라미터, 양방향, 전체 미세조정) 위에 처음부터 학습한 판단 머리를 얹었다. 판단 머리는 트랜스포머 층 2개, 선택지 표지 채점기, 실행/상위 보고(act/escalate) 머리로 이뤄진다. 합쳐서 4억 2,100만 파라미터다.laya-multilingual은 mmBERT-base(22층, 어휘 25만 6,000개)를 쓰며 합쳐서 3억 2,200만 파라미터다.- 각 선택지는 자기
[MASK]토큰 자리에서 점수를 받고, 그 질문의 선택지끼리 소프트맥스로 확률이 된다. - 기본 컨텍스트는
laya가 512토큰,laya-multilingual과laya-typed-decisions가 1,024토큰이다. 이 가운데 선택지 설명에 쓰는 몫(head_max_len)이 영어판 192토큰, 나머지 둘은 256토큰이다. - 한 번의 호출에 담긴 질문은 모두 한 번의 순전파로 답한다.
- 가중치는 Apache 2.0으로 공개돼 사내 설치로도 쓸 수 있다.
학습 방식
- 회사는 이 학습법을 RLCD(Reinforcement Learning for Calibrated Decisions)라고 부른다.
- 모델이 확률 분포를 내면, 탐색을 위해 로짓에 평균이 0인 가우스 잡음을 더하고, 엄밀하게 적정한 채점 규칙(로그 점수와 구면 점수, 순서형 질문에는 순위 확률 점수를 더함)으로 보상을 준다.
- 기대 보상은 정직한 확률을 낼 때만 가장 커진다고 회사는 설명했다.
- 갱신은 그룹 평균을 기준선으로 쓰는 REINFORCE(GRPO 방식)이고, 여러 차례 오가는 대화에는 앞부분 조각마다 TD(λ=1.0)를 쓴다.
회사가 밝힌 수치
- Tesla T4 한 장에서 질문 1개에
laya39.5ms,laya-multilingual32.8ms가 걸렸다. 질문 10개를 묶으면 각각 158.6ms, 72.3ms, 50개면 771ms, 337ms다. 묶어서 처리하면 초당 103~332개 질문을 답한다고 회사는 밝혔다. - 회사는 TypeSafe Jev가 제3자 측정에서 중앙값 236~276ms였다며, Laya가 질문 하나를 6~8배 빠르게 답한다고 밝혔다.
- 51개 언어 가운데 무작위의 3배를 넘어 쓸 만한 언어는
laya23개,laya-multilingual과Router45개였다. - 영어 체크포인트는 라틴 문자가 아닌 글에서 무너진다. 크메르어에서 정확도 0.000에 확신도 0.952를 냈다. 틀리면서도 확신하므로 확신도로 걸러낼 수 없고, 그래서
Router로 언어를 먼저 가른다고 회사는 설명했다. laya-multilingual은 긴 문서에서 약 4,000토큰까지는 20건 중 16~18건을 맞혔다. 그보다 길면 20건 중 8~17건으로 들쭉날쭉했다. 4,000토큰 입력은 Apple GPU에서 약 1.7초 걸렸다.- 타입 판단 벤치마크(2,000건 판단, 업무 흐름 넷)에서
laya-typed-decisions는 정확도 0.766이었다. 같은 문제에서 기본 영어 체크포인트는 0.362,laya-multilingual은 0.342였다. 업무별로는 청구서 처리 0.804, 보안 사고 0.766, 고객 응대 0.764, 에이전트 실행 기록 관찰 0.730이다. 질문 타입별로는noul0.857,choice0.733,score0.723이다. - 보정 오차(ECE)는 온도 보정 뒤 0.081로, Jev의 0.246보다 낮았다고 회사는 밝혔다.
한계로 밝힌 점
- 기본 체크포인트는 타입 판단 문제를 미세조정 없이 풀면 거의 우연 수준이다(0.362, 다국어 0.352. 무작위 0.318, 최다 답 기준 0.461). 0.766은 그 벤치마크의 학습 데이터로 미세조정한 체크포인트의 점수다. 회사는 Laya를 미세조정 없이 쓰는 판단 엔진이 아니라, 빠르게 특화시킬 바탕 모델이라고 밝혔다. 자기 분야의 판단 데이터로 미세조정하라고 권했다.
- 선택지가 20개를 넘으면 약하다. Banking77에서 Jev는 0.870, Laya는 0.425였다. 선택지들이 정해진 토큰 몫을 나눠 쓰기 때문에, 77개면 선택지 하나에 3~4토큰밖에 돌아가지 않는다. 회사는 50개 넘는 선택지를 한 번에 물을 때는 Jev가 아직 낫다고 밝혔다. Laya로 물으려면
head_max_len과max_len을 키우거나, 큰 선택지를 거친 단계와 세부 단계로 나눠 두 번 물으라고 권했다. - 교사 모델의 확률 분포와 얼마나 맞는지 보는 부드러운 정확도는 Jev가 높다(0.580 대 0.471). 온도 보정 전 원래 보정 오차도 Jev가 낮다(0.144 대 0.213).
- 순서형
score질문이 가장 약하다(SST-5 0.372). noul은 특히 영어 체크포인트에서 입력보다 선택지 이름을 따라가, 뚜렷이 긍정인 입력에 확신에 찬 '아니오'를 내기도 한다. 회사는 이럴 때 중립적인 이름을 붙인 두 선택지choice로 바꿔 물으라고 권했다.action.act_probability는 아직 쓸 만한 신호가 없다. 거의 모든 입력에서 1.0이 나온다. 회사는 대신confidence로 거르라고 권했다(같은 항목에서 AUROC 0.77).- 출고 상태에서는 확률이 지나치게 확신에 차 있다. 질문 타입과 선택지 수마다 온도를 다시 맞추면 평균 ECE가
laya0.466에서 0.081로,laya-multilingual0.314에서 0.106으로 내려간다. 회사는 확률을 믿기 전에 자기 데이터로 먼저 이 보정을 하라고 권했다. - 루트의
laya는 영어 전용이다. 영어가 아닌 글에는laya-multilingual을 쓰라고 회사는 권했다.
벤치마크
| 벤치마크 | 무엇을 재나 | Laya (라우팅) (—) | TypeSafe Jev 1.13.0 (—) |
|---|---|---|---|
| typed-decisions, 2,000 decisions | 업무 흐름 넷의 타입 판단 정확도 | 0.766 | 0.727 |
| AG News, 4 labels | 뉴스 기사 주제 분류 | 0.950 | 0.910 |
| DAIR Emotion, 6 labels | 글에 담긴 감정 분류 | 0.595 | 0.480 |
| Banking77 (72 vs 77 labels) | 은행 고객 문의 의도 분류 | 0.425 | 0.870 |
| MASSIVE intent, English | 영어 발화 의도 분류 | 0.783 | — |
| MASSIVE intent, 13 other languages | 다국어 발화 의도 분류 | 0.451 | — |
| XNLI, English | 영어 문장 함의 판단 | 0.860 | — |
| XNLI, 14 other languages | 다국어 문장 함의 판단 | 0.731 | — |
- Laya 수치는 Tesla T4에서 잰
Router결과다. - Jev 수치는 회사가 직접 재지 않은 제3자 공개값이고, 표본 크기와 질문 문구가 다르다.
- Banking77은 Jev가 72개, Laya가 77개 선택지로 쟀다.
원문
Hugging Face 모델 카드 Hugging Face 문서 Hugging Face 문서 Hugging Face 문서