llmfeed

Cua, GUI 양식 채우기용 System One 모델 cua-s1-forms 공개

Cua
  • Cua가 GUI 양식 채우기용 System One 모델 cua-s1-forms를 공개했다.
  • 파라미터 70만 6,048개짜리로, 글을 쓰지 않고 선택지마다 확률을 돌려준다.
  • 예전 pickle 파일은 지워졌고 safetensors 파일만 받아야 한다.
모델cua-s1-forms
저장소cua-ai/cua-s1-forms
개방성오픈형
파라미터 706,048
라이선스 MIT

무엇이 나왔나

  • Cua가 GUI 양식(폼) 채우기를 위한 작은 System One 모델 cua-s1-forms 를 Hugging Face 에 공개했다.
  • Cua-S1 연구 계열에 속하는 tinyx 선택지 채점 모델이다.
  • Cua-S1 문서는 이 모델을 cua-s1-form-v0 연구 프로필과 관련된 tinyx 양식 체크포인트라고 설명하지만, 그 프로필의 정식 대응 릴리스는 아니라고 밝혔다.
  • 이 모델은 글을 만들지 않는다.
  • UI 요소 하나와 정해진 타입의 선택지 목록을 받으면, 한 번의 순전파로 선택지마다 확률 하나씩을 돌려준다.
  • 선택지는 문서에서 찾은 항목마다 하나씩에 check, click, skip 세 가지 고정 동작을 더한 것이다.
  • 회사는 이것이 TypeSafe 의 Jev 와 같은 입력·출력 약속이라고 밝혔다.
  • 모델은 양식 위의 조작 가능한 요소를 하나씩 따로, 한 번의 병렬 묶음으로 채점한다.
  • 실행 순서(값 채우기, 체크박스, 마지막 제출 클릭 한 번)는 모델이 아니라 뒤쪽 코드가 정한다.
  • 실행기는 확률이 가장 높은 선택지를 고르고, fill 이면 해당 항목을 찾아 값을 넣은 뒤 동작을 정렬해 Cua Driver 로 보낸다(set_value 또는 click).
  • 회사는 이 체크포인트가 TypeSafe 의 RLCD 방식으로 보정되지 않았으며, Jev 를 재현한 것이 아니라 독립된 연구용 체크포인트라고 밝혔다.
  • jev-use 의 닫힌 후보 선택기는 Cua-S1-4B 어댑터만 지원하며 이 체크포인트는 불러오지 않는다.

규모와 구조

  • 학습 가능한 파라미터는 706,048개다.
  • 바이트 단위 임베딩과 2층 Transformer 인코더(너비 128, 헤드 4개)가 맥락과 각 선택지의 글을 따로 부호화한다.
  • 이어 선택지 주의(option-attention) 헤드가 각 선택지를 질의로 삼아 맥락 토큰을 살펴 맥락 벡터를 만들고, 공유 내적으로 선택지마다 로짓 하나를 낸 뒤 실제 선택지 수에 대해 softmax 를 취한다.
  • 맥락은 요소마다 224바이트, 선택지는 각각 96바이트로 잘린다.

학습

  • 학습에는 합성 에피소드 10,000개를 썼다.
  • 에피소드마다 2~16개 칸으로 된 무작위 양식이 55개 개념 목록에서 뽑히고, 양식 이름표와 문서 이름표에는 동의어가 쓰인다.
  • 각 양식에는 가상의 인물과, 헷갈리게 하는 항목과 일부러 넣은 닮은꼴 쌍(email 과 street, phone 과 emergency contact phone, state 와 university 따위)을 담은 무작위 문서가 짝지어진다.
  • 창 제목 끝부분은 무작위로 바뀌고 제목의 20%는 빠진다.
  • 회사는 예약된 전화번호, .invalid 도메인, 무효한 시험용 식별자, 가상의 상표만 썼으며 실제 사용자 제출 자료는 들어 있지 않다고 밝혔다.
  • 학습·시험 분할은 양식 칸 구성이 정확히 겹치지 않게 나눴다.
  • 최적화에는 AdamW, 워밍업이 있는 코사인 일정, 6에폭, 배치 128, 실제 선택지 수에 대한 교차 엔트로피를 썼다.

회사가 밝힌 수치

  • 아래 결과는 체크포인트 작성자가 공개 시점에 보고한 것이다.
  • 이를 뒷받침하는 결과 문서는 trycua/cua 저장소에 없고, libs/cua-s1 은 이 결과를 재현하지 않는다고 회사는 밝혔다.
  • 같은 과제를 두고 맞붙인 비교에서 작성자는 이 모델이 99.7%, 미세조정하지 않은 호스팅 Jev API(jev-latest)가 83.6%를 기록했다고 보고했다.
  • 호스팅 Jev 는 판단이 필요한 결정(채우기·체크·클릭)에서 96%를 냈지만, 이미 채워진 칸을 아무것도 하지 않을 칸으로 알아보는 결정에서는 74%에 그쳤다.
  • 회사는 이것이 이 모델은 학습했고 호스팅 Jev 는 학습하지 않은 관례라고 설명했다.

권한 용도와 한계

  • 회사는 좁게 정해진 양식 중심 컴퓨터 사용 과제 연구, 격리·통제된 환경에서의 전문 모델 동작 평가, 과제별 실패 유형·검증·사람의 감독 연구에 쓰라고 권했다.
  • 범용·개방형 컴퓨터 조작, 실제 운영 계정이나 민감한 자료에서의 무감독 사용, 금융·법률·의료·고용·안전 등 영향이 큰 동작, 접근 통제·동의·호출 제한·서비스 정책 우회, 모델 출력이나 겉보기 과제 완료를 동작이 옳았다는 증거로 삼는 일은 용도 밖이라고 밝혔다.
  • 회사가 밝힌 한계는 다음과 같다.
  • 모델은 문서 추출기가 이미 Label: value 쌍으로 찾아낸 항목 가운데서만 고르며 값을 새로 만들지 못한다.
  • 전부 합성 양식으로 학습했고 196개 결정짜리 작은 실제 자료로만 평가해, 시연 자료 밖의 실제 양식에서는 검증되지 않았다.
  • 바이트 단위 인코더와 영어 중심의 이름표 어휘를 쓴다.
  • 가중치를 쓰는 CI 나 정식 Cua Driver 데스크톱 E2E 시험도 이 체크포인트를 다루지 않는다.

pickle 파일 삭제

  • 이 저장소는 예전에 pickle 체크포인트 cua-s1-forms.pt 를 함께 내놓았으나 지금은 지웠다.
  • 회사는 pickle 체크포인트를 풀면 임의의 코드가 실행될 수 있으므로, 예전 리비전에서 받은 것을 포함해 이 모델의 .pt 사본을 torch.load 나 pickle 로 불러오지 말라고 당부했다.
  • 이제 지원하는 형식은 텐서만 담은 cua-s1-forms.safetensors 와, 구조 설정·텐서 SHA-256 서명·최고 검증 지표 등을 담은 cua-s1-forms.json 한 쌍뿐이다.
  • 회사는 이 한 쌍이 지워진 pickle 과 같은 가중치를 담고 있으며 변환 뒤에도 모델 출력이 비트 단위로 같았다고 밝혔다.
  • cua_s1 패키지는 설계상 pickle 체크포인트를 거부한다.

벤치마크

벤치마크 무엇을 재나 cua-s1-forms (706,048)
Synthetic test (form-disjoint, about 15k decisions) 합성 양식에서의 선택 정확도 99.95%
Real demo eval (3 real forms and 3 real PDFs, 196 decisions, no synthetic data) 실제 양식·PDF에서의 선택 정확도 100%
Shuffled-context control 맥락을 섞은 대조 실험 정확도 37%

Top-1 정확도이며, 합성 시험에는 어려운 닮은꼴 쌍을 일부러 넣었다고 작성자가 밝혔다.

원문