Photoroom, PRX 모델 데이터 전략 상세 공개
- •Photoroom의 PRX 데이터 전략은 다양한 공개 및 내부 데이터셋과 고품질의 긴 VLM 생성 캡션을 결합한다.
- •연구팀은 데이터셋 큐레이션을 위해 Lance를 사용하고 저장 효율을 위해 JPEG 품질 92를 설정해 학습을 최적화했다.
- •벤치마크 결과, Qwen2.5-VL-7B로 생성한 긴 캡션이 짧은 캡션 대비 모델 품질 지표를 크게 개선했다.
Photoroom 연구진은 7B 파라미터 이미지 생성 모델인 PRX의 데이터 전략을 공개하며, 다양한 사전 학습 데이터와 고품질 캡션 파이프라인을 상세히 설명했다. 연구팀은 시각적 개념을 폭넓게 학습하기 위해 기존에 구축된 공개 및 내부 데이터셋을 활용하는 방향을 택했다.
데이터 관리를 위해 벡터 검색과 조건 푸시다운을 지원하는 컬럼 형식의 Lance를 도입하여 효율적인 탐색 환경을 마련했다. Mosaic Streaming(MDS)과 병행해 사용하는 과정에서 10만 행 단위의 파편화 문제가 발생했으나, 약 100만 행 규모의 대형 프래그먼트로 조정하여 수억 개의 데이터 항목을 처리하는 병목 현상을 해결했다.
캡션 품질이 모델 출력에 미치는 영향도 확인했다. 확산 모델을 활용한 벤치마크에서 Qwen2.5-VL-7B가 생성한 긴 설명형 캡션은 LLaVA-1.5-LLaMA3-8B의 짧은 캡션보다 우수한 성과를 보였다. 구체적으로 FID는 21에서 13으로, CMMD는 0.52에서 0.32로, DINO-MMD는 0.35에서 0.22로 개선됐다.
이미지 저장 방식에서는 무손실 포맷 대신 JPEG 품질 92를 채택했다. 이는 원본 이미지와 시각적 차이가 거의 없으며 학습 결과에도 부정적 영향을 주지 않았다. JPEG로 학습한 모델과 PNG로 학습한 모델의 생성 결과물은 식별이 불가능한 수준이었으며, 양자화 구조가 감지된 비율은 각각 12%와 10.8%로 큰 차이가 없었다.
학습 과정에서는 Qwen3-VL을 사용한 텍스트 잠재 벡터의 실시간 계산 방식을 도입했다. 3~4%의 처리량 감소가 발생하지만, 데이터 재작성 없이 텍스트 인코더를 유연하게 업데이트할 수 있다는 장점이 있다. 이는 대규모 학습을 지원하는 유연하고 효율적인 파이프라인을 구축하려는 연구팀의 전략을 보여준다.