GCS 버킷#
버킷 경로, 대상 스키마, 파일 옵션을 사용해 GCS 버킷에 연결합니다. 이 소스는 titan.{schema_name} 아래에 JSON, CSV, Parquet 파일에서 검색한 테이블을 기록합니다.
GCS 버킷 연결#
앱을 열고 앱 연결을 선택한 뒤 GCS 버킷 항목을 선택합니다.
버킷 경로, 대상 스키마, 파일 옵션을 입력합니다.
테이블을 확인한 뒤 소스를 저장합니다.
첫 실행이 완료될 때까지 동기화 기록을 확인합니다.
자격 증명은 비밀 정보로 저장됩니다. 레이크 열이 되거나 쿼리 결과에 나타나지 않습니다.
동기화 동작#
검색된 파일 그룹마다 테이블 1개가 됩니다. ID 열, 구분 기호, 선택 사항인 파일 glob 패턴과 파티션 정렬 열을 지정합니다. 압축 파일에 해당 형식의 일반적인 확장자가 없으면 **/*.gz 같은 사용자 지정 glob 패턴을 사용하세요. 초 단위로 파티셔닝된 소스에서는 증분 동기화가 커서 바로 앞의 파티션도 다시 확인합니다. 이렇게 제한된 범위를 겹쳐 읽으면 생산자가 사전순으로 다음 파티션을 이미 연 뒤 도착한 객체도 수집할 수 있습니다. 설정된 ID 열이 안정적이면 행의 멱등성을 유지합니다.
새 소스는 연결할 때 동기화한 다음 설정된 일정을 따릅니다. 기본 반복 간격은 4시간입니다. 실행이 중단되어도 완료한 진행 상황을 유지하며 안전하게 재시도합니다.
모든 레이크 테이블에는 시스템 열인 _synced_at과 _deleted도 있습니다. 아래 열 참조에는 소스 열만 나열합니다.
테이블 참조#
Supernova는 연결된 계정에서 이 참조 정보를 검색합니다. 설정된 버킷 접두사에서 헤더와 샘플을 읽습니다. 생성되는 열 참조는 해당 파일에 따라 달라집니다.
첫 스키마 검색 실행 후 앱 → GCS 버킷 → 테이블을 열면 모든 정확한 테이블 이름, 열 이름, 타입, 동기화 선택 항목을 볼 수 있습니다. 계정을 연결하기 전에는 동적 필드를 정확하게 나열할 수 없습니다.
삭제와 이력#
행은 소스 키로 병합됩니다. 소스에서 행 삭제를 입증할 수 있으면 Supernova는 행을 유지하고 _deleted를 설정합니다. 따라서 쿼리에서 이력을 포함할지 선택할 수 있습니다. 현재 상태를 조회하는 쿼리에는 where not _deleted 필터를 사용하세요.