샌프란시스코 영상 검색 스타트업, 아마존과 벤처캐피탈로부터 1억 달러 투자 유치

샌프란시스코의 한 영상 검색 스타트업이 아마존과 벤처캐피탈로부터 1억 달러 규모의 투자를 받았습니다. 이번 투자는 영상 분석 기술의 상용화 가능성을 인정받은 결과입니다.

data_0

영상 검색 AI 개발사 Twelve Labs, 1억 달러 투자 유치

Nvidia의 지원을 받는 스타트업 Twelve Labs Co.가 Amazon을 포함한 투자자들로부터 1억 달러를 조달했습니다. 이번 Series B 펀딩은 NEA Management Co.와 Naver Ventures가 주도했으며, Radical Ventures, Index Ventures, Korea Investment Partners Co. 등이 참여했습니다. 이 투자는 대규모 영상 데이터를 빠르게 검색하고 분석할 수 있는 인공지능 개발을 가속화하려는 회사의 노력을 강화할 것으로 예상됩니다.

Amazon의 클라우드 서비스 AWS는 Twelve Labs의 업무를 Trainium 칩에서 호스팅하기 위해 다년간의 계약을 체결했습니다. 이 계약의 일환으로 AI 애플리케이션을 개발하는 개발자들을 위해 새로운 모델들이 AWS 서비스에 출시될 예정입니다. 이러한 협력은 Twelve Labs의 기술을 더 많은 기업과 개발자들이 접근할 수 있도록 만들 것입니다.

한국 태생의 엔지니어들이 설립하고 샌프란시스코에 본사를 둔 Twelve Labs는 영상을 검색 가능하고 이해 가능하게 만드는 AI 모델을 개발하고 있습니다. 회사의 목표는 방대한 영상 아카이브에 접근하고 이를 더 쉽게 수익화할 수 있도록 하는 것입니다. CEO이자 공동 창립자인 Jae Lee는 영상이 인간이 세상을 배우는 방식과 가장 유사한 신호 데이터라고 강조했습니다.

영상 데이터의 무한한 잠재력과 기술적 혁신

전 세계 데이터의 약 90%가 영상으로 이루어져 있지만, 대부분은 아카이브에 방치되어 있습니다. 이러한 영상들은 너무 복잡하고 구조화되지 않아 대규모로 검색하거나 분석하기 어렵습니다. 기존의 대규모 언어 모델들은 프레임을 샘플링할 수 있지만 콘텐츠를 놓치는 경우가 많습니다.

Twelve Labs는 여러 유형의 데이터를 동시에 처리할 수 있는 모델을 개발하여 이 문제를 해결했습니다. 회사의 주력 모델인 Marengo 3.0은 원본 영상을 변환하여 기계가 음향, 음성, 동작 전반에 걸쳐 검색할 수 있도록 합니다. Pegasus 1.5 모델은 이 출력을 AI 도구나 애플리케이션을 위해 파싱 가능한 데이터로 구조화하며, 이는 브라우저가 문서를 검색 가능하게 만드는 마크업 언어와 유사합니다.

이 두 모델이 함께 작동하면서 회사가 수집한 모든 영상의 스택을 형성하며, 시간이 지남에 따라 검색 정확도를 높이는 것을 목표로 합니다. 창작자와 엔터테인먼트 회사들은 자신의 영상 아카이브를 검색 가능한 시스템에 넣을 수 있습니다. 이를 통해 1954년 영화 ‘온더 워터프론트’의 말론 브란도 택시 장면이나 1986년 월드컵의 디에고 마라도나의 논란이 된 ‘신의 손’ 골 같은 특정 장면을 찾기가 훨씬 쉬워집니다.

영상 에이전트와 다양한 산업 응용

Twelve Labs는 텍스트 명령을 통해 검색, 설명, 계획, 실행이 가능한 영상 에이전트도 개발 중입니다. CEO Jae Lee는 아직 영상 에이전트에 정식 이름을 붙이지 않았다고 밝혔습니다. 약 200명 규모의 팀은 서울과 샌프란시스코에 균등하게 분산되어 있습니다.

영상에는 방송, 영화, 회의, 공장, 병원, 경기장, 드론, 위성 등 다양한 출처에서 나온 엄청난 양의 정보가 포함되어 있습니다. 그러나 현재 대부분의 영상은 파일명, 폴더, 캡션, 자막, 인간의 기억을 통해서만 접근됩니다. Jae Lee는 ‘모든 영상의 매 초를 주소 지정 가능하고 검색 가능하며 에이전트가 사용 가능하게 만드는 것’이 회사의 목표라고 말했습니다.

Twelve Labs의 고객에는 수백만 시간의 아카이브 콘텐츠를 보유한 할리우드 스튜디오, 광고 회사, 소셜 미디어 인플루언서, 스포츠 프랜차이즈 소유자들이 포함됩니다. 고객 목록에는 Toronto Raptors 소유사인 Maple Leaf Sports & Entertainment Ltd., AMC Global Media Inc., UNICEF 등이 있습니다.

실무 활용 팁: 영상 검색 기술 도입 시 고려사항

조직에서 영상 검색 기술을 도입할 때는 먼저 보유한 영상 자산의 규모와 형태를 파악하는 것이 중요합니다. 방송 아카이브, 회의 기록, 감시 영상 등 다양한 출처의 영상이 있다면 이를 체계적으로 분류하고 정리하는 과정이 필요합니다. 또한 기존 파일명이나 메타데이터가 얼마나 잘 구성되어 있는지 확인하면 도입 과정을 더 효율적으로 진행할 수 있습니다.

기술 도입 후에는 팀원들이 새로운 검색 시스템을 효과적으로 사용할 수 있도록 교육하는 것이 필수적입니다. 텍스트 명령을 통한 검색, 특정 장면 찾기, 콘텐츠 분석 등 다양한 기능을 활용하는 방법을 숙지하면 업무 효율성이 크게 향상됩니다. 초기 단계에서는 가장 자주 사용되는 영상들부터 시스템에 입력하여 실제 효과를 검증하는 것도 좋은 전략입니다.

보안과 접근 권한 관리도 중요한 고려사항입니다. 민감한 콘텐츠나 기밀 영상의 경우 누가 검색하고 접근할 수 있는지 명확히 설정해야 합니다. 또한 클라우드 기반 서비스를 이용할 때는 데이터 보호 정책과 규정 준수 여부를 미리 확인하는 것이 좋습니다.

자주 묻는 질문: 영상 검색 기술에 대해 알아보기

Q1. 기존 영상 검색 방식과 Twelve Labs의 기술은 어떤 점이 다른가요?

A1. 기존 방식은 파일명, 폴더, 자막 등 메타데이터에 의존했지만, Twelve Labs의 기술은 영상 자체의 음향, 음성, 동작을 분석하여 더 정확한 검색을 가능하게 합니다. 예를 들어 특정 배우의 표정이나 특정 음악이 나오는 장면을 직접 찾을 수 있습니다. 이는 마치 영상 전체를 읽을 수 있는 능력을 기계에 부여하는 것과 같습니다.

Q2. 이 기술이 실제로 어떤 산업에서 가장 유용하게 쓰일까요?

A2. 할리우드 스튜디오와 같은 엔터테인먼트 업계에서는 방대한 아카이브에서 특정 장면을 빠르게 찾을 수 있어 제작 시간을 단축할 수 있습니다. 스포츠 산업에서는 경기 영상에서 특정 플레이나 순간을 즉시 검색할 수 있습니다. 또한 뉴스 기관이나 다큐멘터리 제작사도 방대한 영상 자료에서 필요한 콘텐츠를 효율적으로 찾을 수 있습니다.

※ 실제 상황과 다를 수 있으므로, 결정 전 전문 확인을 권장합니다.

댓글 남기기