[위클리AI] 구글·스페이스XAI, 서비스 확장 나섰다···코히어 합병 확정

[IT동아 박귀임 기자] 인공지능(AI)이 세상을 바꾸고 있습니다. AI는 이제 우리 일상에서 떼려야 뗄 수 없는 핵심적인 요소입니다. 한 주간 세계를 들썩이게 만든 글로벌 빅테크 기업부터 우리 일상에 직접 영향을 미칠 새로운 AI 소식까지 핵심만 짚어드립니다.

구글, '가족용 AI 비서' CC 선보여···최대 6명 공유

구글이 가족을 위한 새로운 실험용 에이전트 CC를 선보였습니다 / 출처=구글
구글이 가족을 위한 새로운 실험용 에이전트 CC를 선보였습니다 / 출처=구글

글로벌 빅테크 기업 구글(Google)의 서비스 실험 플랫폼 구글랩스(Google Labs)가 9월 17일(이하 현지 시간) 가족을 위한 새로운 실험용 에이전트 'CC'를 선보였습니다. 이번 소식의 핵심은 CC가 자체 구글 계정을 갖게 됐다는 것으로, AI 에이전트를 이용자 계정의 부속 기능이 아니라 고유한 신원과 권한을 가진 별도 주체로 설계했다는 점에서 눈길을 끕니다. 최대 6명이 하나의 CC를 함께 관리하고 쓸 수 있습니다.

CC는 지난해 12월 개인 생산성 에이전트로 처음 공개된 바 있습니다. 올해 5월에는 제미나이(Gemini) 앱의 '데일리 브리프' 기능으로도 제공됐습니다. 구글랩스는 이번 개편 배경에 대해 '가정 운영을 더 도와달라'는 이용자 요청이 가장 많았다고 설명했습니다.

특히 CC는 매일 아침 가족 공용 브리핑 '유어 데이 어헤드(Your Day Ahead)'를 이메일로 보냅니다. 누가 어디에 가야 하는지, 해야 할 일이 무엇인지, CC가 전날 이미 처리한 일이 무엇인지를 한눈에 보여줍니다. 학교·수영장·동물병원 등에서 온 메일이 대표적인 정보원입니다. CC는 이를 분류해 가족 캘린더와 할 일 목록에 반영하고, 일정이 바뀌면 함께 갱신하기도 합니다.

이용자가 맡길 수 있는 일도 구체적입니다. 참가 동의서나 활동 등록 PDF 양식 작성, 학용품 쇼핑 목록 만들기, 주간 식단 짜기 등 다양합니다. 정보가 부족하면 CC가 이용자에게 되묻고, 그룹 메모리를 업데이트해 다음에 활용하기도 합니다.

통제 방식에 대해 구글랩스는 CC가 그룹 구성원의 요청에만 응답하며, 허락 없이 그룹 밖에서 행동하거나 정보를 공유하지 않는다고 설명했습니다. 구성원은 무엇을 공유하고 무엇을 비공개로 둘지 언제든 바꿀 수 있습니다.

공유 방식은 세 가지로 나뉩니다. CC는 자녀의 학교나 여행 예약처럼 항상 공유할 메일 발신자를 미리 지정할 수 있습니다. 또 매주 새로 발견된 발신자 목록을 비공개로 보내 공유 여부를 묻습니다. 일회성 정보는 메일이나 구글 챗으로 CC에 직접 보내면 됩니다. 생일 파티 초대장이나 축구 연습 일정표 사진을 보내면 캘린더에 반영하는 식입니다. 드라이브 폴더·파일을 공유하거나 CC를 캘린더에 추가하는 방법도 있습니다.

CC의 기억도 다르게 설정할 수 있습니다. 자주 쓰는 장보기 목록이나 가족이 좋아하는 식당처럼 가구 전체에 해당하는 내용부터 식이 선호, 현지 시간대처럼 개인에게만 해당하는 내용까지 구분해 저장합니다.

기술적으로 CC는 가족(그룹)마다 격리된 클라우드 컴퓨터에서 구글의 에이전트 실행 환경 '안티그래비티'와 최신 제미나이 모델로 구동됩니다. 지메일(Gmail)·챗(Chat)·문서(Docs)·캘린더(Calendar) 등 구글 도구와도 연결돼 있습니다. 뿐만 아니라 구글 지도(Google Maps) API로 연이은 일정 사이의 이동 시간을 확인하고 공유 문서·스프레드시트를 만드는 작업 역시 처리 가능합니다.

이는 에이전트가 받은 권한 이상으로 움직이는 문제가 업계의 화두가 된 가운데 구성원별 공유 범위와 그룹 밖 행동 제한을 구조에 넣은 접근으로 볼 수 있습니다.

서비스의 초점도 학교 서류, 식단, 이동 시간 같은 생활 전반에 맞춰졌습니다. 이미 구글 서비스에 쌓여 있는 여러 사람의 메일과 일정, 문서 등은 CC가 활용할 수 있는 기반입니다. 다만 공유 범위를 구성원이 계속 판단·관리해야 하는 구조인 만큼 편의성과 개인정보 보호 사이의 균형이 실제 사용에서 어떻게 나타날지는 지켜봐야 합니다. 자녀 관련 정보를 다루는 서비스라는 점에서 운영 과정의 검증도 필요해 보입니다.

CC는 아직 구글랩스의 초기 실험 단계 서비스입니다. 미국 거주 18세 이상으로 개인 구글 계정이 있는 이용자만 웹과 모바일에서 사용할 수 있습니다. 기존 CC 이용자는 며칠 안에 계정 업그레이드 안내 메일을 받게 됩니다. 신규 이용자의 경우 대기자 명단에 등록해야 합니다. 가격과 미국 외 지역 출시 계획은 이번에 포함되지 않아 국내 도입 시점도 미정입니다.

스페이스XAI, 그록 보이스 트랜스크라이브 2.0 출시 '정확도 2배·가격 그대로'

스페이스XAI가 그록 보이스 트랜스크라이브 2.0을 출시했습니다 / 출처=스페이스XAI
스페이스XAI가 그록 보이스 트랜스크라이브 2.0을 출시했습니다 / 출처=스페이스XAI

미국 AI 기업 스페이스XAI(SpaceXAI)가 9월 18일 최신 음성 인식(STT) 모델 '그록 보이스 트랜스크라이브 2.0(Grok Voice Transcribe 2.0)'을 출시했습니다. 음성 인식이 자막을 만드는 기술을 넘어 말로 내린 지시를 AI 에이전트의 작업으로 곧장 연결하는 관문으로 자리 잡고 있음을 보여주는 사례로 꼽히는 가운데 이번 모델은 자체 실환경 평가 결과 현재 이용 가능한 전사 모델 가운데 가장 정확한 축에 속하며 가격은 이전 버전인 1.0과 동일한 만큼 주목받고 있습니다.

스페이스XAI에 따르면 그록 보이스 트랜스크라이브 2.0은 '그록 보이스'의 기반이 되는 오디오 파운데이션 모델 위에 만들어졌습니다. 그록 보이스는 이미 하루 수만 건의 고객 지원 통화를 처리하고, 수백만 시간 분량의 영상 내레이션을 전사하며, 테슬라 차량의 그록 어시스턴트를 포함한 실제 제품에서 음성 에이전트를 구동하고 있습니다. 이 모델은 다양한 환경에서 녹음한 실시간·소음·다국어 음성 데이터셋으로 학습한 뒤 후속 학습으로 다듬었습니다.

스페이스XAI는 대부분의 전사 모델이 깨끗한 단일 화자 음성에서는 잘 작동하지만 실제 음성은 불안정한 전화선, 겹치는 목소리, 지역 억양, 소리 내어 읽는 전화번호와 이메일 주소처럼 훨씬 까다롭다고 설명했습니다. 그록 보이스 트랜스크라이브 2.0은 이런 조건을 개선해 설계됐습니다.

그록 보이스 트랜스크라이브 2.0은 공개 평가 기관 아티피셜 애널리시스(Artificial Analysis)의 리더보드에서 스트리밍 모델 32개 중 정확도 1위를 차지했다고 스페이스XAI는 밝혔습니다.

자체 평가도 실제 서비스 트래픽에서 뽑은 4개 데이터셋(고객 지원 전화망 음성, 그록과의 대화, 계정 코드·이메일 같은 음성 자격 정보, 짧은 다국어 음성 명령)으로 진행했습니다. 그 결과 그록 보이스 트랜스크라이브 2.0은 4개 모두에서 1.0보다 성능이 향상됐습니다. 특히 8kHz 전화망 고객 지원 통화(영어)에서 단어 오류율 7.1%로 시험한 모든 모델 중 가장 낮았습니다. 1.0(10.6%)보다도 오류율이 개선됐습니다. 언어 판별 맥락이 부족한 짧은 다국어 음성 명령 역시 오류율이 20.6%에서 6.8%로 떨어져 4개 데이터셋 중 가장 큰 개선폭을 보였습니다.

모든 항목에서 그록 보이스 트랜스크라이브 2.0이 1위를 한 것은 아닙니다. 전화번호·이메일·주소를 읽는 자격 정보 평가에서 그록 보이스 트랜스크라이브 2.0은 3.2%를, MAI-Transcribe-2는 2.6%를 각각 기록했습니다.

스페이스XAI는 그록 보이스 트랜스크라이브 2.0의 다국어 정확도가 1.0 대비 가장 크게 개선된 부분이라고 밝혔습니다. 모델은 수십 개 언어를 전사하고 언어를 자동 감지하며, 녹음 도중 언어가 바뀌어도 한 번의 처리로 따라갑니다. 다만 스페이스XAI가 공개한 19개 언어 차트에 한국어는 포함돼 있지 않았습니다.

기능 구성은 사람이 읽는 자막보다 애플리케이션과 음성 에이전트 개발에 맞춰져 있습니다. 그록 보이스 트랜스크라이브 2.0은 녹음 파일과 URL을 처리하는 배치 전사와 오디오 스트림을 바로 받아 옮기는 실시간 스트리밍을 모두 지원하며, 모든 단어에는 정확한 시작·종료 시각과 신뢰도 점수가 붙습니다. 화자 분리 기능은 전사문에서 누가 말했는지 구분해 표시하고 추가 비용이 들지 않습니다. 최대 8개 채널을 각각 독립적으로 전사할 수 있고, 요청 한 건에 제품명이나 의료 용어 같은 도메인 용어를 최대 100개까지 지정해 인식 정확도를 높일 수도 있습니다.

출력 형태도 후속 처리에 맞췄습니다. 숫자, 날짜, 통화, 전화번호, 이메일 주소는 문자로 쓰인 형태로 변환돼 나올 뿐만 아니라 "음"이나 "어" 같은 군말은 전사문에서 뺄 수 있습니다. 음성 에이전트를 위해서는 화자의 발언이 끝나는 시점을 감지하는 기능도 제공합니다. 기존 STT API를 쓰는 이용자는 코드를 바꾸지 않아도 개선된 정확도를 그대로 받습니다.

첫 고객 사례로는 아틀라시안(Atlassian)의 화면 녹화 서비스 루프(Loom)입니다. 아틀라시안은 루프 영상 전사에서 그록 보이스 트랜스크라이브 2.0이 기존 솔루션보다 정확하다고 확인했습니다. 루프에 실행 계획을 녹화하면 전사문이 코딩 도구 커서(Cursor)로 넘어가 코드 수정이 직접 이뤄지는 식의 워크플로가 가능해집니다.

산찬 삭세나(Sanchan Saxena) 아틀라시안 팀워크 컬렉션 수석부사장은 "맥락을 한 번 담아 어디로든 흐르게 하는 것이 업무를 앞으로 나아가게 하는 최선의 방법이라고 믿어 왔습니다"라며 "의도를 녹화하면 일이 끝납니다. AI 지원 개발이 어디로 가고 있는지 보여주는 한 장면"이라고 말했습니다.

그록 보이스 트랜스크라이브 2.0의 가격은 1.0과 동일합니다. 배치 전사는 오디오 1시간당 0.10달러, 스트리밍은 1시간당 0.20달러인데 화자 분리·타임스탬프·핵심 용어가 포함됩니다.

이번 발표는 음성 인식 시장의 경쟁 방식이 바뀌고 있음을 보여줍니다. 첫째는 가격이다. 정확도를 두 배로 높이면서 값을 그대로 둔 것은 비교 대상보다 절반 안팎의 단가에 화자 분리와 타임스탬프까지 기본 포함한 구성입니다. 전사 자체로 차별화하기 어려워지는 방향의 압력으로 보입니다.

둘째는 전사의 위치입니다. 스페이스xAI가 전면에 내세운 사례는 자막 생성이 아니라, 말로 남긴 지시가 다음 단계의 에이전트 작업으로 이어지는 흐름입니다. 발언 종료 감지, 핵심 용어 지정, 멀티채널 같은 기능도 같은 방향입니다. 음성 인식 정확도가 말로 일을 시키는 워크플로의 병목이 된 셈입니다. 전사 오류가 곧 후속 작업의 오류로 이어질 수 있어 정확도의 의미도 커집니다.

마지막으로 평가 무대입니다. 깨끗한 음성이 아니라 전화망, 억양, 짧은 명령어, 소리 내어 읽는 자격 정보처럼 상용 환경에 가까운 조건이 경쟁 지점이 됐습니다. 콜센터와 차량, 음성 에이전트를 실제로 운영하며 얻은 데이터가 모델 개선으로 돌아오는 구조가 강점으로 제시됐다는 점도 주목할 만합니다.

그록 보이스 트랜스크라이브 2.0의 출시는 음성이 주요 AI 기업의 새 경쟁 무대가 되고 있음을 다시 보여주는 사례로 꼽힙니다. 그록 보이스 트랜스크라이브 2.0은 STT API의 기본 모델이 되고, 1.0은 앞으로 몇 주 안에 지원이 중단될 예정입니다.

코히어·알레프 알파, 최종 합병 발표 "대서양 횡단 소버린 AI"

코히어와 알레프 알파가 최종 사업결합계약을 체결했습니다 / 출처=코히어
코히어와 알레프 알파가 최종 사업결합계약을 체결했습니다 / 출처=코히어

캐나다 AI 기업 코히어(Cohere)와 독일 AI 기업 알레프 알파(Aleph Alpha)가 9월 16일 최종 사업결합계약(definitive business combination agreement)을 체결했습니다. 이는 올해 4월 발표한 결합 계획을 공식화한 것입니다. 오픈AI(OpenAI), 앤트로픽(Anthropic), 구글(Google) 등이 모델 성능으로 경쟁하는 사이 코히어와 알레프 알파는 '데이터 주권'을 앞세워 정부·금융·규제 산업에 초점을 맞춘다는 전략입니다.

코히어는 캐나다와 독일 양국에 본사, R&D 센터, 리더십 직책을 둔다고 밝혔습니다. 본사는 베를린과 토론토 두 곳에 두고, 알레프 알파의 하이델베르크 사무소는 연구 센터로 남습니다. 거래로 코히어의 직원 수는 1000명 이상으로 늘어납니다.

거래 종결과 동시에 발효되는 리더십 인선도 함께 발표됐는데, 이는 거래 종결을 전제로 합니다. 일한 쉬어(Ilhan Scheer) 알레프 알파 공동 최고경영자(CEO)는 코히어의 최고운영책임자(COO)를 맡아 글로벌 운영 모델과 조직 확장을 이끕니다. 사무엘 바인바흐(Samuel Weinbach) 알레프 알파 공동창업자 겸 공동최고연구책임자는 코히어의 최고연구책임자(CRO)로 옮겨 회사의 연구·기술 개발을 총괄합니다. 그의 연구 분야는 토큰화, 언어 모델 학습, 설명 가능성, 이미지 생성입니다.

일한 쉬어는 "지난 12개월간 정부와 규제 산업을 위한 특화 언어 모델에 집중해왔습니다"라며 "코히어는 이 작업에 강력한 전략적 적합성을 갖고 있고, 우리의 연구 전문성을 보완하는 글로벌 도달 범위와 배포 역량을 가져다줍니다"라고 말했습니다.

아이단 고메즈(Aidan Gomez) 코히어 공동창업자 겸 CEO는 "어떤 정부나 기업도 유능한 AI와 자사 기술에 대한 통제권 중 하나를 선택해야 해서는 안 됩니다"라면서 "그것이 바로 인재, 인프라, 제도적 신뢰를 강화하기 위해 알레프 알파와 힘을 합치는 이유"라고 전했습니다. 또 "함께라면 경쟁할 만큼 강력하면서도 신뢰할 수 있을 만큼 안전하고 통제 가능한 프런티어 AI에 대해 커지는 전 세계 수요에 더 빠르게 대응할 수 있을 것"이라고 밝혔습니다.

이번 합병에는 독일 유통 대기업 슈바르츠 그룹(Schwarz Group)도 이름을 올렸습니다. 코히어는 슈바르츠 그룹 계열사들과의 파트너십을 발전시켜 슈바르츠 디지츠(Schwarz Digits)의 소버린 클라우드 서비스인 스택아이티(STACKIT) 위에서 소버린 AI를 제공하기로 했습니다.

크리스티안 뮐러(Christian Müller) 슈바르츠 디지츠 CEO는 "디지털 주권은 혼자 나서는 것이 아니라 전략적으로 힘을 합치는 것"이라며 "이번 대서양 횡단 제휴는 독립적인 AI 인프라 발전을 가속화하는 거대한 도약"이라고 강조했습니다. 이어 "스택아이티를 소버린 AI 솔루션의 기술적 근간으로 만들어 조직들이 높은 성능과 디지털 독립성 중 하나를 선택할 필요가 없도록 하겠습니다"라고 덧붙였습니다.

실제로 합병 발표 자리에는 캐나다 AI 담당 장관과 독일 디지털 장관이 함께했습니다. 이번 합병이 코히어와 알레프 알파만의 사업 재편이 아니라 양국 정부가 지지를 보탠 산업 전략임을 보여주는 대목입니다.

슈바르츠 그룹의 역할도 주목할 만합니다. 소매 대기업이 클라우드 자회사를 통해 AI 인프라의 실질적 자금원이자 기술 근간을 제공하는 구조이기 때문입니다. '주권'이라는 표현을 쓰지만, 이를 실제로 뒷받침하는 것은 국가가 아니라 민간 기업 연합이라는 점은 이번 발표에서 다시 확인할 수 있습니다.

무엇보다 알레프 알파 내 리더가 운영(COO)뿐만 아니라 연구(CRO) 총괄까지 맡는다는 점도 눈여겨볼 부분입니다. 코히어가 알레프 알파의 연구 역량 자체를 필요로 했다는 뜻으로 풀이할 수 있습니다. 다만 최종 지분 구조와 재무 조건은 이번 발표에 담기지 않은 만큼 실질적인 힘의 균형이 어느 쪽에 있는지는 두고봐야 합니다.

거래는 최종 규제 승인을 남겨두고 있으며 올해 후반 종결될 것으로 예상됩니다. 통합과 제품에 관한 세부 사항은 추후 발표될 예정입니다. 코히어와 알레프 알파의 합병이 실제 소버린 AI 시장에서 통할지는 규제 승인과 실제 제품 통합 과정에서 판가름날 전망입니다.

IT동아 박귀임 기자(luckyim@itdonga.com)

IT동아의 모든 콘텐츠(기사)는 Creative commons 저작자표시-비영리-변경금지 라이선스에 따라 이용할 수 있습니다.
의견은 IT동아(게임동아) 페이스북에서 덧글 또는 메신저로 남겨주세요.