Fish Audio, 5,200만 달러 시드 투자 유치…AI 음성 제품 확장 추진

Fish Audio의 5,200만 달러 시드 투자와 이용자 800만 명을 알리는 공식 이미지
Fish Audio는 창업 1주년에 5,200만 달러 시드 투자와 이용자 800만 명을 발표했다. 이미지: Fish Audio.

미국 팰로앨토의 AI 음성 스타트업 Fish Audio가 5,200만 달러 규모 시드 투자를 유치했다. Coreline Ventures와 Capital Today가 공동 주도했고 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphaist Partners 등이 참여했다. Fish Audio는 투자금을 최신 텍스트 음성 변환 모델 S2.1 Pro와 기업용 API 고도화에 투입하고, 음성 이해 모델과 음성 대 음성 모델로 제품 범위를 넓힐 계획이다.

S2.1 Pro를 앞세운 5,200만 달러 시드

이번 라운드의 기업가치는 공개되지 않았다. Fish Audio는 창업 1년 만에 팀을 3명에서 22명으로 늘렸고 연간 반복 매출 2,100만 달러, 이용자 800만 명, 커뮤니티 음성 모델 200만 개를 확보했다고 밝혔다. 개발자와 기업 고객에서 전체 매출의 3분의 2가 나온다는 설명도 덧붙였다.

투자의 중심에는 최신 상용 TTS 모델 S2.1 Pro와 기업용 API가 있다. S2.1 Pro는 짧은 참조 음성으로 목소리를 복제하고 문장 안의 감정과 억양을 조절하는 모델이다. 회사는 투자금으로 개발자 도구와 기업 영업을 확대하고, 음성 입력을 이해하는 Audio LM과 입력 음성에서 바로 출력 음성을 만드는 음성 대 음성 모델을 개발할 계획이다. 기존 텍스트 음성 변환에서 음성 처리 전 과정으로 제품 범위를 넓히려는 투자다.

S2.1 Pro, 5초 음성으로 목소리 복제

최신 상용 모델 S2.1 Pro의 핵심은 음성 복제와 표현 제어다. Fish Audio는 5초 분량의 음성만으로 목소리를 복제하고, 83개 언어에서 감정과 억양, 속도를 단어 단위 자연어 지시로 조절할 수 있다고 설명한다. 웃음, 속삭임, 한숨과 같은 표현을 문장 안에 태그로 넣을 수 있으며, 회사가 밝힌 자연어 제어 표현은 1만 5천 개 이상이다. 이런 기능은 게임 캐릭터와 영상 더빙, 오디오북뿐 아니라 통화형 AI 에이전트에서도 활용할 수 있다.

S2.1 Pro는 Fish Audio의 호스팅 API로 제공된다. API 기본 요금은 입력 100만 UTF-8 바이트당 15달러다. Fish Audio는 이를 영어 약 18만 단어 또는 음성 약 12시간 분량으로 설명한다. 투자 발표를 기념해 8월 말까지 API를 무료로 제공한다. 별도로 공개한 이전 세대 S2 Pro는 모델 가중치와 미세조정 코드, 추론 엔진을 내려받을 수 있다. Fish Audio Research License는 연구와 비상업 이용만 무료로 허용하며, 회사도 이를 오픈소스 정의에 맞는 오픈소스가 아니라 공개 가중치 모델이라고 설명한다.

Fish Audio의 공동창업자 겸 최고과학자 Shijia Liao는 NVIDIA 연구 엔지니어로 일할 때 개인 프로젝트 Fish Speech를 만들었다. 그는 기존 합성 음성이 문장은 읽어도 감정과 연기를 충분히 표현하지 못한다고 보고 침실의 RTX 4090 한 장으로 초기 모델을 학습했다. 이후 Fish Audio 공동창업자 겸 최고경영자 Rissa Cao와 회사를 세웠고, 지난 1년 동안 텍스트 음성 변환 모델 4개와 음성 인식 모델 1개를 출시했다.

실내 의자에 나란히 앉은 Fish Audio 공동창업자 두 명
Fish Audio가 창업 1주년 투자 발표 글에 공개한 공동창업자 사진이다. 이미지: Fish Audio.

기본 음성 16위, 투자 근거는 API 사업과 확장성

Fish Audio는 투자 발표에서 S2.1 Pro를 Cartesia보다 두 배 빠르고 ElevenLabs 비용의 6분의 1인 모델로 소개했다. 두 수치는 각각 H200 내부 생성 속도와 회사가 비교한 API 비용을 가리킨다. 아래 Artificial Analysis 순위는 사용자의 음성 선호도와 공통 단위로 환산한 표시 가격을 다루므로 평가 기준이 다르다.

Artificial Analysis의 7월 29일 업체 제공 음성 전체 순위에서 1위는 SpeechifyAI Simba 3.2, 2위는 Alibaba Qwen-Audio-3.0-TTS-Plus, 3위는 Google Gemini 3.1 Flash TTS였다. Cartesia Sonic 3.5는 Elo 1,202로 5위, Eleven v3는 1,173으로 11위, Fish Audio S2.1 Pro는 1,138로 16위였다. 이 순위는 공개 가중치 여부와 관계없이 평가 대상인 사용량 기반 TTS API를 함께 보여준다. S2.1 Pro는 호스팅 상용 모델이며, 앞서 가중치를 공개한 S2 Pro와는 다른 모델이다.

Artificial Analysis 업체 제공 음성 전체 순위 1위부터 16위까지 정리하고 Cartesia 5위, ElevenLabs 11위, Fish Audio 16위를 강조한 그래픽
Artificial Analysis 업체 제공 음성 전체 순위 상위 16개다. Cartesia는 5위, ElevenLabs는 11위, Fish Audio는 16위였다. 2026년 7월 29일 확인.

세 모델의 입력 100만 문자당 표시 가격은 S2.1 Pro 15달러, Cartesia Sonic 3.5 49달러, Eleven v3 100달러였다. Fish Audio의 실제 과금 단위는 문자가 아니라 UTF-8 바이트다. 영문 ASCII 입력은 문자 수와 바이트 수가 같지만 한국어처럼 한 글자가 여러 바이트인 입력은 같은 글자 수라도 비용이 달라진다.

Fish Audio, Cartesia, ElevenLabs의 대표 TTS 모델 비교
회사와 모델 주요 경쟁 축 업체 제공 음성 Elo와 순위 Artificial Analysis 표시 가격
Fish Audio S2.1 Pro 표현 제어, 음성 클로닝, S2 계열 공개 가중치 생태계 1,138, 16위 100만 문자당 15달러 표시, 실제 과금은 100만 UTF-8 바이트당 15달러
Cartesia Sonic 3.5 실시간 음성 에이전트, 저지연 TTS 1,202, 5위 100만 문자당 49달러
ElevenLabs Eleven v3 창작 도구, 더빙, API, 기업용 음성 에이전트 1,173, 11위 100만 문자당 100달러
Elo와 순위, 표시 가격은 Artificial Analysis의 2026년 7월 29일 업체 제공 음성 전체 순위 기준이다. Fish Audio의 실제 과금 단위는 입력 UTF-8 바이트다.

Artificial Analysis 방법론에 따르면 업체 제공 음성 평가는 미국과 영국 억양을 쓰는 남녀 음성 8개를 사용한다. 사용자가 복제한 음성의 닮은 정도와 단어 단위 표현 제어, 긴 문장의 일관성, 실제 통화 환경의 지연 시간은 평가 범위에 들어가지 않으며 언어별 순위도 따로 제공하지 않는다.

16위는 S2.1 Pro의 기본 음성이 이 조건에서 상위 모델보다 덜 선호됐다는 뜻이다. Fish Audio의 제품 차별점은 이 점수에 반영되지 않는 5초 음성 클로닝, 단어 단위 표현 제어, 83개 언어와 API 가격에 있다.

이번 5,200만 달러 투자의 맥락도 여기에 있다. Fish Audio는 연간 반복 매출 2,100만 달러와 이용자 800만 명을 공개했고, 전체 매출의 3분의 2가 개발자와 기업 고객에서 나온다고 밝혔다. 투자금은 음성 이해 모델과 음성 대 음성 모델, 기업용 API 확장에 투입한다. 투자 규모를 설명하는 것은 유료 API와 기업 수요에서 확인된 사업 기반, 음성 AI 전반으로 제품군을 넓힐 가능성이다.

최근 투자 단계로 보면 Fish Audio는 두 경쟁사보다 이르다. 실시간 음성 에이전트에 집중하는 Cartesia는 2025년 3월 Kleiner Perkins가 주도한 6,400만 달러 시리즈 A를 유치했다. ElevenLabs는 2026년 2월 Sequoia Capital 주도로 5억 달러 시리즈 D를 유치하면서 기업가치 110억 달러를 인정받았다. Fish Audio의 시드 투자액은 Cartesia의 시리즈 A 규모에 근접하며, 낮은 표시 가격과 표현 제어, S2 계열의 공개 가중치 연구 생태계로 차별화를 시도하는 성격이 강하다.

기업 시장과 음성 소유권이 성장 조건

기업 시장에서는 AI 아바타 업체 HeyGen과 통화 음성 개선 업체 Sanas를 고객으로 공개했다. 투자 이후에는 개발자 도구와 기업 영업을 늘리고 실시간 미디어 플랫폼 LiveKit, 통화형 AI 플랫폼 Retell과의 연동도 강화할 계획이다. 자체 모델만 제공하는 데서 그치지 않고 다른 서비스가 음성 기능을 쉽게 붙일 수 있는 API와 연동 체계를 넓히려는 전략이다.

음성 소유권 문제는 사업 확대의 위험 요인이다. TechCrunch는 일부 창작자의 목소리가 동의 없이 Fish Audio에 등록됐고 삭제 요청 처리도 늦었다는 주장을 전했다. Rissa Cao는 짧은 음성 샘플이나 계약서로 소유권을 증명하면 3분 안에 자동 삭제하도록 절차를 바꿨다고 설명했다. 그러나 이 절차는 권리자가 발견하고 신고하기 전까지 무단 업로드와 이용을 막지 못한다. 공동 주도 투자사 Coreline Ventures의 파트너 Osuke Honda도 동의와 투명성, 출처 표시, 쉬운 신고와 삭제, 수익 공유가 제품 안에 들어가야 커뮤니티 중심 모델이 지속될 수 있다고 지적했다.

Fish Audio의 투자 가치는 유료 API와 기업 고객을 확보한 음성 플랫폼, 음성 이해와 음성 대 음성 모델로 넓히는 제품 로드맵에 있다. S2.1 Pro의 기본 음성 16위는 최상위권과의 품질 격차를 보여주며, 5초 음성 클로닝과 표현 제어, API 가격, S2 계열의 공개 가중치 생태계는 Fish Audio가 경쟁하는 다른 축을 보여준다. 기업 시장 확대는 이런 제품 경쟁력과 함께 음성 등록 동의, 신속한 삭제와 수익 공유를 얼마나 안정적으로 운영하는지에 달려 있다.

원문 출처