· TongFlow Team · Announcements · 13 min read
TongFlow가 클라우드로 — v0.1.8 이후 달라진 모든 것
데스크톱 앱은 10 MB 껍데기가 되고, 캔버스는 클라우드에서 돌아갑니다. Meta의 SAM과 Sapiens2가 합류했고, 음악은 버튼 하나에서 여섯 개 노드로 늘었습니다. 공식 플러그인은 37개. v0.1.9부터 v0.2.1까지 정리했습니다.
지난 정리는 v0.1.8에서 끝났습니다. 그 뒤로 가장 크게 바뀐 건 특정 모델이 아니라 TongFlow를 실행하는 방식입니다. 데스크톱 앱은 얇은 껍데기가 되었고, 캔버스는 클라우드로 옮겨갔습니다. 그 아래에서 카탈로그도 계속 자랐습니다. Meta의 SAM과 Sapiens2, 음악 작업대 한 벌, 그리고 API 키 하나를 수십 개 모델로 넓혀 주는 노드별 모델 선택까지요.
TongFlow가 처음이신가요? 모든 AI 모델이 무한 캔버스 위의 노드가 되는 오픈소스 멀티모달 GenAI 워크플로 스튜디오입니다. 전체 그림은 소개 글부터 보시면 됩니다.
이제 캔버스는 클라우드에서 돌아갑니다
v0.2.0에서 데스크톱 앱이 클라우드 스튜디오로 바뀌었습니다. app.tongflow.com에서 Google 또는 WeChat으로 로그인하면 바로 캔버스가 열립니다. 플러그인과 실행은 클라우드가 맡으니, 내 컴퓨터에 Python 런타임을 깔 일도 가중치를 내려받을 일도 없습니다.
설치 파일은 여전히 Releases 페이지에 있지만 내용물이 달라졌습니다. 클라우드 스튜디오를 띄우는 약 10 MB짜리 Pake(Tauri) 셸이고, 산출물은 TongFlow-mac-universal.dmg(애플 실리콘과 인텔 통합)와 TongFlow-win-x64.msi입니다. Next.js 서버와 SQLite, Python 플러그인 런타임을 함께 담아 200 MB에 달하던 기존 Electron 앱은 더 이상 배포하지 않습니다. 이미 설치해 두셨다면 그대로 쓰실 수 있고, 별도 업데이트는 내려가지 않습니다.
계정 없이 완전히 로컬로 쓰는 TongFlow가 사라진 건 아닙니다. 그게 셀프호스팅입니다. 코어는 여전히 GitHub의 AGPL-3.0이고, pnpm start:prod나 Docker로 그대로 돌아가며, 비용도 들지 않습니다.
클라우드 가격은 월 $2.99입니다. 새 계정은 카드 없이 7일 동안 전체 기능을 쓸 수 있고, 이후 카드를 등록하면 7일 무료 체험이 시작됩니다. 체험이 끝나면 월 $2.99이며 언제든 해지할 수 있습니다. 저희는 연산 자원이나 크레딧을 팔지 않습니다. 모델 제공사 키는 직접 쓰시고, 요금도 제공사 가격 그대로 제공사에 내시면 됩니다. Modal 무료 한도에는 매달 실제 GPU 시간이 포함되어 있어서, 연산 비용은 $0에서 시작하는 경우도 많습니다.
Meta SAM 4종
Meta의 Segment Anything 계열을 바탕으로 한 공식 Modal 플러그인 네 개가 추가됐습니다. 모두 게이트가 걸린 가중치라 Hugging Face 토큰이 필요합니다.
- SAM 3(
tongflow-modal-sam3) — 텍스트로 누끼 따기. 개념을 말로 설명하면 이미지 속 해당 대상 전부를 잘라내고, 영상에서는 추적합니다. - SAM Audio(
tongflow-modal-sam-audio) — 텍스트로 소리 분리. 노이즈 제거, 보컬 분리, 자유 문장으로 지정하는 스템 추출. 노이즈 제거·트랙 분리 노드의 첫 공식 구현입니다. - SAM 3D Objects(
tongflow-modal-sam-3d-objects) — 이미지 한 장에서 3D 가우시안 스플랫으로. - SAM 3D Body(
tongflow-modal-sam-3d-body) — 이미지 한 장에서 전신 인체 메시로.
Meta Sapiens2, 그리고 영상 모션 캡처
v0.2.1에서는 Sapiens2-1B 체크포인트를 쓰는 노드 다섯 개가 늘었습니다. 전부 Modal L40S 한 장에서 돌아갑니다.
- 자세 검출 — 전신 308개 키포인트(몸·손·얼굴)를 검은 배경 위에.
- 신체 부위 분할 — 29개 클래스 인체 파싱을 클래스 색상 맵 그대로.
- 표면 노멀 — 픽셀 단위 노멀 맵, 배경은 마스킹.
- 인물 매팅 — 스트레이트 알파 투명 PNG.
- 이미지 → 3D에 Sapiens2 pointmap 구현이 추가됐습니다. 색이 입혀진 인체 포인트 클라우드를 GLB로 돌려줍니다.
핵심은 영상 모션 캡처입니다. 단안 영상을 넣으면 Meta의 MHR 리그(Momentum Human Rig, Apache-2.0)에 얹힌 애니메이션 3D 인체 GLB가 나옵니다. 모델 노드에서 바로 재생되고, Blender에는 스키닝된 아마추어로 들어갑니다. 같은 노드를 성격이 정반대인 두 플러그인이 구현합니다. sam-3d-body는 학습된 사전지식으로 프레임마다 MHR을 회귀하고(몸·손, 얼굴 채널은 실험 단계), sapiens2는 기하 파이프라인으로 풉니다(308 키포인트 자세 + pointmap 3D 리프트, One-Euro 스무딩, 화면 밖으로 나간 부위는 레스트 포즈 유지). 노드는 하나, 엔진은 둘, 소재에 맞춰 고르시면 됩니다.
애니메이션이 생겼으니 볼 방법도 필요합니다. 모델 노드는 이제 애니메이션 클립을 자동 재생하고(30 fps 상한, 화면 밖이나 백그라운드 탭에서는 일시정지) 재생/일시정지 버튼도 붙었습니다. 초기 카메라도 모델 정면으로 돌아가 화면에 꽉 차게 잡습니다.
음악은 작업대가 됐습니다
새로 만든 tongflow-modal-ace-step 플러그인(ACE-Step 1.5)으로 음악은 생성 버튼 하나에서 노드 여섯 개로 늘었습니다.
- 구간 다시 만들기 — 고른 구간만 다시 생성합니다.
- 커버 — 설명이나 참조 곡으로 스타일을 바꿉니다.
- 스템 추출 — 12가지 스템(보컬, 드럼, 베이스, 기타…) 중 하나를 뽑아냅니다.
- 트랙 추가 — 기존 믹스 위에 새 스템을 얹습니다.
- 편곡 완성 — 빠진 파트를 채웁니다.
- 음악 기획서 — 한 문장 아이디어에서 가사, 스타일 태그, BPM, 조성, 길이까지.
기본 모델은 공식 최고 품질 버전인 xl-sft로 바뀌었고, 노드마다 모델 드롭다운이 있어 xl-base나 xl-turbo로 바꿀 수도 있습니다. 음악 노드에는 이미 v0.1.13에서 선택형 참조 오디오 입력이 붙었습니다. 오디오 노드를 연결하면 ACE-Step은 스타일 조건으로, LeVo는 멜로디 프롬프트로 씁니다.
옆에서 두 가지 능력도 함께 자리 잡았습니다. 오디오 이해(audio-describe) — 클립을 고르고 설명을 누르면 장르, 분위기, 악기, 보컬, 사건을 자연스러운 말로 돌려줍니다(Gemini, OpenAI, Agnes, Gemma 4가 구현). 그리고 열린 어휘 소리 분리 — 찾고 싶은 소리를 자유 문장으로 적으면 한 번의 추론으로 대상 소리와 나머지 소리를 함께 돌려주는 새 노드입니다(SAM Audio 기반).
키 하나로 여러 모델
- APIMart(
tongflow-api-apimart) — 키 하나로 7개 노드, 46개 모델. 이미지 생성·편집(Z-Image-Turbo, Seedream, Nano Banana Pro, GPT-Image, Imagen 4.0, Qwen Image 2.0, Grok Imagine), 텍스트·이미지 → 영상(Kling v3, VEO3.1, Sora 2, Seedance 2.0), 텍스트 생성, Whisper 전사, TTS까지. - Agnes AI(
tongflow-api-agnes) — 키 하나로 12개 노드. 텍스트 생성·분할·결합, 이미지 이해, 이미지 생성·편집, 다중 이미지 합성, 비동기 텍스트/이미지/첫·끝 프레임 → 영상. - SenseNova-Vision(
tongflow-modal-sensenova-vision) — 5개 노드에 걸친 통합 비전 모델. 표면 노멀과 매팅을 사람 밖으로 넓힌 첫 구현이기도 합니다(장면 전체 노멀, 주요 객체 매팅). - LeVo와 Boogu-Image도 공식 카탈로그에 합류했습니다.
이걸 돌아가게 하려면 계약에도 손이 필요했습니다. 노드별 모델 선택입니다. 라우터형 플러그인이 자기 모델 목록을 선언하면, 노드에는 플러그인 선택기 옆에 모델 드롭다운이 생깁니다. 이 선택값은 pluginId와 마찬가지로 최상위 값으로 태스크 생성, 데이터베이스, 플러그인 엔벨로프, 워크플로 내보내기까지 그대로 흘러갑니다. 모델을 선언하지 않은 플러그인은 예전과 똑같이 동작합니다.
작지만 체감되는 변화들
- 50 MB 업로드 제한이 없어졌습니다 — 큰 미디어도 바로 캔버스로.
- 업로드 실패가 조용히 넘어가지 않습니다 — 파일별 오류를 표시합니다.
- 플러그인 카드에 ID 대신 실제 이름과 설명, 아이콘이 표시됩니다.
- 한국어 UI가 영어·중국어·일본어에 이어 추가됐습니다.
- 노드 프롬프트 입력창은 일정 높이에서 스크롤되어, 노드가 끝없이 늘어나지 않습니다.
- 실행 중인 노드를 취소할 수 있고, 플러그인 삭제도 가능해졌습니다.
- 사내 프록시·사설 CA 환경에서도 플러그인이 설치됩니다 — OS 신뢰 저장소를 함께 보므로
unable to verify the first certificate오류가 나지 않습니다. - Gemini 플러그인이 다시 기본 설정 그대로 동작합니다 — Google이
gemini-2.0-flash를 내리면서 기본 모델을 올렸습니다. - 다중 이미지 → 영상은 이미지 한 장으로도 실행되고, 워크플로를 불러오면 화면이 다시 맞춰집니다.
지금까지의 결과
공식 플러그인 37개, 계약에 정의된 능력 노드 61개 — 텍스트, 이미지, 영상, 오디오, 음악, 3D, 문서, 웹. 전부 캔버스에 올려 다음 노드로 이어 붙일 수 있는 조각입니다.
설치 없이 바로 써 보시려면 app.tongflow.com에서 로그인하시고, 모든 걸 내 컴퓨터에 두고 싶으시면 GitHub에서 셀프호스팅하세요. 스타는 다른 분들이 이 프로젝트를 찾는 데 도움이 되고, 버그 제보와 아이디어, 작업물은 모두 Discord에 모입니다.
더 많은 모델, 더 많은 모달리티, 더 많은 조합 — 계속 만들어 봅시다.

