오픈소스 VoiceStudio 로컬에서 쓰는 법 오픈소스 VoiceStudio(debpalash/VoiceStudio) Electron v0.5.6을 로컬에 설치해 음성 클론·더빙·MCP까지 쓰는 검색 가이드다. 공식 README·install/MCP 문서 기준으로 원라이너·Docker·Gatekeeper·Intel Mac 한계까지 정리했다.
오픈소스 HyperFrames 쓰는 법 HeyGen 오픈소스 HyperFrames는 HTML·CSS·미디어로 영상을 정의하고 deterministic MP4로 렌더하는 CLI·에이전트 스킬 툴이다. Node 22+·FFmpeg 설치부터 skills/init·preview·render·doctor까지 공식 문서 기준으로 따라가는 검색형 가이드다.
오픈소스 화면을 로컬에서 쓴다: Thesys가 OUI-1을 연 이유 Thesys가 DiffusionGemma 파인튜닝작 OUI-1(26B·활성 4B)을 공개했다. openui-lang으로 화면을 쓰고 Generative UI Benchmark 71.7%(베이스 13.0%)를 찍으며, FP8로 소비자 GPU 로컬 서빙을 노린다.
멀티모달 타워를 하나만: H Company가 NeoMME를 연 이유 H Company가 NeoMME 260M/800M 단일 타워 멀티모달 인코더를 Apache 2.0으로 공개했다. 비전 타워 없이 텍스트·이미지 패치를 한 Transformer에 태우고, Retriever는 ViDoRe v3에서 소형 파레토를 노린다.
오픈소스 네 스텝으로 줄인다: inclusionAI가 LLaDA-Image-Turbo를 연 이유 2026년 9월 4일 inclusionAI가 LLaDA-Image Base(50스텝)와 Twin-DMD Turbo(4스텝)를 HF·GitHub에 조용히 공개했다. 약 6B 패밀리가 생성·편집을 한 체크포인트로 묶고 Qwen-Image-Bench 오픈소스 SOTA(53.53 EN / 53.38 ZH)를 주장한다. 학습 코드는 coming soon, 라이선스는 Apache-2.0.
Google 실시간과 파일은 갈린다: Gemini 3.5 Transcribe가 두 엔드포인트인 이유 구글이 2026년 8월 26일 공개한 Gemini 3.5 Transcribe는 하나의 STT 모델이 아니라 Live API와 파일(배치) API, 두 엔드포인트로 나뉜다. 실시간은 지연을 위해 화자 분리·단어 타임스탬프를 포기하고, 배치는 그 반대라서 제품 설계부터 갈라진다.
AI 뉴스 다시 학습하지 않는다: DeepMind가 트랜스포머에 되먹임을 넣은 이유 Google DeepMind와 UT Austin은 기성 Gemma 3 가중치를 건드리지 않고, 깊은 층 활성화를 얕은 층으로 되먹이는 재순환을 올렸다. 적응형은 퍼플렉서티를 평균 23% 낮추고 GSM8k 정확도를 21% 올렸다고 초록은 적으며, 생성 지연은 거의 그대로다.
AI 뉴스 실험대를 돌린다: Claude가 오픈소스 단백질 스택을 맡은 이유 Anthropic은 8월 18일, Claude가 단백질 모델을 발명하지 않고 오픈소스 스택을 돌려 15개 표적 중 14개에서 바인더를 냈다고 밝혔다. 히트율 22–35%는 업계 전형 10–15%를 웃돌지만, 숫자는 회사 보고서이고 독립 심사는 아직 없다.
Google 31B가 400B를 따라잡다: Gemma 4가 다시 그린 오픈소스 AI 지도 Google DeepMind의 Gemma 4 31B Dense 모델이 400B 클로즈드 모델을 추월했다. AIME 89.2% 달성으로 오픈소스 AI의 프론티어 추격이 수치로 증명됐다.