오픈소스 CLM 로컬에서 돌리는 법 Contrastive Language Models(CLM, Contrastive-LM/CLM)를 로컬에서 vLLM Qwen3-8B pooling과 clm-serve로 띄워 typed 결정 API를 쓰는 검색 가이드다. 공식 README·PyPI 0.1.0 기준으로 설치·포트·2048 한도·클라이언트 예제까지 정리했다.
오픈소스 VoiceStudio 로컬에서 쓰는 법 오픈소스 VoiceStudio(debpalash/VoiceStudio) Electron v0.5.6을 로컬에 설치해 음성 클론·더빙·MCP까지 쓰는 검색 가이드다. 공식 README·install/MCP 문서 기준으로 원라이너·Docker·Gatekeeper·Intel Mac 한계까지 정리했다.
오픈소스 WeKnora 쓰는 법 텐센트 오픈소스 WeKnora(v0.8.0)를 Docker Compose로 올려 RAG 질의응답·ReAct 에이전트·Wiki Mode까지 쓰는 셀프호스팅 가이드다. 클론 후 .env만 맞추면 localhost UI와 8080 API로 바로 지식 베이스 Q&A를 시작할 수 있다.
로컬 AI colibri 로컬에서 돌리는 법 colibri는 pure C로 만든 MoE(전문가 혼합) 로컬 추론 엔진으로, 전문가 가중치를 디스크에서 스트리밍해 VRAM에 다 안 올라가는 대형 모델도 기존 PC에서 돌릴 수 있습니다. 이 글은 Releases 바이너리 또는 소스 빌드부터 coli chat·serve·web까지, 공식 README·Quick Start 기준으로 설치·실행 순서를 정리합니다.
오픈소스 nanobot 쓰는 법 HKUDS의 nanobot은 초경량 셀프호스트 개인 AI 에이전트(Python, PyPI nanobot-ai 0.3.5, MIT)다. 설치 후 nanobot webui로 Settings → Models에서 모델을 붙이고 Hello를 보내면 첫 경로가 끝난다.
로컬 AI NVIDIA PAIR 설치하는 법 NVIDIA Personal AI Router(PAIR)는 집 LAN의 머신에 로컬 추론 요청을 나눠 보내는 라우터다. v0.1.1 설치기부터 Ollama·LM Studio·Endpoints·PIN 페어링까지 공식 Getting Started만 따라가는 검색형 가이드다.
로컬 AI PI-Desktop 설치하는 법 vastsa/PI-Desktop은 로컬 프로젝트 위에서 AI 코딩 에이전트를 돌리는 데스크톱 워크스페이스다. GitHub Releases 바이너리(v0.14.6 기준)부터 모델 연결·Agent/Plan/Goal·macOS quarantine·Linux glibc까지 README만 따라가는 검색형 가이드다.
로컬 AI llmfit 쓰는 법 AlexsJones/llmfit은 CPU·RAM·GPU·VRAM을 읽고 내 머신에 맞는 오픈 LLM(양자화 포함)을 추천하는 Rust CLI/TUI다. 설치부터 recommend --json·serve API·벤치까지 README 기준으로만 따라가는 검색형 가이드다.
로컬 AI OUI-1 로컬에서 돌리는 법 vLLM≥0.24 FP8로 thesysdev/OUI-1을 올리면 가중치 25.8 GiB이고, OpenUI 블로그 기준 RTX 5090 소비자 GPU 경로가 열린다. openui-lang 화면을 로컬에서 쓰려면 서빙·시스템 프롬프트 CLI·파서·렌더러를 한 세트로 맞춰야 한다.
오픈소스 허가만 열어둔 2등: IBM이 PatchTST-FM-r2를 연 이유 IBM이 Granite Time Series PatchTST-FM-r2(~385M)를 Apache 2.0·OpenMDW 1.0 이중 라이선스로 공개했다. GIFT-Eval 제로샷에서 TimesFM-3 다음이고, 상업용 친화 라이선스 모델 중에서는 1등이다.
로컬 AI MiniCPM5-2B 로컬에서 돌리는 법 BF16 가중치 약 5.03GB, GGUF Q4_K_M 1.56GB로 노트북·서버에 MiniCPM5-2B를 올리는 공식 경로다. Ollama·vLLM·llama.cpp·SGLang 명령을 카드와 쿡북에서 옮겼고, 런타임 VRAM GiB는 문서에 없어 추정하지 않는다.
온디바이스 작아도 에이전트다: OpenBMB가 MiniCPM5-2B를 연 이유 OpenBMB가 MiniCPM5-2B(2.52B)를 Apache 2.0으로 조용히 열었다. 표준 Llama 구조에 도구·코딩·에이전트 후학습을 넣고, vLLM day-0과 UltraData까지 같이 풀렸다.
로컬 AI 유휴 PC를 묶는다: 엔비디아 PAIR가 집 안 추론을 나눈 이유 2026년 9월 3일 IFA에서 NVIDIA가 Personal AI Router(PAIR) 공개 베타를 풀었다. Ollama·LM Studio 앞에 앉는 가상 추론 라우터로, VRAM 풀이 아니라 독립 요청을 집 LAN 노드에 나눈다.
로컬 AI OpenMAIC 로컬에서 돌리는 법 Node.js 20.9.0 이상과 pnpm 10.28.0, LLM 프로바이더 하나만 있으면 클론부터 pnpm dev까지 공식 경로로 localhost:3000에서 OpenMAIC 교실을 켤다. 공식 문서에 OpenMAIC VRAM 숫자는 없다.
오픈소스 켜는 건 49B뿐이다: 텐센트가 Hy4를 770B로 연 이유 텐센트 혼원(Hunyuan)이 2026년 8월 28일 Hy4 preview를 Apache 2.0으로 공개했다. 총 파라미터 770B 중 토큰당 켜지는 건 49B이고, 컨텍스트는 100만 토큰을 넘긴다. 오픈웨이트 최상위권 경쟁이 ‘얼마나 큰가’가 아니라 ‘얼마나 적게 켜고도 생산성 작업을 버티는가’로 옮겨 간 신호다.
오픈소스 GLM-5.3-Flash 로컬에서 돌리는 법 로컬로 올리려면 FP8 가중치 약 306GiB를 받을 디스크와, 공식 카드에 없는 VRAM을 대신할 멀티 GPU 또는 양자화(GGUF) 경로가 필요하다. 가중치는 MIT로 Hugging Face zai-org/GLM-5.3-Flash에 풀려 있다.
Qwen 켜는 건 6B뿐이다: Qwen이 Flash-Next로 Qwen4를 먼저 연 이유 알리바바 Qwen 팀은 2026년 8월 26일 Qwen4를 받칠 아키텍처의 실험 미리보기 Qwen3.8-Flash-Next를 오픈 웨이트로 풀었다. 125B 중 실제로 켜지는 건 6B이고, 긴 컨텍스트 비용을 구조로 줄이겠다는 설계다.
오픈소스 희소 MoE를 건너뛰다: IBM이 Granite 4.2를 밀집 추론으로 낸 이유 2026년 8월 25일 IBM은 Granite 4.2를 3B·8B·30B 밀집 추론 모델로 Apache 2.0 공개했다. thinking 스위치와 8B·30B의 실제 샌드박스 에이전트 RL이 핵심이고, 같은 날 Speech 5.0 Turbo CTC(470M)도 나왔다.
AI 뉴스 큰 모델이 먼저 안 왔다: GLM-5.3-Flash가 MIT로 풀린 이유 어제 Hugging Face에 앉은 건 플래그십 GLM-5.3이 아니라 Flash다. 320B 중 18B만 켜고 MIT로 가중치가 풀렸고, 플래그십 행은 아직 GitHub 다운로드 표에 없다.
AI 뉴스 기본값이 바뀌었다: Hugging Face가 센 올해 오픈 모델 Hugging Face는 8월 14일 허브(1~7월) 센서스를 올렸다. 공개 모델은 243만에서 296만으로 늘었지만, 파생의 기본 베이스는 Qwen으로 옮겨 앉았다. 좋아요는 흥분을, 다운로드는 파이프라인을 센다.
Qwen 프론티어가 로컬로 내려오다: Qwen3.8-27B가 다시 쓴 배포의 공식 Alibaba Qwen 팀이 8월 14일 Apache 2.0으로 27B 밀집 멀티모달 모델 Qwen3.8-27B의 가중치를 공개했다. 독립 벤치마크에서 클라우드 전용 모델과 같은 점수대에 올라서며, 프론티어급 코딩·에이전트 작업이 더 이상 API 뒤에만 있지 않음을 보여줬다.