로컬 AI 및 안전한 LLM 접근을 위한 두 오픈소스 프로젝트 공유 🚀
Sharing Two Open-Source Projects for Local AI & Secure LLM Access 🚀

TL;DR AI
2분핵심 요약
Quansloth는 공기격리된 프라이빗 AI 서버로 소비자 하드웨어에서 고급 KV 캐시 압축을 제공한다.
Gradio Python 프론트엔드와 최적화된 llama.cpp CUDA 백엔드를 연결한다.
GPU 크래시를 방지하고 대용량 컨텍스트를 지원하며, 6GB RTX 3060에서 32k+ 토큰 컨텍스트를 실행할 수 있는 작업을 처리한다(통상 24GB RTX 4090이 필요).
Google의 TurboQuant (ICLR 2026) 구현을 통해 16비트를 4비트로 압축해 약 75% VRAM 절약을 제공하며, C++ 엔진 로그를 가로채 실시간 VRAM 할당을 보고하는 실시간 분석 기능을 포함한다.
Context Injector는 긴 PDF를 채팅 스트림으로 직접 업로드하고, API2CHAT은 9KB 미만의 초경량 클라이언트로 브라우저 휘발성 메모리에서만 실행되며 서버 없이 GitHub Pages/S3/로컬에서 호스팅할 수 있고 파일을 서버에 업로드하지 않고 로컬에서 읽어 프롬프트에 주입한다.
