본문으로 이동

Liquid Foundation Model

Conaonda Wiki

Liquid Foundation Model(LFM)은 Liquid AI가 엣지와 온디바이스 추론을 목표로 개발하는 파운데이션 모델 계열이다. LFM2와 LFM2.5 세대는 제한된 메모리와 CPU·모바일 환경에서도 실용적인 추론 속도를 내는 것을 중요한 설계 목표로 삼는다.

개요

LFM2 기술 보고서는 하드웨어 제약을 아키텍처 탐색 과정에 직접 반영하고, 짧은 범위의 gated convolution과 소수의 grouped-query attention 블록을 결합한 하이브리드 백본을 설명한다. 모든 토큰 관계를 attention만으로 처리하는 구조와 달리 로컬 패턴 처리는 계산량이 작은 연산으로 맡기고, 전역 정보 결합이 필요한 구간에 attention을 배치하는 접근이다.

2026년의 LFM2.5 계열은 230M급 초소형 모델부터 1.2B·2.6B dense 모델, 활성 파라미터를 줄인 MoE 모델, 비전-언어·오디오·인코더 모델까지 확장됐다. 따라서 LFM은 하나의 언어 모델 이름이라기보다 다양한 모달리티와 하드웨어 범위를 아우르는 모델 패밀리로 보는 것이 적절하다.

핵심 구조

LFM2의 핵심은 모든 계층을 동일한 Transformer 블록으로 구성하지 않는 하이브리드 설계다. Liquid AI는 gated short convolution과 grouped-query attention을 조합하고, 실제 엣지 하드웨어의 지연과 메모리 조건을 고려한 hardware-in-the-loop 탐색을 사용했다고 설명한다. 목표는 파라미터 수만 줄이는 것이 아니라 prefill과 decode 단계의 실제 장치 성능을 높이는 것이다.

LFM2.5에서는 이 기반 위에 instruction tuning, reasoning, tool calling, 구조화 추출 같은 업무별 후학습 모델이 제공된다. 배포 형식도 Hugging Face 체크포인트, GGUF, ONNX, MLX 등으로 확장되어 CPU, Apple Silicon, 브라우저 및 GPU 서버에서 서로 다른 실행 경로를 선택할 수 있다.

활용

LFM은 스마트폰 비서, 로컬 RAG, 구조화 데이터 추출, 번역, 장비 제어용 tool calling, 오프라인 문서 처리와 같은 엣지 응용에 적합하다. 대형 클라우드 모델을 항상 호출하기 어려운 환경에서는 작은 LFM을 빠른 로컬 판단기로 두고 필요한 경우에만 상위 모델이나 외부 서비스를 호출하는 계층형 구조도 가능하다.

비전·오디오 계열까지 함께 사용하면 텍스트 질의뿐 아니라 카메라 입력, 화면 이해, 음성 인터페이스를 하나의 장치 내부 파이프라인으로 구성할 수 있다. 이는 산업·국방·공공 분야의 폐쇄망 또는 저연결성 환경에서 특히 중요한 특성이다.

한계 및 주의점

작은 모델은 계산 비용이 낮지만 대형 프런티어 모델과 동일한 지식량이나 복합 추론 성능을 자동으로 제공하지 않는다. 실제 적용에서는 정확도, latency, 메모리, 전력, tool-call 성공률을 대상 장치와 데이터로 별도 측정해야 한다. 또한 “LFM”이라는 명칭 아래 모델별 기능과 컨텍스트 길이, 지원 런타임이 다르므로 버전을 명확히 기록해야 한다.

함께 보기

출처