Open WebUI와 Local LLM을 서로 다른 컴퓨터에서 실행하면, 추론 전용 장비의 성능을 홈 네트워크에서 공유할 수 있습니다. 집에 사용 중인 컴퓨터를 활용해 구성해 보겠습니다.
이번 구성은 다음과 같습니다.
- A 컴퓨터(debian server) : Open WebUI 실행
- B 컴퓨터(Mac Studio) : MLX 또는 Ollama로 Local LLM 실행
1. B 컴퓨터의 IP 주소 확인
먼저 B 컴퓨터의 IP 주소를 확인합니다.
Wi-Fi 또는 기본 네트워크 인터페이스가 en0인 경우에는 다음 명령으로 확인할 수 있습니다.
ipconfig getifaddr en0인터페이스 이름을 모른다면 다음 명령을 실행합니다.
networksetup -listallhardwareports또는 모든 IP 주소를 확인할 수도 있습니다.
ifconfig | grep "inet "예를 들어 B 컴퓨터의 IP가 아래와 같다고 가정합니다.
192.168.50.1102. MLX에서 사용할 모델 검색
mlx_lm은 Hugging Face에 등록된 MLX Community 모델을 사용할 수 있습니다.
Hugging Face에서 다음과 같은 키워드로 검색하면 다양한 MLX 모델을 찾을 수 있습니다.
mlx-community Qwen
mlx-community Llama
mlx-community Gemma
mlx-community Mistral예를 들어 다음과 같은 모델을 사용할 수 있습니다.
mlx-community/Qwen3-4B-Instruct-2507-4bit
mlx-community/Qwen3.6-27B-OBLITERATED-MLX-4bit
mlx-community/Mistral-7B-Instruct-v0.3-4bitApple Silicon에서는 일반적으로 4bit 양자화 모델을 사용하는 것이 메모리 사용량과 성능 측면에서 가장 효율적입니다.
3. MLX 모델 다운로드
mlx_lm은 별도의 다운로드 명령 없이 모델 ID만 지정하면 자동으로 다운로드합니다.
예를 들어 다음 명령을 실행하면 모델이 다운로드되고 바로 실행됩니다.
mlx_lm.generate \
--model mlx-community/Qwen3-4B-Instruct-2507-4bit \
--prompt "안녕하세요."모델은 최초 한 번만 다운로드되며 이후에는 로컬 캐시를 사용합니다.
다운로드가 완료되면 대화형 테스트도 가능합니다.
mlx_lm.chat \
--model mlx-community/Qwen3-4B-Instruct-2507-4bit4. MLX API 서버 실행
모델이 정상적으로 동작하면 OpenAI 호환 API 서버를 실행합니다.
mlx_lm server \
--model mlx-community/Qwen3.6-27B-OBLITERATED-MLX-4bit \
--host 0.0.0.0 \
--port 11434--host 0.0.0.0 옵션을 지정해야 같은 네트워크의 다른 PC에서도 접속할 수 있습니다.
다른 PC(A 컴퓨터)에서 다음 명령으로 연결을 확인합니다.
curl http://192.168.50.110:11434/v1/models정상적으로 모델 목록이 반환되면 준비가 완료된 것입니다.
5. Open WebUI 연결
Open WebUI에서 OpenAI Compatible API를 추가합니다.
설정은 다음과 같습니다.
Base URL
http://192.168.50.110:11434/v1API Key
빈 값 또는 임의의 문자열참고
mlx_lm server는 기본 포트가 Ollama와 동일한 11434일 수 있지만, 제공하는 API는 OpenAI Compatible API입니다.따라서 Open WebUI에서는 Ollama Provider가 아닌 OpenAI Provider를 선택해야 합니다.
또한 Open WebUI에서 커스텀 모델을 생성할 경우에는 표시 이름(Display Name) 과 실제 모델 ID를 구분해야 합니다.
예를 들어
표시 이름
mlx-local-llm
실제 모델 ID
mlx-community/Qwen3.6-27B-OBLITERATED-MLX-4bit처럼 설정해야 합니다.
실제 모델 ID 대신 mlx-local-llm과 같은 표시 이름을 모델 ID로 사용하면 Hugging Face에서 존재하지 않는 모델을 찾으려 하면서 오류가 발생할 수 있습니다.
6. Ollama로 실행하는 경우
MLX 대신 Ollama를 사용하는 경우에는 다음과 같이 모델을 다운로드합니다.
ollama pull qwen3:8b모델 실행 테스트
ollama run qwen3:8b다른 PC에서 접근하려면 Ollama를 모든 네트워크 인터페이스에 바인딩해야 합니다.
macOS에서는
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"을 실행한 후 Ollama를 다시 시작합니다.
또는 터미널에서 직접 실행할 수도 있습니다.
OLLAMA_HOST=0.0.0.0:11434 ollama serve다른 PC에서 연결을 확인합니다.
curl http://192.168.50.110:11434/api/tagsOpen WebUI에서는 다음과 같이 연결합니다.
Connection Type
OllamaURL
http://192.168.50.110:11434Ollama는 /api/* API를 사용하므로 URL 끝에 /v1을 붙이지 않습니다.
7. 연결 방식 비교
| 실행 방식 | Open WebUI 연결 방식 | URL |
|---|---|---|
MLX (mlx_lm server) |
OpenAI Compatible API | http://192.168.50.110:11434/v1 |
| Ollama | Ollama | http://192.168.50.110:11434 |
같은 11434 포트를 사용하더라도 API가 서로 다르므로 연결 방식도 다릅니다.
또한 MLX와 Ollama를 동시에 실행하려면 둘 중 하나의 포트를 변경해야 합니다.
8. 사용 예시
이 구성을 사용하면 Open WebUI에서 Mac Studio의 Local LLM을 원격으로 사용할 수 있습니다.
활용 예시는 다음과 같습니다.
- 코드 생성 및 코드 리뷰
- 문서 요약
- 번역
- RAG 기반 질의응답
- AI Agent의 추론 엔진
- 여러 사용자가 하나의 Mac Studio를 공용 LLM 서버처럼 사용
Open WebUI와 추론 서버를 분리하면, 고성능 Mac Studio 한 대를 홈 네트워크의 공용 AI 서버처럼 운영할 수 있어 관리와 확장성이 훨씬 좋아집니다.
======
0 댓글