Open WebUI에서 다른 PC의 Local LLM 연결하기 (MLX & Ollama)

 

Open WebUI와 Local LLM을 서로 다른 컴퓨터에서 실행하면, 추론 전용 장비의 성능을 홈 네트워크에서 공유할 수 있습니다. 집에 사용 중인 컴퓨터를 활용해 구성해 보겠습니다.

이번 구성은 다음과 같습니다.

  • A 컴퓨터(debian server) : Open WebUI 실행
  • B 컴퓨터(Mac Studio) : MLX 또는 Ollama로 Local LLM 실행


1. B 컴퓨터의 IP 주소 확인

먼저 B 컴퓨터의 IP 주소를 확인합니다.

Wi-Fi 또는 기본 네트워크 인터페이스가 en0인 경우에는 다음 명령으로 확인할 수 있습니다.

ipconfig getifaddr en0

인터페이스 이름을 모른다면 다음 명령을 실행합니다.

networksetup -listallhardwareports

또는 모든 IP 주소를 확인할 수도 있습니다.

ifconfig | grep "inet "

예를 들어 B 컴퓨터의 IP가 아래와 같다고 가정합니다.

192.168.50.110

2. MLX에서 사용할 모델 검색

mlx_lm은 Hugging Face에 등록된 MLX Community 모델을 사용할 수 있습니다.

Hugging Face에서 다음과 같은 키워드로 검색하면 다양한 MLX 모델을 찾을 수 있습니다.

mlx-community Qwen
mlx-community Llama
mlx-community Gemma
mlx-community Mistral

예를 들어 다음과 같은 모델을 사용할 수 있습니다.

mlx-community/Qwen3-4B-Instruct-2507-4bit
mlx-community/Qwen3.6-27B-OBLITERATED-MLX-4bit
mlx-community/Mistral-7B-Instruct-v0.3-4bit

Apple Silicon에서는 일반적으로 4bit 양자화 모델을 사용하는 것이 메모리 사용량과 성능 측면에서 가장 효율적입니다.


3. MLX 모델 다운로드

mlx_lm은 별도의 다운로드 명령 없이 모델 ID만 지정하면 자동으로 다운로드합니다.

예를 들어 다음 명령을 실행하면 모델이 다운로드되고 바로 실행됩니다.

mlx_lm.generate \
  --model mlx-community/Qwen3-4B-Instruct-2507-4bit \
  --prompt "안녕하세요."

모델은 최초 한 번만 다운로드되며 이후에는 로컬 캐시를 사용합니다.

다운로드가 완료되면 대화형 테스트도 가능합니다.

mlx_lm.chat \
  --model mlx-community/Qwen3-4B-Instruct-2507-4bit

4. MLX API 서버 실행

모델이 정상적으로 동작하면 OpenAI 호환 API 서버를 실행합니다.

mlx_lm server \
  --model mlx-community/Qwen3.6-27B-OBLITERATED-MLX-4bit \
  --host 0.0.0.0 \
  --port 11434

--host 0.0.0.0 옵션을 지정해야 같은 네트워크의 다른 PC에서도 접속할 수 있습니다.

다른 PC(A 컴퓨터)에서 다음 명령으로 연결을 확인합니다.

curl http://192.168.50.110:11434/v1/models

정상적으로 모델 목록이 반환되면 준비가 완료된 것입니다.


5. Open WebUI 연결

Open WebUI에서 OpenAI Compatible API를 추가합니다.

설정은 다음과 같습니다.

Base URL

http://192.168.50.110:11434/v1

API Key

빈 값 또는 임의의 문자열

참고

mlx_lm server는 기본 포트가 Ollama와 동일한 11434일 수 있지만, 제공하는 API는 OpenAI Compatible API입니다.

따라서 Open WebUI에서는 Ollama Provider가 아닌 OpenAI Provider를 선택해야 합니다.

또한 Open WebUI에서 커스텀 모델을 생성할 경우에는 표시 이름(Display Name)실제 모델 ID를 구분해야 합니다.

예를 들어

표시 이름
mlx-local-llm

실제 모델 ID
mlx-community/Qwen3.6-27B-OBLITERATED-MLX-4bit

처럼 설정해야 합니다.

실제 모델 ID 대신 mlx-local-llm과 같은 표시 이름을 모델 ID로 사용하면 Hugging Face에서 존재하지 않는 모델을 찾으려 하면서 오류가 발생할 수 있습니다.


6. Ollama로 실행하는 경우

MLX 대신 Ollama를 사용하는 경우에는 다음과 같이 모델을 다운로드합니다.

ollama pull qwen3:8b

모델 실행 테스트

ollama run qwen3:8b

다른 PC에서 접근하려면 Ollama를 모든 네트워크 인터페이스에 바인딩해야 합니다.

macOS에서는

launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

을 실행한 후 Ollama를 다시 시작합니다.

또는 터미널에서 직접 실행할 수도 있습니다.

OLLAMA_HOST=0.0.0.0:11434 ollama serve

다른 PC에서 연결을 확인합니다.

curl http://192.168.50.110:11434/api/tags

Open WebUI에서는 다음과 같이 연결합니다.

Connection Type

Ollama

URL

http://192.168.50.110:11434

Ollama는 /api/* API를 사용하므로 URL 끝에 /v1을 붙이지 않습니다.


7. 연결 방식 비교

실행 방식 Open WebUI 연결 방식 URL
MLX (mlx_lm server) OpenAI Compatible API http://192.168.50.110:11434/v1
Ollama Ollama http://192.168.50.110:11434

같은 11434 포트를 사용하더라도 API가 서로 다르므로 연결 방식도 다릅니다.

또한 MLX와 Ollama를 동시에 실행하려면 둘 중 하나의 포트를 변경해야 합니다.


8. 사용 예시

이 구성을 사용하면 Open WebUI에서 Mac Studio의 Local LLM을 원격으로 사용할 수 있습니다.

활용 예시는 다음과 같습니다.

  • 코드 생성 및 코드 리뷰
  • 문서 요약
  • 번역
  • RAG 기반 질의응답
  • AI Agent의 추론 엔진
  • 여러 사용자가 하나의 Mac Studio를 공용 LLM 서버처럼 사용

Open WebUI와 추론 서버를 분리하면, 고성능 Mac Studio 한 대를 홈 네트워크의 공용 AI 서버처럼 운영할 수 있어 관리와 확장성이 훨씬 좋아집니다.


======




댓글 쓰기 · 수정

0 댓글