블로그

5분 이내 온프레미스 구축: 이제 온프레미스 배포에 Jina 임베딩 모델 사용 가능

순위 재지정기를 포함한 28개 모든 Jina AI 모델이 텔레메트리와 라이선스 서버 없이 즉시 배포 가능한 Docker 컨테이너로 제공됩니다. OpenAI, Cohere, Voyage AI 및 Elastic Inference Service API와 바로 호환됩니다.

28개의 모든 Jina AI 임베딩 및 순위 재지정 모델이 이제 jina-embeddings-v5-omni jina-reranker-v3를 포함하여 온프레미스 배포를 위한 완전한 오프라인 Docker 컨테이너로 제공됩니다. 하나를 다운로드하여 온프레미스 에어갭 또는 방화벽 시스템으로 전송하면 5분 이내에 로컬 추론이 실행됩니다. 컨테이너는 완전히 독립적이며 외부 연결이 이루어지지 않습니다. Hugging Face나 모델 레지스트리 호출도 발생하지 않습니다. 또한 라이선스 서버, 텔레메트리 또는 로깅 엔드포인트도 없습니다. 이는 규제 대상 산업, 데이터 주권 요구사항 또는 인터넷 액세스를 신뢰할 수 없거나 전혀 사용할 수 없는 환경에서 제3자 AI 서비스에 대한 의존성을 제거합니다. Jina 온프레미스는 Elastic Inference Service(EIS), OpenAI, Cohere, Voyage AI 및 Gemini API 스키마를 지원하므로 기존 애플리케이션이 코드 변경 없이 작동합니다.

가장 강력한 AI 모델이 웹 API를 통한 액세스로 원격 클라우드 설치 환경에서 실행되면 보안, 서비스 가용성 및 가격 안정성을 AI 서비스 제공업체에 맡겨야 합니다. 점점 더 강력하고 정교해지며 리소스 집약적인 AI 사용에 맞춰 신뢰성, 프라이버시, 관리 가능한 비용 및 우수한 데이터 거버넌스에 대한 타당한 요구사항을 조화시키기가 어렵습니다.

정부 규제, 법원 판결 및 타인의 이익을 고려한 비즈니스 결정으로 인해 최근 특정 서비스에 대한 액세스가 제한되는 결과가 발생했습니다. 다른 서비스로 전환할 수 있다 해도, AI 모델은 원하는 때에 언제든지 교체할 수 있는 구성 요소가 아닙니다. 시맨틱 임베딩을 사용하는 애플리케이션은 쿼리 작업 시점에도 데이터 수집 시점과 동일한 모델에 액세스할 수 있어야 합니다. 임베딩 모델에 액세스하지 못하면 검색 시스템이 중단됩니다.

AI 가격 모델은 이러한 위험을 가중시킵니다. 주요 AI 공급업체의 최근 재무 공시를 보면, 고객이 향후 가격 인상 가능성을 우려할 만한 충분한 이유가 있습니다. 예측할 수 없는 비용이 발생하는 제품에 대한 의존은 명확한 수익을 창출하지 못할 수 있는 자본 집약적인 AI 투자에 더 많은 위험을 더합니다.

Jina 온프레미스는 이러한 당면 과제에 대한 Elastic의 해답입니다.

온프레미스 AI가 필요한 대상

AI 모델의 로컬 호스팅 및 직접 제어는 다양한 기술적 요구 사항, 업계 요구 사항, 비즈니스 이해관계를 지원합니다.

로컬 설치는 AI 서비스 제공업체에 지불하는 비용을 줄여 주지만, 조직에 하드웨어 및 안정적인 액세스 비용 부담을 줍니다. 사용량에 따라 단순히 비용이 더 저렴할 수도 있습니다. 하지만 자체 AI 운영을 고려해야 하는 시급한 이유가 더 있습니다. 아래에 설명된 문제 중 하나라도 해당한다면 Jina 온프레미스와 같은 로컬 AI 솔루션을 고려해 보세요. 이 목록은 일부만 정리한 것입니다.

사용 사례

온프레미스를 선택해야 하는 이유

에어갭 / 높은 보안성

아웃바운드 데이터 전송 없음, 완전한 네트워크 격리

국방, 정보, 기밀 연구

규제 준수

데이터 주권, 국경 간 전송 또는 제3자 노출 없음

의료(건강보험의 양도 및 책임에 관한 법률[HIPAA]), 금융, EU 기업(일반 개인정보 보호법[GDPR])

지연 시간에 민감

네트워크 의존성 없음, 연결 실패를 허용하지 않음

로봇공학, 엣지 컴퓨팅, 차량, 선박

비용 예측 가능성

고정 인프라 비용 vs. 향후 요금이 불확실한 토큰당 요금제

대용량 연속 추론 워크로드

책임 감소

제3자 데이터 노출 없음, 법적 권한과 주의 의무 유지관리

법무법인, 정부 기관

에어갭 및 방화벽 시스템에 온프레미스 AI가 필요한 이유

에어갭 및 방화벽으로 보호된 시스템은 외부 AI API를 사용할 수 없습니다. Jina 온프레미스는 아웃바운드 연결 없이 전적으로 자체 인프라 내에서 실행됩니다.

특히 민감한 데이터를 관리하는 조직의 경우, 보안 및 프라이버시 고려 사항이 무엇보다 중요합니다. 보안 조치가 불충분하거나 외국 정부의 요구를 받을 수 있는 원격 제3자에게 민감한 데이터를 즉시 넘겨준다면, 해당 데이터를 보호하기 위해 투자해도 거의 소용이 없습니다.

민감한 데이터를 처리하는 조직의 직원은 안전한 데이터 처리에 대한 교육을 받는 경우가 많지만, 이들 모두 해당 데이터를 처리하는 동안 인터넷의 모든 페이지를 열 수 있는 웹 브라우저를 사용하고 있다면 이는 그다지 효과적이지 않습니다. 격리는 에어갭이나 매우 제한적인 방화벽을 통해 사용할 수 있는 가장 효과적인 보안 조치이지만, 이로 인해 어떤 종류의 외부 서비스든 사용하기가 어려워집니다.

지연 시간에 민감한 고가용성 시스템을 위한 온프레미스 AI

서비스형 소프트웨어와 클라우드 컴퓨팅은 자체 컴퓨터에서 접근성이 높고 신뢰할 수 있는 서비스를 제공하는 비용과 타인에게 문제를 아웃소싱하는 비용을 절충한 방식입니다. 하지만 가변적인 지연 시간, 중단, 그리고 문제가 발생했을 때 제어력을 완전히 상실하는 문제가 동반됩니다. AI 서비스도 예외는 아닙니다. 임베딩 모델에 액세스할 수 없을 때 검색 시스템이 오프라인 상태가 된다면, 더 이상 좋은 절충안으로 여겨지지 않을 것입니다.

또한, 외부 AI에 의존하는 것은 쉽게 예견하거나 관리할 수 없는 위험을 항상 수반합니다. 정치적 사건, 악천후 또는 해저 광케이블 위로 닻을 끄는 선박의 여파로 예고 없이 인터넷 액세스 및 네트워크 대기 시간이 저하될 수 있습니다. 정부는 수출 금지 조치를 활용하여 AI 모델에 대한 접근을 갑자기 차단할 수 있으며, 최근 실제로 그러한 사례가 발생했습니다. AI 서비스 제공업체는 최신 모델로의 전환을 유도하기 위해 때때로 기존 모델을 철수하기도 합니다. 외부 서비스의 유연성 및 관리 가능한 비용은 의존성에 따른 위험과 균형을 이루어야 합니다.

GDPR, HIPAA 및 데이터 주권 규정 준수를 위한 온프레미스 AI

개인 데이터를 수집하는 조직에는 점점 더 엄격한 규정이 적용되며, 관할권에 따라 종종 다르기도 하고 모순된 요구 사항이 있을 수도 있습니다. 특히, HIPAA 규칙은 미국 의료 제공자에게 매우 엄격한 데이터 보호를 부과하며, 캐나다, 유럽 연합많은 아시아 관할권의 강력한 일반 데이터 보호법은 개인정보를 다루는 모든 기업이 이를 안전하게 처리하고 다른 당사자 또는 다른 관할권으로 해당 데이터를 전송하는 것을 제한하도록 요구합니다. 이러한 규칙은 해당 관할권에 고객이 있는 경우 외국 기관에도 의무를 부과할 수 있습니다. 금융 기관은 한층 더 엄격한 규칙을 적용받는 경우가 많으며, 다른 형태의 범죄 활동으로부터 보호해야 하는 것과 마찬가지로 정보 보안에 대해 동일한 직접적 책임을 집니다.

규정 준수는 제3자 AI 서비스와 양립이 불가능할 수 있으며, 특히 해당 서비스를 사용할 때 국경 간 데이터 전송이 수반되는 경우 더욱 그러합니다.

또한 최근 사례에서 드러났듯이, 국제 클라우드 운영업체가 해외 정부의 압력을 받을 때 데이터 저장소의 물리적 위치를 제한하는 규칙은 신뢰할 수 있는 보호 출처가 되지 않을 수 있습니다. 현지 법률은 관할권 간에 충돌할 수 있으며, 이에 따라 현지 데이터 저장 및 처리가 필요하게 되어 제3자 서비스를 사용할 수 없게 될 수 있습니다. 어떤 경우에는 AI 시스템을 포함하여 프로세스의 모든 부분을 사내로 가져오는 것만이 유일한 솔루션입니다.

제3자 데이터 전송으로 인한 AI 책임 위험

데이터 보호법과 민감한 데이터에 대해 인정되는 주의 의무는 일상적으로 법적 책임에 영향을 미치며, 때로는 매우 심각한 영향을 미치기도 합니다. 여러분이 제3자 서비스 제공업체에서 데이터를 처리하는 데 대한 법적 책임을 질 수 있습니다. 법원과 법적 절차는 안전하지 않은 서비스 제공업체로부터 사후에 일부 보호 조치를 제공할 수 있지만, 그러한 구제책은 국가 안보 주체, 법 집행 기관 또는 범죄 해커를 대상으로는 이용 가능하지 않거나 일반적으로 효과적이지 않습니다.

정부와 관련해, 국경을 넘는 클라우드 서비스 제공업체가 민감한 국가 정보를 국외 행위자에게 공개한 사례가 이미 있습니다.

하지만 외국 정부나 해커에 대한 걱정이 없고 외부 AI 서비스 제공업체 자체가 안전하다고 하더라도, 단지 외부에 있다는 사실만으로도 법적 책임이 발생할 수 있습니다.

예를 들어 대부분의 관할권에서 변호사와 의뢰인의 의사소통은 특별한 법적 보호를 받으며, 법률 사무소는 이러한 정보를 기록하거나 저장할 때 엄격한 책임을 집니다. 미국에서 이러한 “변호사-의뢰인 특권”은 매우 유명하여 영화 및 TV 줄거리의 핵심 요소로 등장합니다. 그러나 이러한 특권을 상실하게 되는 원인 중 하나는 특권 대상이 아닌 사람과 정보를 주고받는 것이며, 최근 동향에 따르면 외부 AI 서비스 제공업체가 이에 해당할 수 있습니다.

적어도 미국에서는 인덱싱 서비스를 제공하는 임베딩 모델과 같이 인터넷 API를 통해 제3자 AI 서비스를 사용하는 것만으로도 중요한 기밀 유지 규정을 위반할 가능성이 있습니다. 법률 사무소는 보안 침해가 발생하지 않더라도 외부에 호스팅된 소프트웨어를 사용하는 것만으로도 소송을 당하거나, 징계를 받거나, 변호사 자격을 박탈당할 수 있습니다.

오프라인, 엣지, 물리적으로 격리된 시스템을 위한 온프레미스 AI

컴퓨터 시스템을 보안상의 이유로만 격리하는 것은 아닙니다. 예를 들어, 이동 중인 차량은 필수 기능을 위해 인터넷 액세스를 이용할 수 없습니다. 선박과 항공기에 있는 광범위한 온보드 컴퓨터 시스템은 인터넷 연결 없이 작동해야 하므로 외부 AI 서비스를 사용할 수 없습니다. 해상 플랫폼, 오지의 원격 시설, 북극, 남극, 글로벌 네트워크에 대한 적절한 물리적 연결이 없는 작은 섬의 컴퓨터 서비스는 모두 필요한 모든 서비스를 로컬에서 호스팅함으로써 이점을 얻는 설치 사례입니다. 엔터프라이즈 컴퓨팅에서 AI의 역할이 커짐에 따라 이러한 한계를 해결하는 것이 더욱 중요해집니다.

로봇 공학 및 기타 공간 제약적이거나 외부 세계에 초점을 맞춘 사용 사례(예: 물류 관리 시스템 또는 슈퍼마켓 계산대 등)와 같은 물리적 시스템에 AI를 새롭게 적용하는 경우 글로벌 인터넷에 연결될 수 있지만 연결 실패나 지연 시간 급증이 허용되지 않습니다. 작동을 위해 AI 시스템이 필요한 경우, 이 AI 시스템은 가능한 한 로컬 환경에서 작동하며 신뢰할 수 있어야 합니다.

온프레미스 AI가 필요하지 않은 경우

원격 소프트웨어 서비스와 오프사이트 AI에는 분명 이점이 있습니다. AI 모델을 실행하려면 악명 높게 수명이 짧고 전력 소비가 심한 고가의 프로세서가 필요할 수 있습니다. 시장 요인과 외부 경제 충격으로 인해 현재 고품질 하드웨어에 대한 접근이 특히 어렵습니다. 이러한 상황에서는 로컬 AI의 막대한 자본 비용을 지원하기보다 토큰 단위로 비용을 지불하여 외부 API를 사용하는 것이 합리적일 수 있습니다.

외부 API는 간헐적인 사용자에게 가장 적합합니다. 항상 온라인 상태를 유지해야 하는 검색 시스템을 운영하기보다 주로 분석을 위해 데이터를 배치 처리하는 데 AI 모델을 사용하는 경우, 자본 집약적인 하드웨어 및 로컬 설치에 투자하는 것은 거의 의미가 없습니다.

또한, 신뢰성과 접근성을 위해 클라우드에 호스팅된 전자상거래 웹사이트와 같이 데이터 처리가 이미 클라우드 기반으로 이루어지는 경우, 동일한 클라우드 인프라에 위치한 AI 서비스를 사용하는 것이 자체 라이선스 AI 모델 배포를 도입하는 것보다 비용 대비 더 뛰어난 가치를 제공할 수 있습니다. 이미 클라우드 서비스 제공업체에 의존하고 있으므로 해당 업체의 AI 서비스에 의존한다고 해서 위험이 크게 증가하지는 않습니다.

사용 사례가 이러한 설명에 부합하는 경우, 요구 사항에 맞춰 EIS, AWS MarketplaceGoogle Cloud Platform에서 Jina AI 모델을 이용할 수 있습니다.

아래 표는 주요 고려 요소를 요약한 것입니다. 해답은 데이터, 인프라 및 사용 패턴에 따라 달라집니다.

요소

온프레미스 권장

클라우드 API 권장

사용 패턴

지속적 또는 대용량 추론

간헐적 또는 배치 처리

데이터 민감도

규제 대상, 주권 또는 기밀

국경 간 또는 제3자 제한 없음

네트워크 환경

에어갭, 방화벽 또는 불안정

안정적인 상시 접속 인터넷

기존 인프라

GPU 하드웨어를 소유하고 있거나 조달할 수 있음

이미 동일 위치에 배치된 AI와 함께 클라우드에 호스팅됨

비용 모델

고정 하드웨어 + 라이선스, 확장 시 예측 가능

토큰당, 낮은 초기 비용, 가변적인 장기 비용

지연 시간 허용 범위

없음(로보틱스, 엣지, 실시간)

네트워크 변동성 허용

운영 책임

팀에서 하드웨어 및 가용성 관리

제공업체가 하드웨어 및 업데이트를 관리, 사용자는 통합 관리

이전 섹션에서 강조된 문제 중 해당하는 사항을 고려하여, 특정 상황과 사용 사례에 비추어 비용과 이점을 고려해야 합니다. 비용 편익 분석은 시간이 지남에 따라 분명 변화할 것입니다. 단기적으로도 AI 산업의 미래나 하드웨어 가격은 예측할 수 없습니다.

Jina 온프레미스 소개

로컬 AI 서비스를 활용할 수 있는 사용자를 대상으로 Jina AI의 고성능 모델을 위한 완전한 독립형 설치 제품군인 Jina 온프레미스를 출시합니다.

Jina AI의 모델은 크기가 몇 배나 큰 임베딩 모델의 정확도에 비견되며, 컴퓨팅 비용, 메모리 공간 및 하드웨어 요구 사항을 줄여줍니다. 따라서 AI를 온프레미스에 유지하고자 하거나 유지해야 하는 사용자에게 이상적인 선택입니다. 상업용 라이선스는 모든 규모의 사용 사례에 맞게 확장 가능하고 비례하여 가격이 책정된 솔루션과 함께 제공됩니다.

Massive Multilingual Text Embedding Benchmark (MMTEB) leaderboard, as of July 8, 2026.

Jina 온프레미스가 지원하는 API 스키마

  • 로컬 설치를 위한 전체 종속성 컬렉션으로 제공되거나 몇 분 만에 설치하고 실행할 수 있는 Docker 컨테이너로 제공됩니다.

  • Jina 온프레미스 설치 환경에서는 외부 시스템을 호출하지 않습니다.

    • Hugging Face Hub나 어떠한 모델 레지스트리도 호출하지 않습니다(HF_HUB_OFFLINE=1 및 TRANSFORMERS_OFFLINE=1이 기본으로 포함됨).

    • 라이선스 서버가 없습니다.

    • 텔레메트리 또는 로깅 엔드포인트가 없습니다.

  • CPU 및 GPU 하드웨어를 모두 지원하며, GPU 자동 감지 기능을 제공합니다.

  • 최신 jina-embeddings-v5-omni 멀티모달 임베딩 모델 및 jina-reranker-v3를 포함하여 28개의 모든 Jina AI 모델을 사용할 수 있습니다.

  • Jina API, OpenAI, Cohere, Voyage AI, Gemini 등 표준 AI API 스키마를 통한 액세스가 제공됩니다. Jina 온프레미스는 이러한 스키마를 기반으로 구축된 애플리케이션을 위한 드롭인 솔루션입니다.

  • EIS에서 제공하는 모델을 드롭인 방식으로 대체할 수 있습니다. Jina 온프레미스는 에어갭 Elastic 배포와 직접 통합됩니다.

Jina AI 온프레미스 모델의 하드웨어 요구 사항

하드웨어 요구 사항은 Jina 모델마다 다릅니다. 아래 표는 GPU 설정을 사용하는 최신 모델에 대한 권장 사항을 보여줍니다. v5 임베딩 모델에는 A100이 권장되지만, NVIDIA L4 GPU보다 강력한 GPU는 필요하지 않습니다. 당사의 최신 임베딩 모델에는 현재 최소 8GB의 VRAM이 필요합니다.

모델

최소 VRAM

권장 GPU

jina-embeddings-v5-text-nano

2GB

T4 / L4

jina-embeddings-v5-text-small

3GB

L4 / A10G

jina-embeddings-v5-omni-small

8GB

L4 / A10G / A100

jina-reranker-v3

3GB

L4

jina-clip-v2

4GB

L4

jina-code-embeddings-1.5b

4GB

L4

ReaderLM-v2

4GB

L4

한 번에 둘 이상의 모델을 사용하는 경우 VRAM 요구 사항이 증가합니다. 자세한 내용은 사이징 및 하드웨어 페이지를 참조하세요.

Docker를 사용하여 Jina 온프레미스를 설치하는 방법

가장 빠르게 시작하는 방법은 Docker를 설치하고(아직 설치하지 않은 경우) Jina 온프레미스 빠른 시작 페이지의 지침을 따르는 것입니다.

28개의 모든 Jina 모델을 위한 사전 구성된 Docker 컨테이너가 있습니다. 하나를 다운로드하여 설치 대상에 전송하면 5분 이내에 Jina AI 모델을 실행할 수 있습니다.

멀티모달 또는 사용자 지정 빌드를 사용하거나 컨테이너 외부 설치를 위한 전체 의존성 세트를 다운로드하려면 번들링 가이드에 설명된 단계를 따르세요.

You’ll need a GitHub account and access token to download Jina On-Prem. To create a free account, go to https://github.com/signup. To generate or manage your access tokens, follow the instructions in the GitHub documentation.

Jina 온프레미스 설치는 모든 Jina API 및 EIS 기능과 OpenAI, Cohere, Voyage AI 및 Gemini API를 통한 임베딩 생성을 지원하므로 표준 인터페이스를 사용하여 기존 애플리케이션에 통합할 수 있습니다. 자세한 내용은 API 문서를 참조하세요.

Jina 온프레미스와 함께 설치된 모델을 포함한 Jina 모델은 다양한 라이선스 조건으로 제공되며, 최신 모델은 CC BY-NC 4.0 라이선스에 따라 비상업적 용도로 무료로 사용할 수 있습니다. 상업적 용도로 Jina 온프레미스 라이선스를 이용하려면 Elastic 영업팀에 문의해 주시기 바랍니다.

관련 콘텐츠

모든 미디어, 단 하나의 인덱스: jina-embeddings-v5-omni

Scott Martens

Gemini Enterprise Agent Platform Model Garden에서 Jina Embeddings v3를 사용할 수 있습니다

Sa Zhang

Elasticsearch와 Jina 임베딩을 활용한 비지도형 문서 클러스터링

Matthew Adams

jina-embeddings-v5-text: 검색 및 지능형 애플리케이션을 위한 컴팩트한 최신 텍스트 임베딩

Scott Martens

Jina 모델, 그 기능 및 Elasticsearch에서의 사용에 대한 소개

Scott Martens

최첨단 검색 환경을 구축할 준비가 되셨나요?

충분히 고급화된 검색은 한 사람의 노력만으로는 달성할 수 없습니다. Elasticsearch는 여러분과 마찬가지로 검색에 대한 열정을 가진 데이터 과학자, ML 운영팀, 엔지니어 등 많은 사람들이 지원합니다. 서로 연결하고 협력하여 원하는 결과를 얻을 수 있는 마법 같은 검색 환경을 구축해 보세요.

직접 사용해 보세요