완전 관리형 Llama 모델


Llama 모델은 Gemini Enterprise Agent Platform에서 관리 API 및 자체 배포 모델로 사용할 수 있습니다. 대답을 스트리밍하여 최종 사용자의 지연 시간 인식을 줄일 수 있습니다. 스트리밍된 응답은 서버 전송 이벤트 (SSE)를 사용하여 응답을 점진적으로 스트리밍합니다.

관리형 Llama 모델

Llama 모델은 완전 관리형 서버리스 모델을 API로 제공합니다. Agent Platform에서 Llama 모델을 사용하려면 요청을 Agent Platform API 엔드포인트로 직접 보냅니다. Llama 모델을 관리형 API로 사용하는 경우 인프라를 프로비저닝하거나 관리할 필요가 없습니다.

Gemini Enterprise Agent Platform에서 사용할 수 있는 Llama 모델은 다음과 같습니다. Llama 모델에 액세스하려면 Model Garden 모델 카드로 이동합니다.

Llama 4 Maverick 17B-128E 코딩, 심층 추론, 정교한 채팅, 고정밀 이미지 이해에 최적화된 가장 크고 기능이 뛰어난 멀티모달 Llama 4 모델 (활성 170억 / 총 4, 000억 MoE)
Llama 4 Scout 17B-16E 긴 컨텍스트 검색, 문서 요약, 대규모 코드베이스 전반의 추론을 위한 최신 결과를 제공하는 고효율 MoE 모델 (170억 활성 / 1,090억 전체)입니다.
Llama 3.3 70B 텍스트 전용 애플리케이션에서 Llama 3.1 70B 및 Llama 3.2 90B에 비해 향상된 성능을 제공하는 텍스트 전용 70B 요청 사항 조정 모델입니다.

Llama 모델 사용

관리형 모델의 경우 다음 모델 이름을 사용하여 curl 명령어로 Gemini Enterprise Agent Platform 엔드포인트에 요청을 보낼 수 있습니다. Llama 모델에 스트리밍 및 비스트리밍 호출을 수행하는 방법을 알아보려면 개방형 모델 API 호출을 참고하세요.

자체 배포된 Gemini Enterprise Agent Platform 모델을 사용하려면 다음 단계를 따르세요.

  1. Model Garden 콘솔로 이동합니다.
  2. 관련 Gemini Enterprise Agent Platform 모델을 찾습니다.
  3. 사용 설정을 클릭하고 제공된 양식을 작성하여 필요한 상업적 사용 라이선스를 받습니다.

파트너 모델 배포 및 사용에 관한 자세한 내용은 파트너 모델 배포 및 예측 요청을 참고하세요.

다음 단계

Llama 모델 사용 방법 알아보기