Gemini Robotics ER

Gemini Robotics ER (embodied reasoning) modelleri, robotların fiziksel dünyayı algılamasına ve bu dünyayla etkileşime girmesine olanak tanıyan görme-dil modelleridir (VLMs). Görsel verileri yorumlar, uzamsal ve zamansal akıl yürütme yapar, çok adımlı görevleri planlar, robotları ve araçları yönetir.

Modeller

Gemini Robotics ER 2 modeli, Gemini Robotics'in en yeni modelidir. Bu, robotların çevrelerini tam olarak anlamalarını sağlayan güncellenmiş akıl yürütme modelimizdir. Robotların ajan tabanlı düzenlemesi (ör. VLA'lar kullanılarak), ilerleme durumunu anlama ve başarı tespiti dahil olmak üzere robot videolarını anlama, ölçüm cihazı okuma, işaret etme ve uzamsal akıl yürütme gibi somut akıl yürütme yetenekleri konusunda uzmanlaşmıştır.

Gemini Robotics ER 2 modeli iki model uç noktası sunar:

  • gemini-robotics-er-2-preview: Standart ER 2 modeli. Geliştirilmiş uzamsal akıl yürütme, video anı bulma, video ilerleme sınıflandırması, çoklu robot düzenleme ve çok adımlı araç kullanımı ile Gemini 3.5 Flash'ı temel alır.
  • gemini-robotics-er-2-streaming-preview: Live API kullanılarak gerçek zamanlı yayın için optimize edilmiştir. Sürekli ses ve video girişi işleyen düşük gecikmeli robot aracıları için bu modeli kullanın.

Gemini Robotics ER 1.6'nın desteği 31 Ağustos 2026'da sonlandırıldı. Hâlâ Gemini Robotics ER 1.6'yı kullanıyorsanız API çağrılarınızda model="gemini-robotics-er-1.6-preview" yerine model="gemini-robotics-er-2-preview" veya model="gemini-robotics-er-2-streaming-preview" yazarak Gemini Robotics ER 2'ye yükseltin.

Google AI Studio'da Gemini Robotics ER 2'yi deneyin

Robotik özellikleri

Gemini Robotics ER, bir dizi somut akıl yürütme özelliğini destekler. Daha fazla bilgi edinmek için bir özellik seçin:

Kapasite Açıklama Kılavuz
Uzamsal akıl yürütme Nesneleri işaretleyin, videoda takip edin, sınırlayıcı kutularla algılayın ve yörüngeleri planlayın. Uzamsal akıl yürütme
Ajan tabanlı vizyon Resim işleme araçlarından yararlanarak diğer özellikleri geliştirmek için kod yürütmeyi kullanın. Temsilci tabanlı vizyon
Görev düzenleme Uzun vadeli görevleri tamamlamak için uzamsal akıl yürütmeyi özel robot API'leriyle birleştirin. Görev düzenleme
Akış (yalnızca Gemini Robotics ER 2 Akış uç noktası) Düşük gecikmeli fonksiyon çağrısıyla anlık robot temsilciler için çift yönlü akış. Robotik için akış
Video ilerleme durumu (yalnızca Gemini Robotics ER 2) Sürekli video feed'lerinden anları bulma ve ilerleme sınıflandırması. Video anlama

Başlamadan önce

Gemini Robotics ER modelleri, Gemini Developer API aracılığıyla kullanılabilir. Başlamak için Google AI Studio veya Google Cloud Console'dan Gemini API anahtarı oluşturun ve ortamınızı ayarlayın.

Anahtar türleri, güvenlik ve anahtarınızı Python, JavaScript ve diğer dillerde yapılandırma hakkında ayrıntılı bilgi için Gemini API anahtarlarını kullanma başlıklı makaleyi inceleyin.

Başlarken

Aşağıdaki örnekte, bir resimdeki nesneler bulunur ve bunların normalleştirilmiş 2 boyutlu koordinatları ve etiketleri döndürülür. Bu çıkışı doğrudan bir robotik API'ye veya VLA modeline aktararak robot işlemleri oluşturabilirsiniz.

Python

from google import genai

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": ,
          "label": }, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

image_response = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "image",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": PROMPT}
    ],
    generation_config={"thinking_level": "high"},
)

print(image_response.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const PROMPT = `
  Point to no more than 10 items in the image. The label returned
  should be an identifying name for the object detected.
  The answer should follow the json format: [{"point": ,
  "label": }, ...]. The points are in [y, x] format
  normalized to 0-1000.
`;
const client = new GoogleGenAI();

const uploadedFile = await client.files.upload({ file: "my-image.png" });

const imageResponse = await client.interactions.create({
  model: "gemini-robotics-er-2-preview",
  input: [
    {
      type: "image",
      uri: uploadedFile.uri,
      mime_type: uploadedFile.mimeType,
    },
    { type: "text", text: PROMPT },
  ],
  generation_config: { thinking_level: "high" },
});

console.log(imageResponse.output_text);

Java

import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.Content;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.GenerationConfig;
import com.google.genai.gaos.models.interactions.ImageContent;
import com.google.genai.gaos.models.interactions.ImageContentMimeType;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.TextContent;
import com.google.genai.gaos.models.interactions.ThinkingLevel;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;
import com.google.genai.types.File;
import com.google.genai.types.UploadFileConfig;
import java.util.List;

Client client = new Client();

String prompt =
    "Point to no more than 10 items in the image. The label returned "
        + "should be an identifying name for the object detected. "
        + "The answer should follow the json format: [{\"point\": , "
        + "\"label\": }, ...]. The points are in [y, x] format "
        + "normalized to 0-1000.";

File uploadedFile =
    client.files.upload(
        new java.io.File("my-image.png"),
        UploadFileConfig.builder().mimeType("image/png").build());

Content imageContent =
    ImageContent.builder()
        .uri(uploadedFile.uri().orElse(""))
        .mimeType(ImageContentMimeType.of(uploadedFile.mimeType().orElse("image/png")))
        .build();
Content textContent = TextContent.builder().text(prompt).build();

CreateModelInteraction params =
    CreateModelInteraction.builder()
        .model(Model.of("gemini-robotics-er-2-preview"))
        .input(InteractionsInput.ofContent(List.of(imageContent, textContent)))
        .generationConfig(
            GenerationConfig.builder().thinkingLevel(ThinkingLevel.HIGH).build())
        .build();

Interaction imageResponse =
    client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();

System.out.println(imageResponse.outputText().orElse(""));

Go

package main

import (
    "context"
    "fmt"
    "log"

    "google.golang.org/genai"
    "google.golang.org/genai/interactions/models/interactions"
    "google.golang.org/genai/interactions/models/operations"
)

func main() {
    ctx := context.Background()
    client, err := genai.NewClient(ctx, nil)
    if err != nil {
        log.Fatal(err)
    }

    prompt := `Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": ,
"label": }, ...]. The points are in [y, x] format
normalized to 0-1000.`

    uploadedFile, err := client.Files.UploadFromPath(ctx, "my-image.png", &genai.UploadFileConfig{
        MIMEType: "image/png",
    })
    if err != nil {
        log.Fatal(err)
    }

    res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
        Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
            Model: interactions.Model("gemini-robotics-er-2-preview"),
            Input: interactions.NewInteractionsInput([]interactions.Content{
                interactions.NewContent(interactions.ImageContent{
                    URI:      genai.Ptr(uploadedFile.URI),
                    MimeType: genai.Ptr(interactions.ImageMimeTypeImagePng),
                }),
                interactions.NewContent(interactions.TextContent{
                    Text: prompt,
                }),
            }),
            GenerationConfig: &interactions.GenerationConfig{
                ThinkingLevel: interactions.ThinkingLevelHigh.ToPointer(),
            },
        }),
    })
    if err != nil {
        log.Fatal(err)
    }
    if res.Interaction.OutputText != nil {
        fmt.Println(*res.Interaction.OutputText)
    }
}

REST

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-robotics-er-2-preview",
    "input": {
      "parts": [
        {
          "inlineData": {
            "mimeType": "image/png",
            "data": "'"${IMAGE_BASE64}"'"
          }
        },
        {
          "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": }, ...]. The points are in [y, x] format normalized to 0-1000."
        }
      ]
    },
    "generation_config": {
      "thinking_config": {
        "thinking_level": "high"
      }
    }
  }'

Çıktı, her biri point (normalleştirilmiş [y, x] koordinatları) ve nesneyi tanımlayan bir label içeren nesnelerden oluşan bir JSON dizisi olacaktır.

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

Aşağıdaki resimde bu noktaların nasıl görüntülenebileceğine dair bir örnek verilmiştir:

Resimdeki nesnelerin noktalarını gösteren bir örnek

İşleyiş şekli

Gemini Robotics ER, doğal dil istemleriyle görüntü, video veya ses girişi alır. Nesneleri tanımlar, sahne bağlamı ve uzamsal ilişkiler hakkında akıl yürütür ve koordinatlar veya sınırlayıcı kutular gibi yapılandırılmış çıkışlar döndürür.

Gemini Robotics ER de temsilci tabanlıdır: Karmaşık görevleri alt görevlere ayırır ve robot işlevlerinizi çağırarak veya oluşturulan kodu çalıştırarak bunları yerine getirir. Örneğin, "elmaları kaseye koy" ifadesi bulma, kavrama ve yerleştirme adımlarından oluşan bir diziye dönüşür.

Gemini'ın araç çağrılarını nasıl yürüttüğü hakkında ayrıntılı bilgi için İşlev çağrısı bölümüne bakın.

Güvenlik

Gemini Robotics ER, güvenlik göz önünde bulundurularak üretilmiş olsa da robotun etrafında güvenli bir ortam sağlamak sizin sorumluluğunuzdadır. Üretken yapay zeka modelleri hata yapabilir ve fiziksel robotlar hasara neden olabilir. Daha fazla bilgi için Gemini Robotics güvenlik sayfasını ziyaret edin.

En iyi uygulamalar

  1. Sade ve doğal dil kullanın. Robottan yapmasını istediğiniz şeyi bir kişiye anlatır gibi açıklayın. Bir terim çalışmıyorsa yaygın bir eş anlamlıyı deneyin.

  2. Görsel girişi optimize edin. Resmi göndermeden önce küçük veya net olmayan nesneleri kırpın ya da yakınlaştırın. Işık ve düşük renk kontrastı algılamayı etkileyebilir.

  3. Karmaşık görevleri adımlara ayırın. Modelin odaklanmasını sağlamak ve doğruluğu artırmak için her adımı ayrı bir istem olarak gönderin.

  4. Yüksek hassasiyetli görevler için birden çok kez sorgu gönderin ve sonuçların ortalamasını alın. Bu fikir birliği yaklaşımı, mekansal çıkışlardaki varyansı azaltır.

Sınırlamalar

Gemini Robotics ER ile geliştirme yaparken aşağıdaki sınırlamaları göz önünde bulundurun:

  • API anahtarı kısıtlamaları: Gemini API, kısıtlanmamış API anahtarlarından gelen istekleri kabul etmez ve 403 Forbidden hatasını döndürür. AI Studio'da kısıtlamalar ekleyerek API anahtarınızı güvenli hale getirin. Ayrıntılı bilgi için Sınırsız API anahtarlarının güvenliğini sağlama başlıklı makaleyi inceleyin.
  • Gecikme süresi ve performans: Karmaşık sorgular, yüksek çözünürlüklü girişler veya yüksek düşünce seviyeleri, işleme sürelerinin artmasına neden olabilir. Düşünme seviyesi için gecikme ve performans arasında iyi bir denge sağlamak üzere orta seçeneğini kullanın.
  • Halüsinasyonlar: Tüm büyük dil modelleri gibi Gemini Robotics ER modelleri de zaman zaman "halüsinasyon" yapabilir veya yanlış bilgi verebilir. Bu durum özellikle belirsiz istemlerde ya da dağıtım dışı girişlerde görülür.
  • İstem kalitesine bağlılık: Çıkış kalitesi, giriş isteminin netliğine bağlıdır. Spesifik ve iyi yapılandırılmış istemler kullanın.
  • Hesaplama maliyeti: Özellikle video girişleriyle veya yüksek thinking_budget ile modelin çalıştırılması, hesaplama kaynaklarını tüketir ve maliyetlere neden olur. Daha fazla bilgi için Düşünme sayfasına bakın.
  • Giriş türleri: Her moddaki sınırlamalarla ilgili ayrıntılar için aşağıdaki konulara bakın.

Gizlilik Uyarısı

Bu belgede referans verilen modellerin ("Robotik Modeller"), donanımınızı talimatlarınıza uygun şekilde çalıştırmak ve hareket ettirmek için video ve ses verilerinden yararlandığını kabul edersiniz. Bu nedenle, Robotik Modelleri; ses, görüntü ve benzerlik verileri ("Kişisel Veriler") gibi kimliği tanımlayabilecek kişilerden alınan verileri toplayacak şekilde çalıştırabilirsiniz. Robotik Modelleri Kişisel Veri toplayacak şekilde çalıştırmayı seçerseniz, bu tür Kişisel Verilerin https://ai.google.dev/gemini-api/terms adresinde bulunan Gemini API Ek Hizmet Şartları'nda ("Şartlar") belirtildiği şekilde Google'a sağlanabileceği ve Google tarafından kullanılabileceği konusunda yeterince bilgilendirilip izin vermedikleri sürece, kimliği belirlenebilir kişilerin Robotik Modellerle etkileşime girmesine veya Robotik Modellerin bulunduğu alanın çevresinde bulunmasına izin vermeyeceğinizi kabul edersiniz. Bu kabul, "Google Verilerinizi Nasıl Kullanır?" başlıklı bölüm uyarınca da geçerlidir. Bu tür bir bildirimin, Şartlar'da belirtildiği şekilde Kişisel Verilerin toplanmasına ve kullanılmasına izin vermesini sağlayacak ve yüz bulanıklaştırma gibi teknikler kullanarak ve Robotik Modelleri, tanımlanabilir kişilerin bulunmadığı alanlarda çalıştırarak Kişisel Verilerin toplanmasını ve dağıtılmasını mümkün olduğunca en aza indirmek için ticari olarak makul çabayı göstereceksiniz.

Fiyatlandırma

Fiyatlandırma ve kullanılabilir bölgeler hakkında ayrıntılı bilgi için fiyatlandırma sayfasına bakın.

Model uç noktaları

Gemini Robotics ER 2 Önizlemesi

Mülk Açıklama
Model kodu gemini-robotics-er-2-preview
Desteklenen veri türleri

Girişler

Metin, resim, video, ses

Çıkış

Metin

Jeton sınırları[*]

Giriş jetonu sınırı

131.072

Çıkış jetonu sınırı

65.536

Özellikler

Ses üretme

Desteklenmiyor

Önbelleğe alma

Destekleniyor

Kod yürütme

Destekleniyor

Bilgisayar kullanımı

Destekleniyor

Dosya arama

Destekleniyor

İşlev çağrısı

Destekleniyor

Google Haritalar ile Temellendirme

Destekleniyor

Görüntü üretme

Desteklenmiyor

Live API

Desteklenmiyor

Arama temellendirme

Destekleniyor

Yapılandırılmış çıkışlar

Destekleniyor

Düşünme (Thinking)

Destekleniyor

URL bağlamı

Destekleniyor

Tüketim seçenekleri

Batch API

Destekleniyor

Flex çıkarımı

Desteklenmiyor

Öncelik çıkarımı

Desteklenmiyor

Sürümler
Daha fazla bilgi için model sürümü kalıplarını okuyun.
  • Önizleme: gemini-robotics-er-2-preview
Son güncelleme Temmuz 2026
Model kartı Model kartı

Gemini Robotics ER 2 Streaming Preview

Mülk Açıklama
Model kodu gemini-robotics-er-2-streaming-preview
Desteklenen veri türleri

Girişler

Metin, resim, video, ses

Çıkış

Metin

Jeton sınırları[*]

Giriş jetonu sınırı

131.072

Çıkış jetonu sınırı

65.536

Özellikler

Ses üretme

Desteklenmiyor

Önbelleğe alma

Desteklenmiyor

Kod yürütme

Desteklenmiyor

Bilgisayar kullanımı

Desteklenmiyor

Dosya arama

Desteklenmiyor

İşlev çağrısı

Destekleniyor

Google Haritalar ile Temellendirme

Desteklenmiyor

Görüntü üretme

Desteklenmiyor

Live API

Destekleniyor

Arama temellendirme

Destekleniyor

Yapılandırılmış çıkışlar

Desteklenmiyor

Düşünme (Thinking)

Destekleniyor

URL bağlamı

Desteklenmiyor

Tüketim seçenekleri

Batch API

Desteklenmiyor

Flex çıkarımı

Desteklenmiyor

Öncelik çıkarımı

Desteklenmiyor

Sürümler
Daha fazla bilgi için model sürümü kalıplarını okuyun.
  • Önizleme: gemini-robotics-er-2-streaming-preview
Son güncelleme Temmuz 2026
Model kartı Model kartı

Gemini Robotics ER 1.6 Önizlemesi

Mülk Açıklama
Model kodu gemini-robotics-er-1.6-preview
Desteklenen veri türleri

Girişler

Metin, resim, video, ses

Çıkış

Metin

Jeton sınırları[*]

Giriş jetonu sınırı

131.072

Çıkış jetonu sınırı

65.536

Özellikler

Ses üretme

Desteklenmiyor

Önbelleğe alma

Destekleniyor

Kod yürütme

Destekleniyor

Bilgisayar kullanımı

Destekleniyor

Dosya arama

Destekleniyor

İşlev çağrısı

Destekleniyor

Google Haritalar ile Temellendirme

Destekleniyor

Görüntü üretme

Desteklenmiyor

Live API

Desteklenmiyor

Arama temellendirme

Destekleniyor

Yapılandırılmış çıkışlar

Destekleniyor

Düşünme (Thinking)

Destekleniyor

URL bağlamı

Destekleniyor

Tüketim seçenekleri

Batch API

Destekleniyor

Flex çıkarımı

Desteklenmiyor

Öncelik çıkarımı

Desteklenmiyor

Sürümler
Daha fazla bilgi için model sürümü kalıplarını okuyun.
  • Önizleme: gemini-robotics-er-1.6-preview
Son güncelleme Aralık 2025
Son güncel bilgi tarihi Ocak 2025

Sırada ne var?