Gemini Robotics ER (embodied reasoning) modelleri, robotların fiziksel dünyayı algılamasına ve bu dünyayla etkileşime girmesine olanak tanıyan görme-dil modelleridir (VLMs). Görsel verileri yorumlar, uzamsal ve zamansal akıl yürütme yapar, çok adımlı görevleri planlar, robotları ve araçları yönetir.
Modeller
Gemini Robotics ER 2 modeli, Gemini Robotics'in en yeni modelidir. Bu, robotların çevrelerini tam olarak anlamalarını sağlayan güncellenmiş akıl yürütme modelimizdir. Robotların ajan tabanlı düzenlemesi (ör. VLA'lar kullanılarak), ilerleme durumunu anlama ve başarı tespiti dahil olmak üzere robot videolarını anlama, ölçüm cihazı okuma, işaret etme ve uzamsal akıl yürütme gibi somut akıl yürütme yetenekleri konusunda uzmanlaşmıştır.
Gemini Robotics ER 2 modeli iki model uç noktası sunar:
gemini-robotics-er-2-preview: Standart ER 2 modeli. Geliştirilmiş uzamsal akıl yürütme, video anı bulma, video ilerleme sınıflandırması, çoklu robot düzenleme ve çok adımlı araç kullanımı ile Gemini 3.5 Flash'ı temel alır.gemini-robotics-er-2-streaming-preview: Live API kullanılarak gerçek zamanlı yayın için optimize edilmiştir. Sürekli ses ve video girişi işleyen düşük gecikmeli robot aracıları için bu modeli kullanın.
Gemini Robotics ER 1.6'nın desteği 31 Ağustos 2026'da sonlandırıldı.
Hâlâ Gemini Robotics ER 1.6'yı kullanıyorsanız API çağrılarınızda model="gemini-robotics-er-1.6-preview" yerine model="gemini-robotics-er-2-preview" veya model="gemini-robotics-er-2-streaming-preview" yazarak Gemini Robotics ER 2'ye yükseltin.
Google AI Studio'da Gemini Robotics ER 2'yi deneyin
Robotik özellikleri
Gemini Robotics ER, bir dizi somut akıl yürütme özelliğini destekler. Daha fazla bilgi edinmek için bir özellik seçin:
| Kapasite | Açıklama | Kılavuz |
|---|---|---|
| Uzamsal akıl yürütme | Nesneleri işaretleyin, videoda takip edin, sınırlayıcı kutularla algılayın ve yörüngeleri planlayın. | Uzamsal akıl yürütme |
| Ajan tabanlı vizyon | Resim işleme araçlarından yararlanarak diğer özellikleri geliştirmek için kod yürütmeyi kullanın. | Temsilci tabanlı vizyon |
| Görev düzenleme | Uzun vadeli görevleri tamamlamak için uzamsal akıl yürütmeyi özel robot API'leriyle birleştirin. | Görev düzenleme |
| Akış (yalnızca Gemini Robotics ER 2 Akış uç noktası) | Düşük gecikmeli fonksiyon çağrısıyla anlık robot temsilciler için çift yönlü akış. | Robotik için akış |
| Video ilerleme durumu (yalnızca Gemini Robotics ER 2) | Sürekli video feed'lerinden anları bulma ve ilerleme sınıflandırması. | Video anlama |
Başlamadan önce
Gemini Robotics ER modelleri, Gemini Developer API aracılığıyla kullanılabilir. Başlamak için Google AI Studio veya Google Cloud Console'dan Gemini API anahtarı oluşturun ve ortamınızı ayarlayın.
Anahtar türleri, güvenlik ve anahtarınızı Python, JavaScript ve diğer dillerde yapılandırma hakkında ayrıntılı bilgi için Gemini API anahtarlarını kullanma başlıklı makaleyi inceleyin.
Başlarken
Aşağıdaki örnekte, bir resimdeki nesneler bulunur ve bunların normalleştirilmiş 2 boyutlu koordinatları ve etiketleri döndürülür. Bu çıkışı doğrudan bir robotik API'ye veya VLA modeline aktararak robot işlemleri oluşturabilirsiniz.
Python
from google import genai
PROMPT = """
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": ,
"label": }, ...]. The points are in [y, x] format
normalized to 0-1000.
"""
client = genai.Client()
uploaded_file = client.files.upload(file="my-image.png")
image_response = client.interactions.create(
model="gemini-robotics-er-2-preview",
input=[
{
"type": "image",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
},
{"type": "text", "text": PROMPT}
],
generation_config={"thinking_level": "high"},
)
print(image_response.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const PROMPT = `
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": ,
"label": }, ...]. The points are in [y, x] format
normalized to 0-1000.
`;
const client = new GoogleGenAI();
const uploadedFile = await client.files.upload({ file: "my-image.png" });
const imageResponse = await client.interactions.create({
model: "gemini-robotics-er-2-preview",
input: [
{
type: "image",
uri: uploadedFile.uri,
mime_type: uploadedFile.mimeType,
},
{ type: "text", text: PROMPT },
],
generation_config: { thinking_level: "high" },
});
console.log(imageResponse.output_text);
Java
import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.Content;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.GenerationConfig;
import com.google.genai.gaos.models.interactions.ImageContent;
import com.google.genai.gaos.models.interactions.ImageContentMimeType;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.TextContent;
import com.google.genai.gaos.models.interactions.ThinkingLevel;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;
import com.google.genai.types.File;
import com.google.genai.types.UploadFileConfig;
import java.util.List;
Client client = new Client();
String prompt =
"Point to no more than 10 items in the image. The label returned "
+ "should be an identifying name for the object detected. "
+ "The answer should follow the json format: [{\"point\": , "
+ "\"label\": }, ...]. The points are in [y, x] format "
+ "normalized to 0-1000.";
File uploadedFile =
client.files.upload(
new java.io.File("my-image.png"),
UploadFileConfig.builder().mimeType("image/png").build());
Content imageContent =
ImageContent.builder()
.uri(uploadedFile.uri().orElse(""))
.mimeType(ImageContentMimeType.of(uploadedFile.mimeType().orElse("image/png")))
.build();
Content textContent = TextContent.builder().text(prompt).build();
CreateModelInteraction params =
CreateModelInteraction.builder()
.model(Model.of("gemini-robotics-er-2-preview"))
.input(InteractionsInput.ofContent(List.of(imageContent, textContent)))
.generationConfig(
GenerationConfig.builder().thinkingLevel(ThinkingLevel.HIGH).build())
.build();
Interaction imageResponse =
client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();
System.out.println(imageResponse.outputText().orElse(""));
Go
package main
import (
"context"
"fmt"
"log"
"google.golang.org/genai"
"google.golang.org/genai/interactions/models/interactions"
"google.golang.org/genai/interactions/models/operations"
)
func main() {
ctx := context.Background()
client, err := genai.NewClient(ctx, nil)
if err != nil {
log.Fatal(err)
}
prompt := `Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": ,
"label": }, ...]. The points are in [y, x] format
normalized to 0-1000.`
uploadedFile, err := client.Files.UploadFromPath(ctx, "my-image.png", &genai.UploadFileConfig{
MIMEType: "image/png",
})
if err != nil {
log.Fatal(err)
}
res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
Model: interactions.Model("gemini-robotics-er-2-preview"),
Input: interactions.NewInteractionsInput([]interactions.Content{
interactions.NewContent(interactions.ImageContent{
URI: genai.Ptr(uploadedFile.URI),
MimeType: genai.Ptr(interactions.ImageMimeTypeImagePng),
}),
interactions.NewContent(interactions.TextContent{
Text: prompt,
}),
}),
GenerationConfig: &interactions.GenerationConfig{
ThinkingLevel: interactions.ThinkingLevelHigh.ToPointer(),
},
}),
})
if err != nil {
log.Fatal(err)
}
if res.Interaction.OutputText != nil {
fmt.Println(*res.Interaction.OutputText)
}
}
REST
# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-robotics-er-2-preview",
"input": {
"parts": [
{
"inlineData": {
"mimeType": "image/png",
"data": "'"${IMAGE_BASE64}"'"
}
},
{
"text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": }, ...]. The points are in [y, x] format normalized to 0-1000."
}
]
},
"generation_config": {
"thinking_config": {
"thinking_level": "high"
}
}
}'
Çıktı, her biri point
(normalleştirilmiş [y, x] koordinatları) ve nesneyi tanımlayan bir label içeren nesnelerden oluşan bir JSON dizisi olacaktır.
JSON
[
{"point": [376, 508], "label": "small banana"},
{"point": [287, 609], "label": "larger banana"},
{"point": [223, 303], "label": "pink starfruit"},
{"point": [435, 172], "label": "paper bag"},
{"point": [270, 786], "label": "green plastic bowl"},
{"point": [488, 775], "label": "metal measuring cup"},
{"point": [673, 580], "label": "dark blue bowl"},
{"point": [471, 353], "label": "light blue bowl"},
{"point": [492, 497], "label": "bread"},
{"point": [525, 429], "label": "lime"}
]
Aşağıdaki resimde bu noktaların nasıl görüntülenebileceğine dair bir örnek verilmiştir:
İşleyiş şekli
Gemini Robotics ER, doğal dil istemleriyle görüntü, video veya ses girişi alır. Nesneleri tanımlar, sahne bağlamı ve uzamsal ilişkiler hakkında akıl yürütür ve koordinatlar veya sınırlayıcı kutular gibi yapılandırılmış çıkışlar döndürür.
Gemini Robotics ER de temsilci tabanlıdır: Karmaşık görevleri alt görevlere ayırır ve robot işlevlerinizi çağırarak veya oluşturulan kodu çalıştırarak bunları yerine getirir. Örneğin, "elmaları kaseye koy" ifadesi bulma, kavrama ve yerleştirme adımlarından oluşan bir diziye dönüşür.
Gemini'ın araç çağrılarını nasıl yürüttüğü hakkında ayrıntılı bilgi için İşlev çağrısı bölümüne bakın.
Güvenlik
Gemini Robotics ER, güvenlik göz önünde bulundurularak üretilmiş olsa da robotun etrafında güvenli bir ortam sağlamak sizin sorumluluğunuzdadır. Üretken yapay zeka modelleri hata yapabilir ve fiziksel robotlar hasara neden olabilir. Daha fazla bilgi için Gemini Robotics güvenlik sayfasını ziyaret edin.
En iyi uygulamalar
Sade ve doğal dil kullanın. Robottan yapmasını istediğiniz şeyi bir kişiye anlatır gibi açıklayın. Bir terim çalışmıyorsa yaygın bir eş anlamlıyı deneyin.
Görsel girişi optimize edin. Resmi göndermeden önce küçük veya net olmayan nesneleri kırpın ya da yakınlaştırın. Işık ve düşük renk kontrastı algılamayı etkileyebilir.
Karmaşık görevleri adımlara ayırın. Modelin odaklanmasını sağlamak ve doğruluğu artırmak için her adımı ayrı bir istem olarak gönderin.
Yüksek hassasiyetli görevler için birden çok kez sorgu gönderin ve sonuçların ortalamasını alın. Bu fikir birliği yaklaşımı, mekansal çıkışlardaki varyansı azaltır.
Sınırlamalar
Gemini Robotics ER ile geliştirme yaparken aşağıdaki sınırlamaları göz önünde bulundurun:
- API anahtarı kısıtlamaları: Gemini API, kısıtlanmamış API anahtarlarından gelen istekleri kabul etmez ve
403 Forbiddenhatasını döndürür. AI Studio'da kısıtlamalar ekleyerek API anahtarınızı güvenli hale getirin. Ayrıntılı bilgi için Sınırsız API anahtarlarının güvenliğini sağlama başlıklı makaleyi inceleyin. - Gecikme süresi ve performans: Karmaşık sorgular, yüksek çözünürlüklü girişler veya yüksek düşünce seviyeleri, işleme sürelerinin artmasına neden olabilir. Düşünme seviyesi için gecikme ve performans arasında iyi bir denge sağlamak üzere orta seçeneğini kullanın.
- Halüsinasyonlar: Tüm büyük dil modelleri gibi Gemini Robotics ER modelleri de zaman zaman "halüsinasyon" yapabilir veya yanlış bilgi verebilir. Bu durum özellikle belirsiz istemlerde ya da dağıtım dışı girişlerde görülür.
- İstem kalitesine bağlılık: Çıkış kalitesi, giriş isteminin netliğine bağlıdır. Spesifik ve iyi yapılandırılmış istemler kullanın.
- Hesaplama maliyeti: Özellikle video girişleriyle veya yüksek
thinking_budgetile modelin çalıştırılması, hesaplama kaynaklarını tüketir ve maliyetlere neden olur. Daha fazla bilgi için Düşünme sayfasına bakın. - Giriş türleri: Her moddaki sınırlamalarla ilgili ayrıntılar için aşağıdaki konulara bakın.
Gizlilik Uyarısı
Bu belgede referans verilen modellerin ("Robotik Modeller"), donanımınızı talimatlarınıza uygun şekilde çalıştırmak ve hareket ettirmek için video ve ses verilerinden yararlandığını kabul edersiniz. Bu nedenle, Robotik Modelleri; ses, görüntü ve benzerlik verileri ("Kişisel Veriler") gibi kimliği tanımlayabilecek kişilerden alınan verileri toplayacak şekilde çalıştırabilirsiniz. Robotik Modelleri Kişisel Veri toplayacak şekilde çalıştırmayı seçerseniz, bu tür Kişisel Verilerin https://ai.google.dev/gemini-api/terms adresinde bulunan Gemini API Ek Hizmet Şartları'nda ("Şartlar") belirtildiği şekilde Google'a sağlanabileceği ve Google tarafından kullanılabileceği konusunda yeterince bilgilendirilip izin vermedikleri sürece, kimliği belirlenebilir kişilerin Robotik Modellerle etkileşime girmesine veya Robotik Modellerin bulunduğu alanın çevresinde bulunmasına izin vermeyeceğinizi kabul edersiniz. Bu kabul, "Google Verilerinizi Nasıl Kullanır?" başlıklı bölüm uyarınca da geçerlidir. Bu tür bir bildirimin, Şartlar'da belirtildiği şekilde Kişisel Verilerin toplanmasına ve kullanılmasına izin vermesini sağlayacak ve yüz bulanıklaştırma gibi teknikler kullanarak ve Robotik Modelleri, tanımlanabilir kişilerin bulunmadığı alanlarda çalıştırarak Kişisel Verilerin toplanmasını ve dağıtılmasını mümkün olduğunca en aza indirmek için ticari olarak makul çabayı göstereceksiniz.
Fiyatlandırma
Fiyatlandırma ve kullanılabilir bölgeler hakkında ayrıntılı bilgi için fiyatlandırma sayfasına bakın.
Model uç noktaları
Gemini Robotics ER 2 Önizlemesi
| Mülk | Açıklama |
|---|---|
| Model kodu | gemini-robotics-er-2-preview |
| Desteklenen veri türleri |
Girişler Metin, resim, video, ses Çıkış Metin |
| Jeton sınırları[*] |
Giriş jetonu sınırı 131.072 Çıkış jetonu sınırı 65.536 |
| Özellikler | Desteklenmiyor Destekleniyor Destekleniyor Destekleniyor Destekleniyor Destekleniyor Google Haritalar ile Temellendirme Destekleniyor Desteklenmiyor Desteklenmiyor Destekleniyor Destekleniyor Düşünme (Thinking) Destekleniyor Destekleniyor |
| Tüketim seçenekleri |
Destekleniyor Desteklenmiyor Desteklenmiyor |
| Sürümler |
|
| Son güncelleme | Temmuz 2026 |
| Model kartı | Model kartı |
Gemini Robotics ER 2 Streaming Preview
| Mülk | Açıklama |
|---|---|
| Model kodu | gemini-robotics-er-2-streaming-preview |
| Desteklenen veri türleri |
Girişler Metin, resim, video, ses Çıkış Metin |
| Jeton sınırları[*] |
Giriş jetonu sınırı 131.072 Çıkış jetonu sınırı 65.536 |
| Özellikler | Desteklenmiyor Desteklenmiyor Desteklenmiyor Desteklenmiyor Desteklenmiyor Destekleniyor Google Haritalar ile Temellendirme Desteklenmiyor Desteklenmiyor Destekleniyor Destekleniyor Desteklenmiyor Düşünme (Thinking) Destekleniyor Desteklenmiyor |
| Tüketim seçenekleri |
Desteklenmiyor Desteklenmiyor Desteklenmiyor |
| Sürümler |
|
| Son güncelleme | Temmuz 2026 |
| Model kartı | Model kartı |
Gemini Robotics ER 1.6 Önizlemesi
| Mülk | Açıklama |
|---|---|
| Model kodu | gemini-robotics-er-1.6-preview |
| Desteklenen veri türleri |
Girişler Metin, resim, video, ses Çıkış Metin |
| Jeton sınırları[*] |
Giriş jetonu sınırı 131.072 Çıkış jetonu sınırı 65.536 |
| Özellikler | Desteklenmiyor Destekleniyor Destekleniyor Destekleniyor Destekleniyor Destekleniyor Google Haritalar ile Temellendirme Destekleniyor Desteklenmiyor Desteklenmiyor Destekleniyor Destekleniyor Düşünme (Thinking) Destekleniyor Destekleniyor |
| Tüketim seçenekleri |
Destekleniyor Desteklenmiyor Desteklenmiyor |
| Sürümler |
|
| Son güncelleme | Aralık 2025 |
| Son güncel bilgi tarihi | Ocak 2025 |
Sırada ne var?
- Uzamsal akıl yürütme: işaretleme, izleme, sınırlayıcı kutular, yörüngeler.
- Ajan tabanlı yetenekler: Kod yürütme, enstrüman okuma, görüntü ekleme.
- Görev düzenleme: Özel robot API'leri ile uzun vadeli görevler.
- Yayın özellikli robotik: Anlık çift yönlü yayın (yalnızca Gemini Robotics ER 2).
- Video anlama: Anları bulma ve ilerleme sınıflandırması (yalnızca Gemini Robotics ER 2).
- Gemini Robotics güvenliği: Model ailesinin temelindeki güvenlik araştırması.