Google Vision OCR¶
Class: GoogleVisionOCRBlockV1
Source: inference.core.workflows.core_steps.models.foundation.google_vision_ocr.v1.GoogleVisionOCRBlockV1
Detect text in images using Google Vision OCR.
Supported types of text detection:
text_detection: optimized for areas of text within a larger image.ocr_text_detection: optimized for dense text documents.
Provide your Google Vision API key or set the value to rf_key:account (or
rf_key:user:<id>) to proxy requests through Roboflow's API.
Type identifier¶
Use the following identifier in step "type" field: roboflow_core/google_vision_ocr@v1to add the block as
as step in your workflow.
Properties¶
| Name | Type | Description | Refs |
|---|---|---|---|
name |
str |
Enter a unique identifier for this step.. | ❌ |
ocr_type |
str |
Type of OCR to use. | ❌ |
api_key |
str |
Your Google Vision API key. | ✅ |
language_hints |
List[str] |
Optional list of language codes to pass to the OCR API. If not provided, the API will attempt to detect the language automatically.If provided, language codes must be supported by the OCR API, visit https://cloud.google.com/vision/docs/languages for list of supported language codes.. | ❌ |
The Refs column marks possibility to parametrise the property with dynamic values available
in workflow runtime. See Bindings for more info.
Runtime compatibility¶
-
requires_internet— air-gapped / offline deployments - This block depends on a service that is not reachable from fully offline / air-gapped deployments.
Available Connections¶
Compatible Blocks
Check what blocks you can connect to Google Vision OCR in version v1.
- inputs:
Google Gemini,OpenAI,Trace Visualization,Twilio SMS Notification,Image Preprocessing,Anthropic Claude,Image Slicer,VLM As Classifier,Dynamic Crop,LMM For Classification,Object Detection Model,Bounding Box Visualization,Webhook Sink,Halo Visualization,Mask Visualization,Absolute Static Crop,Pixelate Visualization,Twilio SMS/MMS Notification,MoonshotAI Kimi,SIFT Comparison,Dot Visualization,Multi-Label Classification Model,Stitch Images,Stitch OCR Detections,OpenAI,OPC UA Writer Sink,Google Gemini,Stability AI Inpainting,Email Notification,EasyOCR,Keypoint Visualization,Llama 3.2 Vision,Florence-2 Model,LMM,Roboflow Custom Metadata,Auto Rotate on Edges,Image Slicer,Keypoint Detection Model,OCR Model,Circle Visualization,Model Comparison Visualization,Stability AI Outpainting,Slack Notification,Line Counter Visualization,Camera Calibration,Contrast Enhancement,Relative Static Crop,Single-Label Classification Model,Clip Comparison,Morphological Transformation,Email Notification,Halo Visualization,VLM As Detector,Cosmos 3,CogVLM,Polygon Visualization,Camera Focus,Corner Visualization,Ellipse Visualization,Qwen-VL,Crop Visualization,PP-OCR,Google Gemma,Qwen 3.5 API,PLC Writer,Model Monitoring Inference Aggregator,Morphological Transformation,Anthropic Claude,Roboflow Visual Search,Icon Visualization,Heatmap Visualization,Color Visualization,Instance Segmentation Model,Google Gemma API,OpenAI,CSV Formatter,Image Blur,Triangle Visualization,Background Color Visualization,Grid Visualization,Image Contours,Image Threshold,Blur Visualization,GLM-OCR,Current Time,Roboflow Visual Search Classifier,QR Code Generator,Anthropic Claude,OpenAI-Compatible LLM,Florence-2 Model,Reference Path Visualization,Polygon Zone Visualization,Stitch OCR Detections,Roboflow Asset Library Attributes,Classification Label Visualization,Microsoft SQL Server Sink,Perspective Correction,Background Subtraction,Camera Focus,Image Convert Grayscale,Label Visualization,Contrast Equalization,Polygon Visualization,Google Vision OCR,SIFT,Stability AI Image Generation,Text Display,Llama 3.2 Vision,Qwen 3.6 API,MQTT Writer,MoonshotAI Kimi,Roboflow Dataset Upload,Local File Sink,OpenRouter,Qwen3.5-VL,Roboflow Vision Events,OpenAI,Google Gemini,S3 Sink,Event Writer,Depth Estimation,Roboflow Dataset Upload - outputs:
SAM 3,Image Preprocessing,Anthropic Claude,Time in Zone,CLIP Embedding Model,Dynamic Crop,Mask Area Measurement,BoT-SORT Tracker,Bounding Box Visualization,Cache Get,Path Deviation,SIFT Comparison,Stitch OCR Detections,OpenAI,Instance Segmentation Model,Email Notification,Stability AI Inpainting,Distance Measurement,Frame Delay,Llama 3.2 Vision,Track Class Lock,Florence-2 Model,Roboflow Custom Metadata,YOLO-World Model,Auto Rotate on Edges,Detections Transformation,Byte Tracker,Stability AI Outpainting,Model Comparison Visualization,Slack Notification,Detections Classes Replacement,Line Counter Visualization,Byte Tracker,Clip Comparison,CogVLM,SORT Tracker,Corner Visualization,Ellipse Visualization,Camera Focus,Morphological Transformation,Detections List Roll-Up,Anthropic Claude,Roboflow Visual Search,Color Visualization,Instance Segmentation Model,OpenAI,Triangle Visualization,Time in Zone,Detection Event Log,Detections Stabilizer,Object Detection Model,SAM 3,Image Threshold,SAM 3,Detections Merge,Current Time,Roboflow Visual Search Classifier,QR Code Generator,OpenAI-Compatible LLM,Florence-2 Model,Semantic Segmentation Model,Polygon Zone Visualization,Stitch OCR Detections,Path Deviation,Roboflow Asset Library Attributes,GeoTag Detection,Microsoft SQL Server Sink,Moondream2,Label Visualization,Llama 3.2 Vision,Stability AI Image Generation,Detection Offset,Instance Segmentation Model,Perception Encoder Embedding Model,Line Counter,MQTT Writer,Roboflow Dataset Upload,Local File Sink,Cache Set,Event Writer,Google Gemini,Depth Estimation,Seg Preview,Byte Tracker,Google Gemini,OpenAI,Trace Visualization,Twilio SMS Notification,Pixel Color Count,SAM 3 Interactive,Detections Filter,LMM For Classification,Velocity,Webhook Sink,Halo Visualization,Mask Visualization,Twilio SMS/MMS Notification,Pixelate Visualization,MoonshotAI Kimi,Dot Visualization,OPC UA Writer Sink,Google Gemini,OC-SORT Tracker,Keypoint Visualization,LMM,Detections Combine,PTZ Tracking (ONVIF),Time in Zone,Circle Visualization,SAM2 Video Tracker,ByteTrack Tracker,Morphological Transformation,Per-Class Confidence Filter,Email Notification,Halo Visualization,Cosmos 3,Polygon Visualization,Qwen-VL,Google Gemma,Crop Visualization,Qwen 3.5 API,Model Monitoring Inference Aggregator,Size Measurement,Icon Visualization,Heatmap Visualization,Single-Label Classification Model,Google Gemma API,Instance Segmentation Model,Detections Consensus,Overlap Analysis,Segment Anything 2 Model,Image Blur,Background Color Visualization,SAM3 Video Tracker,Detections Stitch,Blur Visualization,GLM-OCR,Anthropic Claude,Reference Path Visualization,Classification Label Visualization,Google Vision OCR,Perspective Correction,Polygon Visualization,Contrast Equalization,Qwen 3.6 API,Text Display,MoonshotAI Kimi,OpenRouter,Qwen3.5-VL,Roboflow Vision Events,Keypoint Detection Model,OpenAI,Multi-Label Classification Model,Overlap Filter,S3 Sink,Line Counter,Roboflow Dataset Upload
Input and Output Bindings¶
The available connections depend on its binding kinds. Check what binding kinds
Google Vision OCR in version v1 has.
Bindings
-
input
image(image): Image to run OCR.api_key(Union[secret,string,ROBOFLOW_MANAGED_KEY]): Your Google Vision API key.
-
output
text(string): String value.language(string): String value.predictions(object_detection_prediction): Prediction with detected bounding boxes in form of sv.Detections(...) object.
Example JSON definition of step Google Vision OCR in version v1
{
"name": "<your_step_name_here>",
"type": "roboflow_core/google_vision_ocr@v1",
"image": "$inputs.image",
"ocr_type": "<block_does_not_provide_example>",
"api_key": "xxx-xxx",
"language_hints": [
"en",
"fr"
]
}