Perception Encoder Embedding Model¶
Class: PerceptionEncoderModelBlockV1
Use the Meta Perception Encoder model to create semantic embeddings of text and images.
This block accepts an image or string and returns an embedding. The embedding can be used to compare similarity between different images or between images and text.
Type identifier¶
Use the following identifier in step "type" field: roboflow_core/perception_encoder@v1to add the block as
as step in your workflow.
Properties¶
| Name | Type | Description | Refs |
|---|---|---|---|
name |
str |
Unique name of step in workflows. | ❌ |
data |
str |
The string or image to generate an embedding for.. | ✅ |
version |
str |
Variant of Perception Encoder model. | ✅ |
The Refs column marks possibility to parametrise the property with dynamic values available
in workflow runtime. See Bindings for more info.
Runtime compatibility¶
-
hard— runtimeself_hosted_cpu; executionlocal - Requires a GPU; run_locally() loads a model that needs CUDA.
Available Connections¶
Compatible Blocks
Check what blocks you can connect to Perception Encoder Embedding Model in version v1.
- inputs:
Crop Visualization,Image Slicer,Roboflow Dataset Upload,Google Gemini,Classification Label Visualization,Dynamic Crop,Image Slicer,Absolute Static Crop,Current Time,Roboflow Custom Metadata,Multi-Label Classification Model,SIFT Comparison,Morphological Transformation,Background Subtraction,Line Counter Visualization,Ellipse Visualization,OpenAI,MoonshotAI Kimi,Grid Visualization,Bounding Box Visualization,Morphological Transformation,Google Gemma,Cosmos 3,OpenAI,Webhook Sink,VLM As Detector,Depth Estimation,Image Preprocessing,OPC UA Writer Sink,Stitch Images,Roboflow Dataset Upload,OpenAI,Camera Calibration,Google Vision OCR,OpenAI,QR Code Generator,Florence-2 Model,Polygon Zone Visualization,Contrast Equalization,VLM As Classifier,Pixelate Visualization,Qwen 3.6 API,PLC Writer,CSV Formatter,Triangle Visualization,Stability AI Image Generation,Icon Visualization,Dot Visualization,Stability AI Outpainting,Keypoint Visualization,Relative Static Crop,Anthropic Claude,PP-OCR,Anthropic Claude,Roboflow Visual Search Classifier,OCR Model,Qwen 3.5 API,Halo Visualization,OpenRouter,Local File Sink,Text Display,Roboflow Asset Library Attributes,Image Threshold,Image Blur,LMM,Color Visualization,Corner Visualization,S3 Sink,MQTT Writer,Qwen-VL,Google Gemini,Stitch OCR Detections,Slack Notification,Event Writer,SIFT,Stitch OCR Detections,Auto Rotate on Edges,Google Gemini,Instance Segmentation Model,Twilio SMS Notification,Trace Visualization,Single-Label Classification Model,Perspective Correction,Camera Focus,EasyOCR,Google Gemma API,MoonshotAI Kimi,Twilio SMS/MMS Notification,Blur Visualization,Polygon Visualization,Model Monitoring Inference Aggregator,Stability AI Inpainting,Image Convert Grayscale,Microsoft SQL Server Sink,Florence-2 Model,Qwen3.5-VL,Clip Comparison,Mask Visualization,Reference Path Visualization,Email Notification,Polygon Visualization,Roboflow Visual Search,Halo Visualization,Contrast Enhancement,Llama 3.2 Vision,GLM-OCR,CogVLM,Circle Visualization,Image Contours,Camera Focus,Heatmap Visualization,Roboflow Vision Events,Llama 3.2 Vision,OpenAI-Compatible LLM,Label Visualization,Background Color Visualization,Keypoint Detection Model,Model Comparison Visualization,LMM For Classification,Object Detection Model,Email Notification,Anthropic Claude - outputs:
Identify Outliers,Cosine Similarity,Identify Changes
Input and Output Bindings¶
The available connections depend on its binding kinds. Check what binding kinds
Perception Encoder Embedding Model in version v1 has.
Bindings
Example JSON definition of step Perception Encoder Embedding Model in version v1
{
"name": "<your_step_name_here>",
"type": "roboflow_core/perception_encoder@v1",
"data": "$inputs.image",
"version": "PE-Core-B16-224"
}