Clip Comparison¶
v2¶
Class: ClipComparisonBlockV2 (there are multiple versions of this block)
Source: inference.core.workflows.core_steps.models.foundation.clip_comparison.v2.ClipComparisonBlockV2
Warning: This block has multiple versions. Please refer to the specific version for details. You can learn more about how versions work here: Versioning
Use the OpenAI CLIP zero-shot classification model to classify images.
This block accepts an image and a list of text prompts. The block then returns the similarity of each text label to the provided image.
This block is useful for classifying images without having to train a fine-tuned classification model. For example, you could use CLIP to classify the type of vehicle in an image, or if an image contains NSFW material.
Type identifier¶
Use the following identifier in step "type" field: roboflow_core/clip_comparison@v2to add the block as
as step in your workflow.
Properties¶
| Name | Type | Description | Refs |
|---|---|---|---|
name |
str |
Unique name of step in workflows. | ❌ |
classes |
List[str] |
List of classes to calculate similarity against each input image. | ✅ |
version |
str |
Variant of CLIP model. | ✅ |
The Refs column marks possibility to parametrise the property with dynamic values available
in workflow runtime. See Bindings for more info.
Available Connections¶
Compatible Blocks
Check what blocks you can connect to Clip Comparison in version v2.
- inputs:
Image Preprocessing,Anthropic Claude,Image Slicer,Dynamic Crop,Bounding Box Visualization,Absolute Static Crop,SIFT Comparison,Stitch Images,Stitch OCR Detections,OpenAI,Email Notification,Stability AI Inpainting,EasyOCR,Llama 3.2 Vision,Florence-2 Model,Roboflow Custom Metadata,Dynamic Zone,Auto Rotate on Edges,Keypoint Detection Model,Stability AI Outpainting,Model Comparison Visualization,Slack Notification,Line Counter Visualization,Camera Calibration,Single-Label Classification Model,Clip Comparison,VLM As Detector,CogVLM,Camera Focus,Corner Visualization,Ellipse Visualization,PP-OCR,Morphological Transformation,Detections List Roll-Up,Anthropic Claude,Roboflow Visual Search,Color Visualization,Instance Segmentation Model,OpenAI,Triangle Visualization,Image Contours,Image Threshold,Current Time,Roboflow Visual Search Classifier,QR Code Generator,OpenAI-Compatible LLM,Florence-2 Model,Polygon Zone Visualization,Stitch OCR Detections,Roboflow Asset Library Attributes,GeoTag Detection,Microsoft SQL Server Sink,VLM As Classifier,Camera Focus,Image Convert Grayscale,Label Visualization,Llama 3.2 Vision,Stability AI Image Generation,MQTT Writer,Roboflow Dataset Upload,Local File Sink,Google Gemini,Event Writer,Depth Estimation,Google Gemini,OpenAI,Trace Visualization,Twilio SMS Notification,PLC EthernetIP,LMM For Classification,Object Detection Model,Webhook Sink,Halo Visualization,Buffer,Mask Visualization,Pixelate Visualization,Twilio SMS/MMS Notification,MoonshotAI Kimi,Dot Visualization,Image Stack,Multi-Label Classification Model,OPC UA Writer Sink,Google Gemini,Keypoint Visualization,Dimension Collapse,LMM,Image Slicer,OCR Model,Circle Visualization,Contrast Enhancement,Relative Static Crop,Morphological Transformation,Email Notification,Halo Visualization,Clip Comparison,Cosmos 3,Polygon Visualization,Qwen-VL,PLC Writer,Google Gemma,Crop Visualization,Qwen 3.5 API,Model Monitoring Inference Aggregator,Size Measurement,Icon Visualization,Heatmap Visualization,Motion Detection,Google Gemma API,CSV Formatter,Image Blur,Background Color Visualization,Grid Visualization,Blur Visualization,GLM-OCR,Anthropic Claude,Reference Path Visualization,Classification Label Visualization,Google Vision OCR,Perspective Correction,Background Subtraction,Polygon Visualization,Contrast Equalization,SIFT,Qwen 3.6 API,Text Display,MoonshotAI Kimi,OpenRouter,Qwen3.5-VL,Roboflow Vision Events,OpenAI,PLC ModbusTCP,S3 Sink,Roboflow Dataset Upload - outputs:
SAM 3,Image Preprocessing,Single-Label Classification Model,Anthropic Claude,Time in Zone,Image Slicer,Dynamic Crop,CLIP Embedding Model,BoT-SORT Tracker,Bounding Box Visualization,Cache Get,Object Detection Model,Path Deviation,SIFT Comparison,Stitch Images,Stitch OCR Detections,OpenAI,Instance Segmentation Model,Email Notification,Stability AI Inpainting,Frame Delay,Distance Measurement,Llama 3.2 Vision,Track Class Lock,Florence-2 Model,Roboflow Custom Metadata,Dynamic Zone,YOLO-World Model,Auto Rotate on Edges,Keypoint Detection Model,Byte Tracker,Stability AI Outpainting,Model Comparison Visualization,Detections Classes Replacement,Slack Notification,Line Counter Visualization,Byte Tracker,PLC Reader,Clip Comparison,Single-Label Classification Model,VLM As Detector,CogVLM,SORT Tracker,Corner Visualization,Ellipse Visualization,Detections List Roll-Up,Morphological Transformation,Anthropic Claude,Roboflow Visual Search,Color Visualization,Instance Segmentation Model,OpenAI,Time in Zone,Triangle Visualization,Detections Stabilizer,Object Detection Model,SAM 3,Image Threshold,SAM 3,Current Time,Roboflow Visual Search Classifier,QR Code Generator,OpenAI-Compatible LLM,Florence-2 Model,Semantic Segmentation Model,Polygon Zone Visualization,Stitch OCR Detections,Roboflow Asset Library Attributes,Path Deviation,Microsoft SQL Server Sink,Moondream2,VLM As Classifier,Label Visualization,Llama 3.2 Vision,Stability AI Image Generation,VLM As Detector,Instance Segmentation Model,Perception Encoder Embedding Model,Line Counter,MQTT Writer,Roboflow Dataset Upload,Local File Sink,Identify Outliers,Cache Set,VLM As Classifier,Google Gemini,Event Writer,Depth Estimation,Seg Preview,Byte Tracker,Google Gemini,OpenAI,Trace Visualization,Twilio SMS Notification,Pixel Color Count,PLC EthernetIP,LMM For Classification,Object Detection Model,Webhook Sink,Halo Visualization,Buffer,Mask Visualization,Template Matching,Twilio SMS/MMS Notification,MoonshotAI Kimi,Dot Visualization,Multi-Label Classification Model,OPC UA Writer Sink,Google Gemini,OC-SORT Tracker,Keypoint Visualization,LMM,Image Slicer,PTZ Tracking (ONVIF),Time in Zone,Circle Visualization,Relative Static Crop,ByteTrack Tracker,Morphological Transformation,Per-Class Confidence Filter,Email Notification,Halo Visualization,Clip Comparison,Cosmos 3,Polygon Visualization,Qwen-VL,Google Gemma,Crop Visualization,Qwen 3.5 API,Model Monitoring Inference Aggregator,Keypoint Detection Model,Size Measurement,Single-Label Classification Model,Icon Visualization,Heatmap Visualization,Motion Detection,Multi-Label Classification Model,Google Gemma API,Detections Consensus,Instance Segmentation Model,Overlap Analysis,SAM3 Video Tracker,Segment Anything 2 Model,Grid Visualization,Background Color Visualization,Detections Stitch,Image Blur,GLM-OCR,Anthropic Claude,Reference Path Visualization,Classification Label Visualization,Google Vision OCR,Perspective Correction,Polygon Visualization,Contrast Equalization,Qwen 3.6 API,Text Display,MoonshotAI Kimi,OpenRouter,Qwen3.5-VL,Roboflow Vision Events,Identify Changes,Keypoint Detection Model,OpenAI,Multi-Label Classification Model,S3 Sink,Line Counter,Roboflow Dataset Upload
Input and Output Bindings¶
The available connections depend on its binding kinds. Check what binding kinds
Clip Comparison in version v2 has.
Bindings
-
input
images(image): The image to infer on..classes(list_of_values): List of classes to calculate similarity against each input image.version(string): Variant of CLIP model.
-
output
similarities(list_of_values): List of values of any type.max_similarity(float_zero_to_one):floatvalue in range[0.0, 1.0].most_similar_class(string): String value.min_similarity(float_zero_to_one):floatvalue in range[0.0, 1.0].least_similar_class(string): String value.classification_predictions(classification_prediction): Predictions from classifier.parent_id(parent_id): Identifier of parent for step output.root_parent_id(parent_id): Identifier of parent for step output.
Example JSON definition of step Clip Comparison in version v2
{
"name": "<your_step_name_here>",
"type": "roboflow_core/clip_comparison@v2",
"images": "$inputs.image",
"classes": [
"a",
"b",
"c"
],
"version": "ViT-B-16"
}
v1¶
Class: ClipComparisonBlockV1 (there are multiple versions of this block)
Source: inference.core.workflows.core_steps.models.foundation.clip_comparison.v1.ClipComparisonBlockV1
Warning: This block has multiple versions. Please refer to the specific version for details. You can learn more about how versions work here: Versioning
Use the OpenAI CLIP zero-shot classification model to classify images.
This block accepts an image and a list of text prompts. The block then returns the similarity of each text label to the provided image.
This block is useful for classifying images without having to train a fine-tuned classification model. For example, you could use CLIP to classify the type of vehicle in an image, or if an image contains NSFW material.
Type identifier¶
Use the following identifier in step "type" field: roboflow_core/clip_comparison@v1to add the block as
as step in your workflow.
Properties¶
| Name | Type | Description | Refs |
|---|---|---|---|
name |
str |
Unique name of step in workflows. | ❌ |
texts |
List[str] |
List of texts to calculate similarity against each input image. | ✅ |
The Refs column marks possibility to parametrise the property with dynamic values available
in workflow runtime. See Bindings for more info.
Available Connections¶
Compatible Blocks
Check what blocks you can connect to Clip Comparison in version v1.
- inputs:
Google Gemini,OpenAI,Trace Visualization,Image Preprocessing,Anthropic Claude,Image Slicer,PLC EthernetIP,Dynamic Crop,Bounding Box Visualization,Halo Visualization,Buffer,Mask Visualization,Absolute Static Crop,Pixelate Visualization,MoonshotAI Kimi,SIFT Comparison,Dot Visualization,Image Stack,Stitch Images,OpenAI,Google Gemini,Stability AI Inpainting,Keypoint Visualization,Llama 3.2 Vision,Florence-2 Model,Dimension Collapse,Dynamic Zone,Auto Rotate on Edges,Image Slicer,Circle Visualization,Model Comparison Visualization,Stability AI Outpainting,Line Counter Visualization,Camera Calibration,Contrast Enhancement,Relative Static Crop,Clip Comparison,Morphological Transformation,Halo Visualization,Clip Comparison,Polygon Visualization,Camera Focus,Corner Visualization,Ellipse Visualization,Qwen-VL,Crop Visualization,Google Gemma,Qwen 3.5 API,Morphological Transformation,Detections List Roll-Up,Anthropic Claude,Size Measurement,Roboflow Visual Search,Icon Visualization,Heatmap Visualization,Color Visualization,Motion Detection,Google Gemma API,OpenAI,Image Blur,Triangle Visualization,Background Color Visualization,Grid Visualization,Image Contours,Image Threshold,Blur Visualization,Roboflow Visual Search Classifier,QR Code Generator,Anthropic Claude,Florence-2 Model,Reference Path Visualization,Polygon Zone Visualization,GeoTag Detection,Classification Label Visualization,Perspective Correction,Background Subtraction,Camera Focus,Image Convert Grayscale,Label Visualization,Contrast Equalization,Polygon Visualization,SIFT,Stability AI Image Generation,Text Display,Llama 3.2 Vision,Qwen 3.6 API,MoonshotAI Kimi,OpenRouter,PLC ModbusTCP,Google Gemini,Depth Estimation - outputs:
Google Gemini,OpenAI,SAM 3,Trace Visualization,Anthropic Claude,Time in Zone,PLC EthernetIP,LMM For Classification,Object Detection Model,Bounding Box Visualization,Object Detection Model,Webhook Sink,Halo Visualization,Buffer,Mask Visualization,Path Deviation,Twilio SMS/MMS Notification,MoonshotAI Kimi,Dot Visualization,OpenAI,Instance Segmentation Model,Email Notification,Google Gemini,Frame Delay,Keypoint Visualization,Llama 3.2 Vision,Florence-2 Model,YOLO-World Model,Keypoint Detection Model,Time in Zone,Circle Visualization,Detections Classes Replacement,Line Counter Visualization,PLC Reader,Clip Comparison,Email Notification,Halo Visualization,VLM As Detector,Clip Comparison,Polygon Visualization,Corner Visualization,Ellipse Visualization,Qwen-VL,Google Gemma,Crop Visualization,Qwen 3.5 API,Detections List Roll-Up,Anthropic Claude,Keypoint Detection Model,Size Measurement,Color Visualization,Instance Segmentation Model,Motion Detection,Google Gemma API,Detections Consensus,OpenAI,Instance Segmentation Model,Time in Zone,Triangle Visualization,SAM3 Video Tracker,Grid Visualization,Object Detection Model,SAM 3,SAM 3,Anthropic Claude,Florence-2 Model,Reference Path Visualization,Polygon Zone Visualization,Roboflow Asset Library Attributes,Path Deviation,Classification Label Visualization,VLM As Classifier,Perspective Correction,Polygon Visualization,Label Visualization,Llama 3.2 Vision,Qwen 3.6 API,VLM As Detector,Instance Segmentation Model,Line Counter,MoonshotAI Kimi,Roboflow Dataset Upload,OpenRouter,Keypoint Detection Model,Cache Set,VLM As Classifier,Google Gemini,Line Counter,Seg Preview,Roboflow Dataset Upload
Input and Output Bindings¶
The available connections depend on its binding kinds. Check what binding kinds
Clip Comparison in version v1 has.
Bindings
-
input
images(image): The image to infer on..texts(list_of_values): List of texts to calculate similarity against each input image.
-
output
similarity(list_of_values): List of values of any type.parent_id(parent_id): Identifier of parent for step output.root_parent_id(parent_id): Identifier of parent for step output.prediction_type(prediction_type): String value with type of prediction.
Example JSON definition of step Clip Comparison in version v1
{
"name": "<your_step_name_here>",
"type": "roboflow_core/clip_comparison@v1",
"images": "$inputs.image",
"texts": [
"a",
"b",
"c"
]
}