Cosmos 3¶
Class: Cosmos3EdgeBlockV1
Source: inference.core.workflows.core_steps.models.foundation.cosmos3.v1.Cosmos3EdgeBlockV1
This workflow block runs the NVIDIA Cosmos 3 reasoner — a world model tuned for physical scene understanding—on an image with an optional text prompt, and returns a text answer. The model is well suited to questions about spatial relations, safety, and what will happen next in a scene.
Type identifier¶
Use the following identifier in step "type" field: roboflow_core/cosmos3_edge@v1to add the block as
as step in your workflow.
Properties¶
| Name | Type | Description | Refs |
|---|---|---|---|
name |
str |
Enter a unique identifier for this step.. | ❌ |
prompt |
str |
Optional text prompt to pass to Cosmos 3 Edge. Otherwise a default scene-description prompt is used, which may affect the desired model behavior.. | ✅ |
model_version |
str |
The Cosmos 3 Edge model to be used for inference.. | ✅ |
system_prompt |
str |
Optional system prompt to provide additional context to Cosmos 3 Edge.. | ✅ |
The Refs column marks possibility to parametrise the property with dynamic values available
in workflow runtime. See Bindings for more info.
Runtime compatibility¶
-
hard— runtimeself_hosted_cpu; executionlocal - Requires a GPU; run_locally() loads a model that needs CUDA.
Available Connections¶
Compatible Blocks
Check what blocks you can connect to Cosmos 3 in version v1.
- inputs:
Image Preprocessing,Single-Label Classification Model,Anthropic Claude,Image Slicer,Dynamic Crop,Bounding Box Visualization,Object Detection Model,Absolute Static Crop,SIFT Comparison,Stitch Images,Stitch OCR Detections,OpenAI,Instance Segmentation Model,Email Notification,Stability AI Inpainting,EasyOCR,Llama 3.2 Vision,Florence-2 Model,Roboflow Custom Metadata,Auto Rotate on Edges,Keypoint Detection Model,Stability AI Outpainting,Model Comparison Visualization,Slack Notification,Line Counter Visualization,Camera Calibration,Single-Label Classification Model,Clip Comparison,VLM As Detector,CogVLM,Camera Focus,Corner Visualization,Ellipse Visualization,PP-OCR,Morphological Transformation,Anthropic Claude,Roboflow Visual Search,Color Visualization,Instance Segmentation Model,OpenAI,Triangle Visualization,Object Detection Model,Image Contours,Image Threshold,Current Time,Roboflow Visual Search Classifier,QR Code Generator,OpenAI-Compatible LLM,Florence-2 Model,Semantic Segmentation Model,Polygon Zone Visualization,Stitch OCR Detections,Roboflow Asset Library Attributes,Microsoft SQL Server Sink,VLM As Classifier,Camera Focus,Image Convert Grayscale,Label Visualization,Llama 3.2 Vision,Stability AI Image Generation,Instance Segmentation Model,MQTT Writer,Roboflow Dataset Upload,Local File Sink,Google Gemini,Event Writer,Semantic Segmentation Model,Depth Estimation,Google Gemini,OpenAI,Trace Visualization,Twilio SMS Notification,LMM For Classification,Object Detection Model,Webhook Sink,Halo Visualization,Mask Visualization,Pixelate Visualization,Twilio SMS/MMS Notification,MoonshotAI Kimi,Dot Visualization,Multi-Label Classification Model,OPC UA Writer Sink,Google Gemini,Keypoint Visualization,LMM,Image Slicer,OCR Model,Circle Visualization,Contrast Enhancement,Relative Static Crop,Morphological Transformation,Email Notification,Halo Visualization,Cosmos 3,Polygon Visualization,Qwen-VL,PLC Writer,Google Gemma,Crop Visualization,Qwen 3.5 API,Model Monitoring Inference Aggregator,Keypoint Detection Model,Icon Visualization,Heatmap Visualization,Single-Label Classification Model,Multi-Label Classification Model,Google Gemma API,Instance Segmentation Model,CSV Formatter,Image Blur,Background Color Visualization,Grid Visualization,Blur Visualization,GLM-OCR,Anthropic Claude,Reference Path Visualization,Classification Label Visualization,Google Vision OCR,Perspective Correction,Background Subtraction,Polygon Visualization,Contrast Equalization,SIFT,Qwen 3.6 API,Text Display,MoonshotAI Kimi,OpenRouter,Qwen3.5-VL,Roboflow Vision Events,OpenAI,Keypoint Detection Model,Multi-Label Classification Model,S3 Sink,Roboflow Dataset Upload - outputs:
SAM 3,Image Preprocessing,Anthropic Claude,Time in Zone,CLIP Embedding Model,Dynamic Crop,Bounding Box Visualization,Cache Get,Path Deviation,SIFT Comparison,Stitch OCR Detections,OpenAI,Instance Segmentation Model,Email Notification,Stability AI Inpainting,Distance Measurement,Llama 3.2 Vision,Florence-2 Model,Roboflow Custom Metadata,YOLO-World Model,Auto Rotate on Edges,Stability AI Outpainting,Model Comparison Visualization,Slack Notification,Detections Classes Replacement,Line Counter Visualization,Clip Comparison,VLM As Detector,CogVLM,Corner Visualization,Ellipse Visualization,Morphological Transformation,Anthropic Claude,Roboflow Visual Search,Color Visualization,Instance Segmentation Model,OpenAI,Triangle Visualization,Time in Zone,Object Detection Model,SAM 3,Image Threshold,SAM 3,Current Time,Roboflow Visual Search Classifier,QR Code Generator,OpenAI-Compatible LLM,Florence-2 Model,Semantic Segmentation Model,Polygon Zone Visualization,Stitch OCR Detections,Path Deviation,Roboflow Asset Library Attributes,Microsoft SQL Server Sink,Moondream2,VLM As Classifier,Label Visualization,Llama 3.2 Vision,Stability AI Image Generation,VLM As Detector,Instance Segmentation Model,Perception Encoder Embedding Model,Line Counter,MQTT Writer,Roboflow Dataset Upload,Local File Sink,Cache Set,VLM As Classifier,Event Writer,Google Gemini,Depth Estimation,Seg Preview,Google Gemini,OpenAI,Trace Visualization,Twilio SMS Notification,Pixel Color Count,LMM For Classification,Webhook Sink,Halo Visualization,Mask Visualization,Twilio SMS/MMS Notification,MoonshotAI Kimi,Dot Visualization,OPC UA Writer Sink,Google Gemini,Keypoint Visualization,LMM,PTZ Tracking (ONVIF),Time in Zone,Circle Visualization,Morphological Transformation,Email Notification,Halo Visualization,Cosmos 3,Polygon Visualization,Qwen-VL,Google Gemma,Crop Visualization,Qwen 3.5 API,Model Monitoring Inference Aggregator,Size Measurement,Icon Visualization,Heatmap Visualization,Single-Label Classification Model,Google Gemma API,Instance Segmentation Model,Segment Anything 2 Model,Image Blur,Background Color Visualization,SAM3 Video Tracker,Detections Stitch,GLM-OCR,Anthropic Claude,Reference Path Visualization,Classification Label Visualization,Google Vision OCR,Perspective Correction,Polygon Visualization,Contrast Equalization,Qwen 3.6 API,Text Display,JSON Parser,MoonshotAI Kimi,OpenRouter,Qwen3.5-VL,Roboflow Vision Events,Keypoint Detection Model,OpenAI,Multi-Label Classification Model,S3 Sink,Line Counter,Roboflow Dataset Upload
Input and Output Bindings¶
The available connections depend on its binding kinds. Check what binding kinds
Cosmos 3 in version v1 has.
Bindings
-
input
images(image): The image to infer on..prompt(string): Optional text prompt to pass to Cosmos 3 Edge. Otherwise a default scene-description prompt is used, which may affect the desired model behavior..model_version(roboflow_model_id): The Cosmos 3 Edge model to be used for inference..system_prompt(string): Optional system prompt to provide additional context to Cosmos 3 Edge..
-
output
output(Union[string,language_model_output]): String value ifstringor LLM / VLM output iflanguage_model_output.
Example JSON definition of step Cosmos 3 in version v1
{
"name": "<your_step_name_here>",
"type": "roboflow_core/cosmos3_edge@v1",
"images": "$inputs.image",
"prompt": "Is the walkway free of obstacles?",
"model_version": "nvidia/cosmos-3-edge",
"system_prompt": "You are a safety inspector."
}