SAM3 Video Tracker¶
Class: SegmentAnything3VideoBlockV1
Run Segment Anything 3 on a live video stream frame by frame, keeping per-video temporal memory so object identities are preserved across frames.
Provide the concepts to track as text in class_names (e.g.
["person", "forklift"]) — no upstream detector is needed. SAM3 runs
fused detection and tracking on every frame, so objects matching a
concept that enter the scene mid-stream are picked up automatically and
assigned fresh tracker_ids. Each emitted mask carries the prompt it
matched as its class name and the model's detection score as its
confidence.
The block multiplexes a single SAM3 streaming model across many video
streams by keying state on video_metadata.video_identifier; a session
is re-seeded only when the source stream restarts or class_names
changes. For detector-driven (box-prompted) video tracking, use the
SAM2 Video Tracker block instead.
Intended for use with InferencePipeline, which delivers one frame at
a time and tags each frame with video metadata.
Type identifier¶
Use the following identifier in step "type" field: roboflow_core/sam3_video@v1to add the block as
as step in your workflow.
Properties¶
| Name | Type | Description | Refs |
|---|---|---|---|
name |
str |
Enter a unique identifier for this step.. | ❌ |
class_names |
Union[List[str], str] |
Concepts to segment and track, as a list of phrases (or a single comma-separated string). Each emitted mask carries the concept it matched as its class name.. | ✅ |
model_id |
str |
Streaming SAM3 model id resolved by inference_models.. |
✅ |
threshold |
float |
Minimum detection score for emitted masks. Scores come from SAM3's per-object concept detection head.. | ✅ |
The Refs column marks possibility to parametrise the property with dynamic values available
in workflow runtime. See Bindings for more info.
Runtime compatibility¶
-
soft— runtimehosted_serverless,dedicated_deployment; executionremote; inputvideo - Block keeps per-video state in process memory (keyed by video_metadata.video_identifier). With remote step execution on stateless or multi-replica HTTP runtimes, successive requests may be served by different worker processes, so the state resets between calls and the output is meaningless for tracking / counting / aggregation. Use local step execution in an InferencePipeline for stable cross-frame results.
-
hard— runtimeself_hosted_cpu; executionlocal - Requires a GPU; the streaming SAM3 video model needs CUDA.
-
soft— inputimage - Block depends on temporal context from video or repeated-frame workflows. With a still image/photo, there is no meaningful history to track, compare, aggregate, or visualize, so the block provides little or no benefit.
Available Connections¶
Compatible Blocks
Check what blocks you can connect to SAM3 Video Tracker in version v1.
- inputs:
Keypoint Visualization,Twilio SMS/MMS Notification,OPC UA Writer Sink,Keypoint Detection Model,Qwen 3.6 API,Grid Visualization,Object Detection Model,Llama 3.2 Vision,PLC Writer,Absolute Static Crop,Roboflow Visual Search Classifier,Image Threshold,Polygon Zone Visualization,CogVLM,MQTT Writer,Contrast Equalization,Google Gemini,Detections List Roll-Up,OCR Model,GLM-OCR,Background Subtraction,Contrast Enhancement,Reference Path Visualization,Twilio SMS Notification,Instance Segmentation Model,Google Gemma API,VLM As Detector,Florence-2 Model,Dynamic Crop,Halo Visualization,Image Blur,LMM,Ellipse Visualization,OpenAI,Florence-2 Model,LMM For Classification,Semantic Segmentation Model,Instance Segmentation Model,Event Writer,OpenAI,Single-Label Classification Model,Keypoint Detection Model,Google Gemma,Buffer,Slack Notification,Heatmap Visualization,Semantic Segmentation Model,Email Notification,Circle Visualization,Perspective Correction,Camera Focus,Crop Visualization,Polygon Visualization,Keypoint Detection Model,Multi-Label Classification Model,Stability AI Inpainting,OpenAI-Compatible LLM,Object Detection Model,VLM As Classifier,PLC ModbusTCP,Image Slicer,Google Gemini,Roboflow Vision Events,Multi-Label Classification Model,Size Measurement,Local File Sink,Object Detection Model,Dot Visualization,Line Counter Visualization,Depth Estimation,Instance Segmentation Model,Stitch OCR Detections,PP-OCR,Blur Visualization,Clip Comparison,EasyOCR,Anthropic Claude,PLC EthernetIP,CSV Formatter,Color Visualization,Dynamic Zone,Image Convert Grayscale,Motion Detection,Stitch OCR Detections,Single-Label Classification Model,Qwen 3.5 API,Trace Visualization,Icon Visualization,Current Time,Model Comparison Visualization,Camera Focus,QR Code Generator,Google Gemini,Image Stack,Instance Segmentation Model,Qwen-VL,Mask Visualization,MoonshotAI Kimi,Microsoft SQL Server Sink,Text Display,Gaze Detection,Stability AI Image Generation,Google Vision OCR,Webhook Sink,OpenAI,Cosine Similarity,Pixelate Visualization,Stitch Images,S3 Sink,Classification Label Visualization,MoonshotAI Kimi,Polygon Visualization,Anthropic Claude,Dimension Collapse,Roboflow Dataset Upload,Morphological Transformation,Bounding Box Visualization,Image Contours,Image Slicer,Stability AI Outpainting,Anthropic Claude,Roboflow Custom Metadata,Multi-Label Classification Model,Camera Calibration,Roboflow Asset Library Attributes,Morphological Transformation,Relative Static Crop,Background Color Visualization,Model Monitoring Inference Aggregator,Clip Comparison,Corner Visualization,GeoTag Detection,SIFT,Roboflow Visual Search,OpenRouter,Llama 3.2 Vision,Qwen3.5-VL,Identify Changes,Email Notification,Single-Label Classification Model,Triangle Visualization,OpenAI,Roboflow Dataset Upload,Image Preprocessing,SIFT Comparison,Halo Visualization,Label Visualization - outputs:
Blur Visualization,Segment Anything 2 Model,Color Visualization,Per-Class Confidence Filter,Dynamic Zone,Distance Measurement,Velocity,Trace Visualization,Icon Visualization,Time in Zone,Model Comparison Visualization,BoT-SORT Tracker,Detections Stitch,Detections List Roll-Up,Mask Visualization,Mask Edge Snap,Detections Filter,Detections Merge,Detections Classes Replacement,PTZ Tracking (ONVIF),Florence-2 Model,Dynamic Crop,SAM 3 Interactive,Halo Visualization,Ellipse Visualization,Pixelate Visualization,Byte Tracker,Florence-2 Model,Detection Offset,Line Counter,Time in Zone,Overlap Filter,Polygon Visualization,Path Deviation,Roboflow Dataset Upload,Event Writer,Time in Zone,Byte Tracker,Detection Event Log,Bounding Box Visualization,Heatmap Visualization,SORT Tracker,Circle Visualization,Roboflow Custom Metadata,SAM2 Video Tracker,Perspective Correction,Camera Focus,Byte Tracker,Crop Visualization,Polygon Visualization,Detections Consensus,Detections Stabilizer,Line Counter,ByteTrack Tracker,Path Deviation,Detections Combine,Mask Area Measurement,Background Color Visualization,Model Monitoring Inference Aggregator,Stability AI Inpainting,GeoTag Detection,Corner Visualization,Track Class Lock,Roboflow Vision Events,Detections Transformation,Bounding Rectangle,Size Measurement,Overlap Analysis,Triangle Visualization,Roboflow Dataset Upload,OC-SORT Tracker,Dot Visualization,Halo Visualization,Label Visualization
Input and Output Bindings¶
The available connections depend on its binding kinds. Check what binding kinds
SAM3 Video Tracker in version v1 has.
Bindings
-
input
images(image): The image to infer on..class_names(Union[string,list_of_values]): Concepts to segment and track, as a list of phrases (or a single comma-separated string). Each emitted mask carries the concept it matched as its class name..model_id(roboflow_model_id): Streaming SAM3 model id resolved byinference_models..threshold(float): Minimum detection score for emitted masks. Scores come from SAM3's per-object concept detection head..
-
output
predictions(instance_segmentation_prediction): Prediction with detected bounding boxes and segmentation masks in form of sv.Detections(...) object.
Example JSON definition of step SAM3 Video Tracker in version v1
{
"name": "<your_step_name_here>",
"type": "roboflow_core/sam3_video@v1",
"images": "$inputs.image",
"class_names": [
"person",
"forklift"
],
"model_id": "sam3video",
"threshold": 0.5
}