Pre-trained Vision ModelGrounding DINOby IDEA ResearchTaskdetectionArchitectureDETR-style transformer (DINO) with grounded language-image pre-training; Swin backbone; open-set via text promptsFrameworkPyTorchSign in to save Grounding DINO