


Masterarbeit Vision-Centric 4D Occupancy World Model (all genders)
Vor 4 TagenDas könntest du laut kununu User:innen als Marktforschungsassistent:in in Deutschland verdienen
Kurzbeschreibung
Wie können Roboter lernen, die zukünftige 3D-Welt allein auf Basis visueller Informationen zu verstehen und vorherzusagen? World Models entwickeln sich zu einem wichtigen Paradigma in der Robotik und ermöglichen intelligenten Systemen, zu schlussfolgern, wie sich ihre Umgebung über die Zeit verändert. Diese Fähigkeit ist insbesondere für dynamische Robotikanwendungen wie autonome Fahrzeuge von großer Bedeutung, bei denen die Vorhersage zukünftiger Szenengeometrie, Semantik und Bewegung eine wichtige Grundlage für sichere Interaktion und Entscheidungsfindung darstellt. Semantic 4D Occupancy bietet hierfür eine strukturierte Repräsentation der sich verändernden 3D-Welt, indem Geometrie, Semantik und Dynamik einer Szene gemeinsam modelliert werden. Eine zentrale Herausforderung liegt jedoch in der benötigten Überprüfung: Aktuelle Occupancy-Modelle stützen sich oft auf teure, aufwendige, dicht annotierte 3D-Voxel-Daten, die schwer zu beschaffen und zu skalieren sind.
Im Rahmen dieser Masterarbeit untersuchst du, wie Bildverarbeitungs-Grundmodelle wie DINOv2, CLIP oder SAM als skalierbare semantische Lehrer für ein vision-centric Occupancy World Model eingesetzt werden können. Durch die Übertragung semantischen Wissens aus vortrainierten 2D-Modellen auf räumlich-zeitliche 3D-/4D-Repräsentationen soll die Abhängigkeit von dichten 3D-Annotationen reduziert werden, ohne dabei die Qualität der Vorhersage zukünftiger Szenen zu beeinträchtigen. Du entwickelst und evaluierst ein durch Grundmodelle unterstütztes Predictive Occupancy World Model auf Basis von Multi-View-Kamerasequenzen. Dabei untersuchst du insbesondere Ansätze zum Semantic Feature Alignment und zur Knowledge Distillation, mit dem Ziel, skalierbare 4D-Occupancy-Vorhersagen für dynamische Robotikumgebungen wie das autonome Fahren zu ermöglichen.
Diese Aufgaben interessieren Dich
- Entwicklung eines visionszentrierten Occupancy Worl Models auf Basis von Transformer-Architekturen zur Vorhersage zukünftiger semantischer 4D-Occupancy aus sequenziellen Multi-View-Kamera-Eingaben.
- Aufbau und Training der Pipelines mit PyTorch, Entwicklung von Alignment-Mechanismen zur Destillation semantischer Merkmale aus 2D-Grundmodellen in deine 4D-raum-zeitliche Weltdarstellung.
- Durchführung von Benchmarks anhand voll überwachter Basismodelle auf groß angelegten Datensätzen (z. B. nuScenes), mit Fokus auf Prognosegenauigkeit (IoU), semantische Präzision und Label-Effizienz.
Das zeichnet Dich aus
- Du bist eingeschrieben in einem Masterstudium der Informatik, Künstlichen Intelligenz, Robotik oder eines vergleichbaren Studiengangs.
- Du verfügst über sehr gute Programmierkenntnisse in Python sowie fundierte Erfahrung mit Deep-Learning-Frameworks (insbesondere PyTorch).
- Du bringst fundiertes Hintergrundwissen im Bereich 3D Computer Vision mit. Praktische Erfahrung mit semantischer Segmentierung, Occupancy Networks oder 3D Gaussian Splatting ist von großem Vorteil.
- Du besitzt Kenntnisse über Vision Transformers (ViT), Foundation Models (DINO, CLIP) sowie Paradigmen des selbst- bzw. schwach überwachten Lernens (Self-/Weakly-Supervised Learning).
- Du hast eine selbstständige und lösungsorientierte Arbeitsweise, hohe Motivation sowie sehr gute Englisch- und Deutschkenntnisse (C1-Niveau) für eine klare Kommunikation im Team und mit unseren Partnern.
Deine Ansprechpartnerin
Daniela
+49 821 885882-0
work@xitaso.com

Ähnliche Jobs, die dich interessieren könnten




