Modèles VLA
RT-2 (Robotic Transformer 2)
Le VLA fondateur : premier à démontrer que les connaissances vision-langage à l'échelle du web se transfèrent directement au contrôle robotique en traitant les actions comme des tokens de texte. Il a engendré l'initiative RT-X / Open X-Embodiment sur laquelle reposent la plupart des VLA ouverts ultérieurs. Artefact de recherche, jamais publié en poids ni en produit.
Sources : Google DeepMind (2023-07-28)arXiv (2023-07-28)InfoQ (2023-10-01)
← Retour au comparateur · Modèles VLA