Modèles VLA

RT-2 (Robotic Transformer 2)

États-Unis

Le VLA fondateur : premier à démontrer que les connaissances vision-langage à l'échelle du web se transfèrent directement au contrôle robotique en traitant les actions comme des tokens de texte. Il a engendré l'initiative RT-X / Open X-Embodiment sur laquelle reposent la plupart des VLA ouverts ultérieurs. Artefact de recherche, jamais publié en poids ni en produit.

Mis à jour le 2026-07-09 · Dernière vérification 2026-07-09

OrganisationGoogle DeepMind
PaysUS
Sortie2023-07
Params (Mds)55
Poids ouvertsnon
ArchitectureVLA co-fine-tuned from web-scale VLMs (PaLI-X 55B and PaLM-E 12B variants); robot actions emitted as text tokens
Modalitésvision, language, action
Incarnationsmanipulator, mobile
Données d'entraînementInternet-scale vision-language data co-fine-tuned with RT-1 robot demonstrations (collected with 13 robots over 17 months)

Sources : Google DeepMind (2023-07-28)arXiv (2023-07-28)InfoQ (2023-10-01)

← Retour au comparateur · Modèles VLA
Christian Verbrugge

Christian Verbrugge · D·Fairy

Vous introduisez une solution physical AI dans l'industrie européenne ?

15 ans chez KUKA sur les programmes OEM automobile (100 M€), aujourd'hui IA embarquée et agents autonomes. J'accompagne les entreprises de robotique et d'IA incarnée sur leur entrée marché EMEA : accès OEM et Tier 1, pilotes cofinancés, AI Act.

Réserver un premier appel