Al grand modèle vers la multimodalité

Jan 04, 2025 Laisser un message

Avez-vous entendu parler du paradoxe de Moravec? Le paradoxe déclare que le raisonnement avancé nécessite très peu de pouvoir de calcul pour un système d'intelligence artificielle (IA), tout en mettant en œuvre les compétences perceptuelles-moteur que les humains tiennent pour acquises nécessitent d'énormes ressources de calcul. En substance, les tâches logiques complexes sont plus faciles pour l'IA que les tâches sensorielles de base que les instincts humains peuvent accomplir. Ce paradoxe met en évidence la différence entre l'IA et les capacités cognitives humaines à ce stade.


Les gens sont intrinsèquement multimodaux. Chacun de nous est comme un terminal intelligent qui doit généralement aller à l'école pour être éduqué (formé), mais le but et le résultat de cette formation et de l'apprentissage est que nous avons la capacité de travailler et de vivre de manière autonome sans toujours compter sur des instructions externes et contrôle.


Nous apprenons le monde qui nous entoure à travers plusieurs modalités sensorielles telles que la vue, la parole, le son, le toucher, le goût et l'odeur pour analyser, raisonner, décider et agir.


Après des années de fusion de capteurs et d'évolution de l'IA, les robots sont largement équipés de capteurs multimodaux à ce stade. Alors que nous apportons plus de puissance de calcul aux appareils Edge tels que les robots, ces appareils deviennent de plus en plus intelligents, capables de détecter leur environnement, de comprendre et de communiquer dans le langage naturel, d'acquérir des haptiques à travers des interfaces de détection numérique, ainsi que de détecter la force spécifique du robot, vitesse angulaire, et même le champ magnétique autour du robot à travers une combinaison d'accéléromètres, de gyroscopes et de magnétomètres, et plus encore.


Vers une nouvelle ère de robotique et de cognition machine


Avant le transformateur et les grands modèles de langage (LLMS), la mise en œuvre de la multimodalité dans l'IA nécessitait généralement l'utilisation de plusieurs modèles distincts responsables de différents types de données (texte, images, audio) et l'intégration des différentes modalités via un processus complexe.


Avec l'avènement des modèles de transformateurs et des LLM, la multimodalité est devenue plus intégrée, permettant à un seul modèle de traiter et de comprendre simultanément plusieurs types de données, ce qui entraîne des systèmes d'IA qui sont plus capables de détecter de manière globale leur environnement. Ce changement a considérablement amélioré l'efficacité et l'efficacité des applications d'IA multimodales.


Alors que les LLM tels que GPT -3 sont principalement basés sur du texte, l'industrie a fait des progrès rapides vers la multimodalité. Depuis le clip d'Openai et Dall-E, et maintenant Sora et GPT -4 O, sont des exemples de modèles qui se sont déplacés vers la multimodalité et l'interaction humaine-ordinateur plus naturelle. Par exemple, Clip comprend des images associées à un langage naturel, combler ainsi l'écart entre les informations visuelles et textuelles; Dall-E vise à générer des images en fonction des descriptions textuelles. Nous voyons le modèle Google Gemini subir une évolution similaire.


En 2024, l'évolution multimodale accélère. En février, OpenAI a publié Sora, qui génère des vidéos réalistes ou imaginatives basées sur des descriptions de texte. Lorsque vous y réfléchissez, cela pourrait fournir un chemin prometteur pour construire des simulateurs mondiaux universels, ou devenir un outil important pour la formation des robots. Après trois mois, GPT -4 O a considérablement amélioré les performances de l'interaction humaine-robot et est capable de raisonner en temps réel entre l'audio, la vision et le texte. La combinaison d'informations de texte, visuel et audio pour former un nouveau modèle de bout en bout élimine deux transitions modales de la modalité d'entrée au texte, puis du texte à la modalité de sortie, ce qui améliore considérablement les performances.


Au cours de la même semaine de février, Google a publié Gemini 1.5, qui a considérablement élargi la durée du contexte à 1 million de jetons. Cela signifie que 1.5 Pro peut traiter de grandes quantités d'informations à la fois, y compris une heure de vidéo, 11 heures d'audio et une base de code qui contient plus de 30, 000 lignes de code ou 700, 000 Words.gemini 1.5 est construit sur les principales recherches de Google sur l'architecture d'experts transformateurs et les membres mixtes (MOE) et les modèles open-source 2b et 7b qui peuvent être déployés du côté. Lors de la conférence Google I / S en mai, en plus de doubler la durée du contexte et de publier une série d'outils et d'applications génératifs d'IA, Google a exploré sa vision de l'avenir de Project Astra, un assistant d'IA à usage général qui traite l'information multimodale , comprend le contexte dans lequel un utilisateur est placé et interagit avec les gens dans les conversations de manière très naturelle.


En tant que société derrière l'Open-source LLM Llama, Meta rejoint également la piste générale de l'intelligence artificielle (AGI).


Cette véritable multimodalité augmente considérablement le niveau d'intelligence des machines et conduira à de nouveaux paradigmes pour de nombreuses industries.


Par exemple, les robots étaient très homogènes, avec certains capteurs et capacités de locomotion, mais généralement ils n'avaient pas le "cerveau" pour apprendre de nouvelles choses et s'adapter à des environnements non structurés et inconnus.


Les LLM multimodales devraient transformer la capacité des robots à analyser, raisonner et apprendre, en les faisant passer de la spécialisation à la généralisation. Les PC, les serveurs et les smartphones sont des leaders des plates-formes informatiques à usage général et peuvent exécuter de nombreux types d'applications logicielles pour atteindre une grande variété de fonctions. La généralisation aidera à augmenter, générant des économies d'échelle et les prix peuvent être considérablement réduits à mesure qu'ils augmentent, conduisant à un cycle d'adoption vertueux dans plus de domaines.


Elon Musk a remarqué les avantages de la technologie généralisée dès le début, alors que les robots de Tesla ont évolué de Bumblebee en 2022 à Optimus Gen 1, annoncé en mars 2023, et la génération 2, annoncé fin 2023, avec des capacités de polyvalence et d'apprentissage toujours croissantes. Au cours des derniers mois 6-12, nous avons assisté à un certain nombre de percées dans le domaine de la robotique et de la robotique humanoïde.


Les nouvelles technologies derrière la robotique de nouvelle génération et l'intelligence incarnée


Il ne fait aucun doute que nous avons encore beaucoup de travail à faire avant que l'intelligence incarnée atteigne la production de masse. Nous avons besoin de conceptions plus légères, de temps d'exécution plus longs et des plates-formes informatiques de bord plus rapides et plus puissantes pour traiter et fusionner les informations de données de capteur pour prendre des décisions et contrôler les actions opportunes.


Et nous nous dirigeons vers la création de robots humanoïdes; Des milliers d'années de civilisation humaine ont produit des environnements omniprésents conçus pour les humains, et les systèmes robotiques humanoïdes devraient être en mesure d'interagir confortablement avec les humains et de l'environnement et d'effectuer des opérations requises dans des environnements existants humains en raison de leur similitude de forme avec les gens. Ces systèmes seront bien adaptés pour gérer les tâches sales, dangereuses et ennuyeuses telles que les soins aux patients et la réadaptation, le travail de service dans l'industrie de l'hôtelle . De telles applications utilisent des attributs humains de la machine humanoïde pour faciliter les interactions naturelles du robot humain, agir dans des espaces centrés sur l'homme et effectuer des tâches qui sont souvent difficiles à réaliser pour les robots traditionnels.


De nombreuses sociétés d'IA et de robotique lancent de nouvelles recherches et collaboration autour de la façon de former des robots pour mieux raisonner et planifier de nouveaux environnements non structurés. Comme les nouveaux «cerveaux» des robots, les modèles pré-formés sur de grandes quantités de données ont d'excellentes capacités de généralisation, permettant aux robots de voir et de comprendre leur environnement de manière plus exhaustive, d'ajuster leurs mouvements et d'actions en fonction de la rétroaction sensorielle et d'optimiser leurs performances Dans une variété d'environnements dynamiques.


Comme exemple intéressant, le chien robot de Boston Dynamics, Spot, peut servir de guide dans un musée, interagissant avec les visiteurs, les présentant aux différentes expositions et répondant à leurs questions. Il peut être difficile de croire, mais dans ce cas d'utilisation, les performances divertissantes, interactives et subtiles de Spot sont plus importantes que de s'assurer que les faits sont corrects.


Transformateur robotique: le nouveau cerveau de la robotique


Le transformateur robotique (RT) évolue rapidement pour traduire les entrées multimodales directement dans le code exploitable. RT de Google DeepMind -2 effectue ainsi que son prédécesseur, RT -1, avec un taux de réussite proche de 100% lors de l'exécution de tâches qui ont été vues auparavant. Cependant, lorsqu'il est formé avec Palm-E (un modèle de langage multimodal incarné par robot) et Pali-X (un modèle de vision et de langage multilingue à grande échelle, non spécifiquement conçus pour les robots), RT -2 a de meilleures capacités de généralisation et surpasse RT -1 sur les tâches invisibles.


Microsoft a introduit Llava, un adjoint à la langue et à la vision à grande échelle. Conçu à l'origine pour les tâches textuelles, Llava exploite la puissance de GPT -4 pour créer un nouveau paradigme pour les instructions multimodales pour suivre les données, intégrant de manière transparente les composants textuels et visuels, qui peuvent être utiles pour les tâches robotiques. Lors de son introduction, LLAVA a établi de nouveaux enregistrements pour le chat multimodal et les tâches de quiz scientifiques, dépassant déjà les capacités moyennes humaines.


Comme mentionné précédemment, l'incursion de Tesla dans Humanoid et IA General Purpose Robotics est significative non seulement parce qu'elle est conçue pour l'échelle et la production de masse, mais aussi parce que la Fondation technologique forte entièrement autonome (FSD) de l'autopilote de Tesla pour les automobiles peut être utilisée pour robots. Tesla a également un cas d'utilisation de fabrication intelligente pour appliquer Optimus à son nouveau processus de production de véhicules énergétiques.


ARM est la pierre angulaire de l'avenir de la robotique


ARM estime que le cerveau robotique, à la fois le "grand cerveau" et le "petit cerveau", devrait être un système informatique hétérogène d'IA qui offre des performances supérieures, une réponse en temps réel et une efficacité énergétique.

 

news-800-1

 

La robotique implique un large éventail de tâches, y compris le calcul de base (par exemple, l'envoi et la réception de signaux vers et depuis les moteurs), le traitement avancé des données (par exemple, l'interprétation des données d'image et de capteurs) et l'exécution des LLM multimodales mentionnées précédemment. Le CPU est bien adapté aux tâches à usage général, tandis que les pédales de gaz et les GPU AI peuvent gérer plus efficacement les tâches de traitement parallèle, telles que l'apprentissage automatique (ML) et le traitement des graphiques. Des pédales de gaz supplémentaires telles que les processeurs de signaux d'image et les codecs vidéo peuvent également être intégrés pour améliorer les capacités de vision du robot et l'efficacité de stockage / transmission. De plus, le CPU doit avoir une réactivité en temps réel et doit être en mesure d'exécuter des systèmes d'exploitation tels que les packages Linux et ROS.


Lorsqu'il est étendu à la pile logicielle robotique, la couche de système d'exploitation peut également nécessiter un système d'exploitation en temps réel (RTOS) qui peut gérer de manière fiable les tâches critiques, ainsi qu'une distribution Linux personnalisée pour la robotique, telles que ROS, qui peuvent fournir Services conçus pour les grappes informatiques hétérogènes. Nous pensons que les normes et les programmes de certification parrainés par ARM tels que SystemReady et PSA certifié aideront à mettre à l'échelle le développement de logiciels robotiques. SystemReady est conçu pour garantir que les distributions standard des SG riches fonctionnent sur une large gamme de systèmes sur puce (SOC) en fonction de l'architecture ARM, tandis que la certification PSA aide à simplifier les solutions de mise en œuvre de sécurité pour répondre aux exigences de sécurité et réglementaires régionales pour les appareils connectés.


Les progrès des modèles multimodaux à grande échelle et de l'IA génératrice annoncent une nouvelle ère dans le développement de robots d'IA et de robots humanoïdes. Parallèlement à l'informatique de l'IA et aux écosystèmes, l'efficacité énergétique, la sécurité et la sécurité fonctionnelle sont essentielles pour rendre la robotique courant dans cette nouvelle ère. Les processeurs ARM sont déjà largement utilisés en robotique, et nous sommes impatients de travailler en étroite collaboration avec l'écosystème pour faire du bras une pierre angulaire de l'avenir de la robotique de l'IA.

Envoyez demande

whatsapp

Téléphone

Messagerie

Enquête