Des anciens de la division de recherche de Meta lancent sur le marché un modèle de vision ouvert pour les ateliers et les entrepôts

21 septembre 20269 vues

Le startup Perceptron, fondée par deux anciens employés de FAIR, a présenté Isaac 0.5 — un modèle à poids ouverts qui, selon ses développeurs, combine perception et contrôle dans un environnement industriel. Le lecteur découvrira comment cette approche est conçue, sur quelles données le système a été entraîné et pourquoi il est considéré comme une alternative aux solutions à la fois spécialisées et généralistes dans le cloud.

Des anciens de la division de recherche de Meta lancent sur le marché un modèle de vision ouvert pour les ateliers et les entrepôts

Perceptron a lancé quoi

Perceptron est une startup fondée en novembre 2024. Elle a été créée par deux anciens chercheurs de Meta : Armen Aghajanyan et Akshat Shrivastava. Ils travaillaient au sein de Meta’s Fundamental AI Research (FAIR). C’est la division de recherche de Meta consacrée à l’IA.

Cette semaine, l’entreprise a lancé le modèle Isaac 0.5. Selon ses créateurs, il donne aux machines la capacité de “perceive, reason and act” dans des conditions industrielles. Le modèle est publié en open-weight. Les paramètres et les données d’entraînement peuvent donc être vérifiés par quiconque le souhaite.

L’entreprise voit son logiciel comme l’avenir du déploiement industriel automatisé.

Conclusion : Isaac 0.5 doit être considéré comme un modèle ouvert pour les tâches industrielles. La vérifiabilité des poids est un critère clé au moment du choix.

Enjeu : l’intelligence physique pour les entrepôts et les ateliers

Perceptron développe des frontier vision models. Ils doivent aider les machines à interagir plus efficacement avec les environnements physiques. Le logiciel peut aider les vision-guided robots à se déplacer dans des environnements complexes. Il s’agit de warehouses ou de factory floors.

L’entreprise décrit le problème ainsi : “Physical AI today forces a false choice”. D’un côté, les generalist foundation models, qui nécessitent plusieurs GPU cloud dédiés pour chaque instance. De l’autre, les narrow models, qui traitent la perception ou le contrôle, mais jamais les deux. Isaac 0.5 vise à donner aux machines la capacité de percevoir, raisonner et agir.

Shrivastava a proposé d’examiner un processus physique simple : l’organisation de cartons. Un robot déployé pour trier des colis doit accomplir de nombreuses étapes. D’abord lire l’étiquette sur l’emballage. Ensuite effectuer une analyse spatiale pour comprendre où se trouvent les cartons. Puis décider lequel soulever. S’il soulève une série de cartons, il doit planifier quels cartons soulever et dans quel ordre. Le logiciel de Perceptron est destiné à aider les robots à franchir chaque étape du processus.

Conclusion : le critère de choix est la capacité du modèle à couvrir tout le processus, de la perception à la planification des actions, et non une seule opération.

Comment Isaac 0.5 a été entraîné

Les modèles comme Isaac 0.5 acquièrent des compétences opérationnelles en absorbant de grands volumes de données vidéo d’entraînement. Perceptron affirme avoir entraîné son nouveau modèle sur un million d’heures de ce qu’on appelle la general video. C’est nécessaire pour apprendre à l’algorithme à reconnaître des conditions, des éléments visuels et des scénarios précis.

L’entreprise s’est également beaucoup appuyée sur l’ego video. Il s’agit de vidéos filmées à la première personne par une personne accomplissant une tâche physique. Elles sont tournées avec une GoPro ou une caméra portable. Des UMI video ont aussi été utilisées. Elles servent de la même manière à entraîner les systèmes d’IA aux mouvements en enregistrant des actions humaines répétées.

Perceptron ne divulgue pas les sources de ses données d’entraînement. Shrivastava a déclaré que l’entreprise avait “internally built petabyte-scale datasets that span across modalities”. Il a précisé : “whether it’s images, text, video, etc. all the way through robotic trajectories.”

Conclusion : le poids ouvert du modèle permet de vérifier les paramètres et les données d’entraînement. C’est un critère important pour les équipes qui ont besoin de vérifiabilité.

En quoi il diffère des modèles existants

Aghajanyan et Shrivastava affirment que leur outil diffère des modèles existants. Il est general-purpose, c’est-à-dire qu’il n’est pas conçu pour une tâche répétitive unique. Le modèle doit être flexible selon l’environnement ou la situation.

Le secteur dispose déjà de logiciels qui aident les machines à accomplir la plupart de ces tâches. Mais peu de programmes sont conçus pour le faire avec flexibilité. Voici une comparaison des approches, fondée sur les faits avancés par l’entreprise.

ApprocheCaractéristique clé
Generalist foundation modelsNécessitent plusieurs GPU cloud dédiés pour chaque instance
Narrow modelsTraitent la perception ou le contrôle, mais jamais les deux
Isaac 0.5General-purpose, open-weight, vise à perceive, reason and act

Aghajanyan a déclaré : “Nothing like this really exists out there.” Il a ajouté : “We’re really excited about it.”

Conclusion : si la tâche exige à la fois la perception et le contrôle dans un environnement changeant, les narrow models ne conviendront pas. Les generalist models nécessitent des GPU cloud dédiés pour chaque instance. Isaac 0.5 est présenté comme un compromis entre ces options.

Où l’entreprise prévoit de l’utiliser

La startup est prête à commercialiser son logiciel auprès de différents fournisseurs. L’entreprise peut potentiellement intégrer sa couche d’intelligence dans différents secteurs. Parmi eux : manufacturing, logistics and warehousing, security, mobility, ainsi que media and entertainment.

Le logiciel aide les vision-guided robots à se déplacer dans des environnements complexes, tels que les warehouses or factory floors. Il aide aussi les entreprises à extraire de l’intelligence visuelle des vidéos enregistrées par ces robots.

Conclusion : le critère pratique est la correspondance entre le secteur et le scénario. Pour les entrepôts et les ateliers, ce sont le déplacement en environnement complexe et l’extraction de données à partir de vidéos qui comptent. Pour security, mobility, media et entertainment, l’entreprise annonce une intégration potentielle.

Financement et statut

Perceptron a précédemment levé $21 million. Les investisseurs étaient Bessemer Venture Partners, Foundation Capital et S32. Cela ressort des données de Pitchbook. SmartGateVC a également participé au founding round de l’entreprise.

Selon TechCrunch, la startup est en train de finaliser un tour supplémentaire. Les autres conditions et délais ne sont pas divulgués.

Conclusion : l’entreprise dispose d’un financement de fonds de capital-risque et d’un intérêt annoncé pour un tour supplémentaire. Cela ne garantit pas la maturité du produit, mais réduit le risque d’un choix précoce.

Foire aux questions

Matériaux connexes

Tous matériaux