Erstellen Sie eine Full-Stack-Ökologie von der taktilen Wahrnehmung über die Datenerfassung bis hin zur körperlichen Intelligenz
Der X-TouchMind V1, das erste VTLA-Modell für körperliche Berührung, und der TacVerse 1k, der erste Multimode-Datensatz für körperliche Interaktion, wurden offiziell vorgestellt.
Diese Veröffentlichung markiert den Abschluss des Roboters von der taktilen Hardware-System, Datenerfassungssystem, um die vollständige technologische Ökologie von Datenanlagen und menschlichen Modellen, um die Entwicklung der taktilen Intelligenz von der Wahrnehmungsfähigkeit zu der Roboterintelligenz weiter voranzutreiben.
01 Die nächste Stufe der körperlichen Intelligenz: Von der modalen Nachfüllung bis zur haptischen Nativität
Während Roboter in die reale Welt eingesetzt werden, ist es bereits schwierig, sich allein auf visuelle Technologien zu verlassen, um komplexe Aufgaben zu erfüllen. Doch die ergänzenden haptischen Informationen, die oft durch einen spliced-Pfad durchlaufen, um sich in ein bestehendes physisches Modell zu integrieren, beschränken die Obergrenze der physischen Interaktionsfähigkeit.
Angesichts dieses Punktes in der Industrie glaubt Qishu, dass Berührung ein Schlüsselmodell ist, bei dem Roboter wirklich in die physische Welt eintreten, und dass es auf der Grundlage einer nativen Ökologie und um eine echte Szenarie mit starkem Kontakt gebaut werden muss.
Dadurch können Roboter nicht nur die Welt wahrnehmen, sondern auch komplexe physikalische Aufgaben verstehen und stabil erfüllen.
02 X-TouchMind V1: Das erste VTLA-Modell mit Touch
Das X-TouchMind V1 ist ein VTLA-Modell für körperliche Berührung, das auf visueller Berührung basiert.
X-TouchMind V1 konzentriert sich stärker auf den physischen Zustand nach dem Auftreten des Kontakts und vereint visuelle, sprachliche, taktische, bewegliche und physische Zustände des Roboters, um eine kollaborative Modellierung vom Aufgabenverständnis über die Bewegungsgenerierung bis zur Kontaktfeedback-Steuerung zu ermöglichen.
Das Modell hat eine schichtende Architektur, die den verschiedenen Ebenen des realen Roboterbetriebs entspricht:
System 2: Aufgabenverständnis- und Semantikrationsebene, die für das Verständnis der Umgebung, Aufgabenziele und Sprachanweisungen verantwortlich ist und die Antwort auf "was zu tun ist".
System 1: Bewegungsgeneration und Bahnplanungsschicht, die Bewegungswege basierend auf Visualisierung, Aufgabensemantik und Roboterzustand generiert und die Antwort auf "Wie tun".
System 0: Kontrollschicht für haptische und ontologische Interaktionen, bei realem Kontakt mit haptischem und ontologischem Feedback für eine hohe Frequenz-Korrektur und Antwort auf "Wie man nach dem Kontakt stabil und korrekt ist"
Durch diese Architektur kann X-TouchMind V1 nicht nur Bewegungsfolgen generieren, sondern auch Schiebe, Kraft, Veränderungen, Textur und Berührungsstabilität im realen Betrieb verstehen und Bewegungen dynamisch korrigieren, um die Stabilität des Roboters bei Aufgaben wie Feinbetrieb, flexibler Materialbearbeitung und intelligenter Qualitätskontrolle zu verbessern.
Für Contact-Rich-Touch-Aufgaben wie Entfernen, Ziehen, Komprimieren, Stecken, Gegenstellen und Wiederherstellen ist das Ziel des X-TouchMind V1 nicht, den Roboter eine Bewegungsdemonstration zu erledigen, sondern den Roboter in komplexen physischen Interaktionen stabil, zuverlässig und beschädigungsfrei zu ermöglichen.
03TacVerse 1k: Erste 1.000-stündige hochwertige visuell-taktile multimodale physische Datensätze
Der TacVerse 1k, der synchron mit dem X-TouchMind V1 veröffentlicht wurde, ist der erste Datensatz von 1.000 Stunden hochwertiger visueller, taktiler Multimodus, der für reale physische Interaktionen entwickelt wurde.
Auf der Datenerfassungsseite stützt sich TacVerse 1k auf ein eigenes Erfassungshardware-System, um die Datenproduktion vom Roboterkörper zu entkoppeln, um die Entkopplung der Kapazität, die Szenenentkopplung und die Wiederverwendung des Roboterkörpers zu erreichen. Auf der Grundlage dieses Systems können die Kosten für die Datenerfassung um mehr als 80 % gesenkt und die Effizienz um das Drei- bis Fünffache erhöht werden, was die Grundlage für eine massive, reale Interaktion bietet.
Auf der Datenqualitätsseite ist XTacFlow verantwortlich für die Vereinheitlichung der geplanten Erfassungsverbindungen, die Unterstützung eines einheitlichen Zugriffs auf mehrere Geräte, eine zeitliche Ausrichtung auf Millisekundenbereich und die Automatisierung der Datenrückgabe und Nachverarbeitung zu mehr als 90 Prozent, um die Rohdaten in trainierbare, nachverfolgbare und wiederverwendbare Datenproben und Trainingsressourcen umzuwandeln.
Die TacVerse 1k Datenstruktur ist nativ kompatibel mit den gängigen Roboterdatenformaten wie LeRobot, MCAP, HDF5 und ROS2 und standardisiert haptische Modus-Erweiterungsfelder, so dass Daten nicht nur intern verfügbar sind, sondern auch eine Basis für Branchenfreigabe, Wiederverwendung und Targeting sind.
Die ersten 100-stündigen Datensätze von TacVerse 1k sind am 30. Juli verfügbar und decken über 40 reale Szenen ab. Ab August werden 1.000-stündige Datensatzanträge in Batches geöffnet und offene Kooperationen über Plattformen wie Arizona Tower und Hugging Face vorangetrieben.
Orientiert auf reale Industrieaufgaben, um die Skalierung der physischen Intelligenz zu fördern
Die synchrone Veröffentlichung des X-TouchMind V1 und des TacVerse 1k markiert den offiziellen Beginn einer neuen Phase der Industrie.
Als Folge wird sich Qixu auf die industrielle Präzisionsmontage, die Verbraucherelektronikmontage, die flexible Logistik, die intelligente Qualitätsprüfung, die Authentifizierung von Verbrauchsgütern und den Bau von Rechenzentren konzentrieren, um eine tiefe Zusammenarbeit in mehreren Bereichen durchzuführen.
"Wir hoffen, dass die Veröffentlichung von X-TouchMind V1 und TacVerse 1k weiterhin Wert für die Industrie liefert und eine neue Phase des "Touch Native" eröffnet. ”
In Zukunft wird Qishu weiterhin technologische Iterationen und theoretische Erkundungen rund um „Touch Native“ und „Real Scenarios“ vorantreiben und gemeinsam mit der Industrie vorantreiben.
X-TouchMind V1, erstes VTLA-Modell mit physischer Berührung, und TacVerse 1k, erster multimodaler Datensatz mit visueller Berührung