விஎல்எம் மற்றும் விஎல்ஏ

VLM மற்றும் VLA ஒப்பீடு: ரோபோட்டிக்ஸிற்கு விஷன்-லாங்குவேஜ் மாடல்கள் ஏன் போதுமானதாக இல்லை

ரோபோட்டிக்ஸ் உரையாடல்களில் இரண்டு மாதிரி வகைகள் குழப்பப்படுகின்றன: பார்வை-மொழி மாதிரிகள் (vision-language models) மற்றும் பார்வை-மொழி-செயல் மாதிரிகள் (vision-language-action models). அவை கேட்பதற்கு ஒரே மாதிரியாகத் தோன்றினாலும், இரண்டுமே படங்களையும் உரைகளையும் உள்ளீடாகப் பெறுகின்றன, மேலும் இரண்டுமே பன்முறைமை முன்-பயிற்சியின் (multimodal pretraining) ஒரே மரபிலிருந்து வந்தவை. ஆனால், விவரிப்பதை மட்டும் செய்யாமல், இயங்கக்கூடிய ஒரு செயற்கை நுண்ணறிவு அமைப்பைச் செயல்படுத்த முயற்சிக்கும் எவருக்கும், இந்த வேறுபாடு மிகவும் தீர்க்கமானது. VLM மற்றும் VLA-க்கு இடையேயான வேறுபாடு என்பது, ஒரு காட்சியைப் புரிந்துகொள்ளும் மாதிரிக்கும், பௌதிக உலகத்துடன் தொடர்பை முழுமையாக்கும் மாதிரிக்கும் இடையேயானதாகும்.

ஒரு காட்சியைப் புரிந்துகொள்வது நடிப்பதைப் போன்றது அல்ல.

முக்கிய எடுத்துக்காட்டுகள்

  • VLM-கள் படங்களையும் உரையையும் மொழி வெளியீடுகளுடன் இணைக்கின்றன; VLA-கள் அவற்றை ரோபோவின் செயல்பாடுகளுடன் இணைக்கின்றன.
  • VLM-களால் ஒரு மோட்டார், கிரிப்பர் அல்லது எண்ட்-எஃபெக்டரை நேரடியாக இயக்க முடியாது.
  • ரோபோ செயல்விளக்கத் தரவுகளில் பயிற்சி அளிக்கப்பட்ட செயல் டோக்கன்களைக் கொண்டு VLA-க்கள் VLM-களை விரிவுபடுத்துகின்றன.
  • பெரும்பாலான VLA கட்டமைப்புகள், செயல்விளக்க அத்தியாயங்களில் VLM முதுகெலும்பு அமைப்பை நுட்பமாகச் சரிசெய்கின்றன.
  • செயல்பாட்டுத் தரத்திலான ரோபோட்டிக்ஸிற்கு, VLM தரவுகள் மட்டுமல்லாமல், VLA பாணியிலான பயிற்சித் தரவுகளும் தேவைப்படுகின்றன.
  • இவ்விரண்டையும் குழப்பிக்கொள்வது, உற்பத்தியில் ஒரு புலனுணர்வு மாதிரி என்ன செய்ய முடியும் என்பதை மிகையாக மதிப்பிடுவதற்கு வழிவகுக்கிறது.

VLM என்பது என்ன?

VLM (பார்வை-மொழி மாதிரி) என்பது படங்களையும் உரையையும் உள்ளீடாகப் பெற்று, உரை அல்லது கட்டமைக்கப்பட்ட வெளியீடுகளை உருவாக்கும் ஒரு பன்முறை நரம்பியல் வலையமைப்பு ஆகும். VLM-கள் மிகப் பெரிய அளவில் பட-உரை இணைகளில் பயிற்சி அளிக்கப்பட்டு, தலைப்பிடுதல், காட்சிவழி வினா-விடை மற்றும் காட்சிவழிப் பகுத்தறிவு ஆகியவற்றில் சிறந்து விளங்குகின்றன.

விஎல்எம் (VLM) என்றால் என்ன?

வி.எல்.எம்: பார்வை மற்றும் மொழி உள்ளீடுகளை உள்வாங்கி, தலைப்புகள், வகைப்பாடுகள் அல்லது தர்க்கத் தொடர்கள் போன்ற மொழி அல்லது குறியீட்டு வெளியீடுகளை உருவாக்கும் ஒரு பன்முறைமை மாதிரி.

வி.எல்.எம்-கள் சக்தி வாய்ந்தவை — ஆனால் அவற்றின் வெளியீட்டு வெளி குறியீட்டு ரீதியானது, பௌதீகமானது அல்ல. அவற்றால் ஒரு சமையலறையில் என்ன நடக்கிறது என்பதை விவரிக்கவோ, ஒரு பொருளை அடையாளம் காணவோ, அல்லது ஒரு காட்சியைப் பற்றிய கேள்விகளுக்குப் பதிலளிக்கவோ முடியும். ஆனால், அவற்றால் எதையும் நேரடியாகப் பெற முடியாது.

VLA என்பது என்ன?

VLA (பார்வை-மொழி-செயல்) மாதிரி என்பது பார்வை மற்றும் மொழி உள்ளீடுகளைப் பெற்று, ரோபோவின் செயல்பாட்டுத் தொடர்களை உருவாக்கும் ஒரு பன்முறைமை மாதிரி ஆகும். அதன் வெளியீட்டு வெளியில், இயக்கக் கட்டளைகள், இறுதி-செயல்பாட்டாளரின் நிலைகள் அல்லது தொடர்ச்சியான கட்டுப்பாட்டு சமிக்ஞைகளாகப் பொருள்மாற்றம் செய்யப்படும் செயல்பாட்டுக் குறியீடுகள் ஆகியவை அடங்கும்.

VLA என்றால் என்ன?

வி.எல்.ஏ: உரையை அல்லாமல் செயல்களை வெளியிடும் ஒரு ரோபோ அடித்தள மாதிரி — இது பொதுவாக ஒரு ரோபோவின் இயக்கச் சுதந்திரங்களுடன் பொருந்தக்கூடிய, துண்டாக்கப்பட்ட இயக்கக் குறியீடுகளை வெளியிடும்.

இந்த முன்மாதிரியை நிறுவிய அடித்தளக் கட்டுரைகளில் ஒன்றில், RT-2 ரோபோ செயல்விளக்கத் தரவுகளில் பார்வை-மொழி முதுகெலும்புகளைச் செம்மைப்படுத்தி, துண்டாக்கப்பட்ட செயல் குறியீடுகளை வெளியிட்டது (டீப்மைண்ட், 2023). உரையிலிருந்து செயலுக்கான அந்த வெளியீட்டு மாற்றமே முழுமையான கட்டமைப்பு வேறுபாடு ஆகும்.

VLM மற்றும் VLA பயிற்சித் தரவுகள் எவ்வாறு வேறுபடுகின்றன?

VLM மற்றும் VLA பயிற்சித் தரவுகள் எவ்வாறு வேறுபடுகின்றன?

VLM பயிற்சித் தரவு மற்றும் VLA பயிற்சித் தரவு ஆகியவை ஒவ்வொரு எடுத்துக்காட்டின் முடிவிலும் உள்ளவற்றில் வேறுபடுகின்றன. ஒரு VLM எடுத்துக்காட்டு, ஒரு படத்துடன் ஒரு தலைப்பு அல்லது கேள்வி-பதிலை இணைக்கிறது. ஒரு VLA எடுத்துக்காட்டு, ஒரு படத்துடன் ஒரு அறிவுறுத்தலையும், ஒரு குறிப்பிட்ட ரோபோ உருவமைப்பை அடிப்படையாகக் கொண்ட ஒரு செயல் பாதையையும் இணைக்கிறது.

ஒரு பயனுள்ள ஒப்புமை: ஒரு VLM என்பவர், ஒவ்வொரு ஆட்டத்தையும் விரிவாக விவரிக்கக்கூடிய, ஆனால் ஒருபோதும் பந்தைக் கையில் பிடித்திராத ஒரு விளையாட்டு ஆய்வாளரைப் போன்றவர். ஒரு VLA என்பவர் ஆட்டக்காரர். ஆய்வாளரின் நிபுணத்துவம் உண்மையானது மற்றும் பயனுள்ளது — ஆனால் அது பந்தைக் கையாளும் பயிற்சிகளுக்கு மாற்றாக அமையாது. VLA பயிற்சித் தரவுகளே அந்தப் பயிற்சிகள்: மில்லியன் கணக்கான அத்தியாயங்களில் மீண்டும் மீண்டும் செய்யப்படும் ஒத்திசைக்கப்பட்ட அவதானிப்புகள், மொழி வழிமுறைகள், செயல் குறியீடுகள் மற்றும் விளைவுக் குறிகாட்டிகள்.

ரோபோட்டிக்ஸுக்கு நீங்கள் ஏன் ஒரு VLM-ஐப் பயன்படுத்தக் கூடாது?

ரோபோடிக்ஸிற்கான விஎல்எம்ரோபோவியலுக்கு VLM-ஐ நேரடியாகப் பயன்படுத்த முடியாது, ஏனெனில் அதன் வெளியீட்டு டோக்கன் வெளி, இயக்கக் கட்டளைகளுடன் ஒத்துப்போவதில்லை. ஒரு VLM சொற்களை வெளியிடுகிறது; ஆனால் ஒரு ரோபோவிற்கு மூட்டுக் கோணங்கள், இறுதி-செயல்பாட்டாளரின் திசைவேகங்கள் அல்லது பற்றிக்கொள்ளியின் நிலைகள் தேவைப்படுகின்றன. "கோப்பை இடதுபுறத்தில் உள்ளது" என்பதற்கும் "மணிக்கட்டை 4 செ.மீ இடதுபுறமாக நகர்த்தி, பற்றிக்கொள்ளியை மூடு" என்பதற்கும் இடையிலான இடைவெளியைத்தான் ஒரு VLA நிரப்புகிறது.

நடைமுறையில், பல குழுக்கள், சொற்களைப் போலக் கருதப்படும் துண்டாக்கப்பட்ட இயக்க அலகுகளான செயல் டோக்கன்களைக் கொண்டு வெளியீட்டுச் சொற்களஞ்சியத்தை விரிவுபடுத்துவதன் மூலம், VLM-களை VLA-களாகச் செம்மைப்படுத்துகின்றன. இது VLM-இன் பகுத்தறிவைப் பாதுகாப்பதோடு, அது செயல்படுவதற்கான ஒரு வழியையும் வழங்குகிறது.

செயல்பாட்டு டோக்கன்: ஒரு மொழிச் சொல்லைக் கணிப்பதைப் போலவே ஒரு மாதிரியாலும் கணிக்கக்கூடிய, சொற்களஞ்சிய உள்ளீடாகக் குறியாக்கம் செய்யப்பட்ட ஒரு துண்டாக்கப்பட்ட ரோபோ இயக்கம்.

ஒரு உயர்தர VLM-க்கு உரிமம் பெற்று, அது ஒரு பொருளை எடுத்து வைக்கும் ரோபோவை இயக்க முடியும் என்று கருதும் ஒரு லாஜிஸ்டிக்ஸ் ஸ்டார்ட்அப் நிறுவனத்தைக் கற்பனை செய்து பாருங்கள். அந்த மாடல் காட்சியைப் பிழையின்றி உணர்ந்து, சரியான திட்டத்தை விவரிக்கிறது, ஆனால் எந்த இயக்கக் கட்டளைகளையும் உருவாக்குவதில்லை. ஆக்சன்-டோக்கன் பயிற்சி இல்லாமல், அந்த அமைப்பு வெறும் விவரிப்பு நிலையிலேயே நின்றுவிடுகிறது. அதன் மீது VLA தரவைச் சேர்ப்பதுதான், அதைச் செயல்பாட்டிற்குக் கொண்டுவர வழிவகுக்கிறது.

விஎல்எம் மற்றும் விஎல்ஏ: அருகருகே

பரிமாணத்தை வி.எல்.எம் வி.எல்.ஏ
உள்ளீடு படங்கள் + உரை படங்கள் + உரை + (பெரும்பாலும்) ரோபோ நிலை
வெளியீடு மொழி / குறியீட்டு செயல்பாட்டு டோக்கன்கள் / மோட்டார் கட்டளைகள்
பயிற்சி தரவு பட-உரை ஜோடிகள் செயல் பாதைகளைக் கொண்ட அத்தியாயங்கள்
வழக்கைப் பயன்படுத்தவும் வசன வரிகள், VQA, பகுத்தறிவு ரோபோட்டிக்ஸ், தன்னாட்சி, உருவமைக்கப்பட்ட செயற்கை நுண்ணறிவு
உருவகம் கர்மா இல்லை ஒரு குறிப்பிட்ட ரோபோ அல்லது குடும்பத்துடன் தொடர்புடையது
மதிப்பீட்டு துல்லியம், ப்ளூ, உதவிகரமான தன்மை பணி வெற்றி, OOD பொதுமைப்படுத்தல், பாதுகாப்பு

ஒவ்வொன்றையும் எப்போது பயன்படுத்த வேண்டும்?

ஒரு பணி விளக்கம், முடிவு அல்லது உரை வடிவப் பதிலில் முடிவடையும்போது VLM-ஐப் பயன்படுத்தவும். ஒரு பணி உடல்ரீதியான செயலில் முடிவடையும்போது VLA-ஐப் பயன்படுத்தவும்.

கலப்பின அமைப்புகளில், இரண்டுக்குமே ஒரு பங்கு உண்டு. VLM-கள் உயர்-நிலை காட்சிப் புரிதல், உரையாடல் மற்றும் பகுத்தறிதலைக் கையாளுகின்றன. VLA-கள் மூடிய-சுற்று கட்டுப்பாட்டைக் கையாளுகின்றன. பல தயாரிப்புக் கட்டமைப்புகள் ஒரு VLM-ஐ திட்டமிடுபவராகவும், ஒரு VLA-ஐ செயல்படுத்துபவராகவும் பயன்படுத்துகின்றன — சில சமயங்களில், இவ்விரண்டிற்கும் இடையில் மறைநிலை பிரதிநிதித்துவங்களைப் பரிமாறிக்கொள்ளும் இரட்டை-அமைப்பு வடிவமைப்புகளில் இது நிகழ்கிறது. இந்த வேறுபாடு முக்கியமானது, ஏனெனில் அவற்றுக்கு அடிப்படையில் வேறுபட்ட பயிற்சித் தரவுகள், மதிப்பீட்டு அளவுகோல்கள் மற்றும் தரக் கட்டுப்பாடுகள் தேவைப்படுகின்றன. ஷைப்பின் கணினி பார்வை சேவைகள் மற்றும் உடல் AI தரவு செயல்பாடுகள் அந்த நிறமாலையின் இரு முனைகளையும் உள்ளடக்கியுள்ளன.

தீர்மானம்

VLM மற்றும் VLA-க்கு இடையேயான ஒப்பீடு ஒரு போட்டியல்ல; அது ஒரு பணிப் பங்கீடு. உருவமைக்கப்பட்ட செயற்கை நுண்ணறிவுக்கு (embodied AI) இரண்டுமே இன்றியமையாதவை, மேலும் இரண்டுமே தத்தமது பணிக்குப் பொருத்தமான பயிற்சித் தரவுகளைச் சார்ந்துள்ளன. சரியான மாதிரியைத் தேர்ந்தெடுப்பது என்பது, அதைச் சரியான வெளியீட்டு வெளியுடனும் (output space) மற்றும் அதனை ஆதரிக்கும் சரியான தரவுத்தொகுப்பு அடுக்குடனும் (dataset stack) பொருத்துவதாகும்.

VLA என்பது பார்வை-மொழி-செயல் என்பதன் சுருக்கமாகும். இது பார்வை மற்றும் மொழி உள்ளீடுகளைப் பெற்று, ரோபோவின் செயல்பாடுகளை வெளியிடும் ஒரு வகை மாதிரி ஆகும். இதன் முக்கிய அம்சம் செயல்பாடு கூறு ஆகும் — இதுவே, உரை அல்லது குறியீட்டு வெளியீடுகளை மட்டுமே உருவாக்கிய முந்தைய பார்வை-மொழி மாதிரிகளிலிருந்து VLA-க்களை வேறுபடுத்துகிறது.

விரிவாக்கப்பட்ட செயல்-குறியீட்டுச் சொற்களஞ்சியத்துடன் கூடிய ரோபோ செயல்விளக்கத் தரவுகளில் நுணுக்கமாகச் சரிசெய்வதன் மூலம், ஒரு மெய்நிகர் மொழி கட்டமைப்பை (VLM) மெய்நிகர் மொழிச் செயல்பாடாக (VLA) மாற்ற முடியும். பெரும்பாலான நவீன மெய்நிகர் மொழிச் செயல்பாடுகள் இந்த வழியில்தான் கட்டமைக்கப்படுகின்றன; இவை, இயக்கக் கட்டளைகளை வெளியிடக் கற்றுக்கொடுக்கும் அதே வேளையில், மெய்நிகர் மொழி கட்டமைப்பின் பகுத்தறிவையும் பாதுகாக்கின்றன. இந்த நுணுக்கமாகச் சரிசெய்யும் படிநிலைக்கு, வெறும் கூடுதல் உரை மட்டுமல்ல, உயர்தரமான, செயலுடன் இணைந்த தரவுத்தொகுப்புகளும் தேவைப்படுகின்றன.

VLA என்பது வேறுபட்ட தலைப்பைக் கொண்ட ஒரு VLM-ஐ விட மேலானது. பல கட்டமைப்புகள் VLM-இன் முதுகெலும்பைப் பகிர்ந்துகொண்டாலும், VLA-க்கள் செயல்பாட்டு டிகோடர்கள், உருவமைப்பு-உணரும் டோக்கனைசேஷன் மற்றும் பௌதீகக் கட்டுப்பாட்டுடன் இணைக்கப்பட்ட இழப்புச் செயல்பாடுகளைச் சேர்க்கின்றன. சில வடிவமைப்புகள் திட்டமிடலையும் செயலாக்கத்தையும் தனித்தனி VLM மற்றும் VLA தொகுதிகளாகப் பிரிக்கின்றன, அவை மறைநிலை பிரதிநிதித்துவங்களைப் பரிமாறிக்கொள்கின்றன.

VLM மற்றும் VLA-வை ஒப்பிட்டுப் பார்ப்பதற்கான மிக எளிய சோதனை, அந்த மாடல் என்ன வெளியீட்டைத் தருகிறது என்று கேட்பதுதான். அந்த வெளியீடு ஒரு வாக்கியம், தலைப்பு, வகைப்பாடு அல்லது தர்க்கச் சங்கிலியாக இருந்தால், அந்த மாடல் ஒரு VLM ஆகும். அந்த வெளியீடு ஒரு மோட்டார் கட்டளை, மூட்டுக் கோணம் அல்லது ஒரு ரோபோவை இயக்கும் செயல் குறியீடாக இருந்தால், அந்த மாடல் ஒரு VLA ஆகும். உள்ளீட்டு முறை அல்ல, வெளியீட்டு வெளியே அதன் வகையை வரையறுக்கிறது.

மொத்த டோக்கன் எண்ணிக்கை குறைவாக இருந்தாலும் கூட, VLM-களை விட VLA-க்களுக்கு பொதுவாக அதிக அளவில் தொகுக்கப்பட்ட, கட்டமைக்கப்பட்ட தரவுகள் தேவைப்படுகின்றன. VLM பயிற்சியானது, இரைச்சல் மிகுந்த இணைய அளவிலான பட-உரை இணைகளைப் பயன்படுத்துகிறது. VLA பயிற்சிக்கு செயல் பாதைகள், எபிசோட் அளவிலான மொழி சீரமைப்பு மற்றும் தெளிவான வெற்றிக் குறியீடுகள் தேவைப்படுகின்றன — இவை அனைத்துமே கட்டமைக்கப்பட்ட தரவு சேகரிப்பு மற்றும் குறிப்புரை வழங்கும் செயல்முறைகளைக் கோருகின்றன.

VLA மதிப்பீட்டிற்கு VLM அளவுகோல்கள் வரையறுக்கப்பட்ட பயன்பாட்டையே கொண்டுள்ளன. வசனத் துல்லியம் மற்றும் காட்சிவழி வினா-விடை ஆகியவை புலனுணர்வையும் பகுத்தறிவையும் அளவிடுகின்றனவே தவிர, கட்டுப்பாட்டை அல்ல. VLA மதிப்பீடானது, பணியின் வெற்றி விகிதம், இதுவரை காணாத பொருள்கள் மற்றும் சூழல்களுக்குப் பொதுமைப்படுத்துதல், மற்றும் பாதுகாப்பு-படிநிலைப்படுத்தப்பட்ட சூழ்நிலைகளில் அதன் செயல்திறன் ஆகியவற்றைச் சார்ந்துள்ளது — இந்த அளவீடுகளைத் தற்போதுள்ள எந்த VLM அளவுகோலும் உள்ளடக்குவதில்லை.

இந்தக் கட்டுரை உங்களுக்குப் பிடித்திருந்ததா? மேலும் தகவல்களுக்கு லிங்க்ட்இனில் ஷைப்பைப் பின்தொடரவும்.

சமூக பகிர்