রোবট সাধারণত নমনীয়তার জন্য পরিচিত নয়: একটি মাত্র নড়াচড়ার জন্য হাজার হাজার পুনরাবৃত্তি, আর আলো বা বস্তুর আকারের সামান্য পরিবর্তনই দক্ষতা ভেঙে দিতে পারে। কেমব্রিজের (ম্যাসাচুসেটস) স্টার্টআপ Generalist AI এই যুক্তিটাকে উল্টে দিতে চাইছে। দীর্ঘ প্রশিক্ষণের বদলে মেশিনের জন্য একটি ছোট ভিডিও একবার দেখা যথেষ্ট — আর সে তখন একই রকম, কিন্তু হুবহু নয়, এমন পরিস্থিতিতে কাজ করতে প্রস্তুত। এটা কিছুটা মনে করিয়ে দেয় যে, কীভাবে একটি শিশু প্রাপ্তবয়স্কের আচরণ অনুকরণ করে, এমনকি সে বুঝতেও পারে না যে সে শিখছে।
ভিডিও নির্দেশনা হিসেবে: রোবটরা কীভাবে "একবার দেখেই" শেখে
কোম্পানির ল্যাবরেটরি পরিদর্শনকারী লেখক একটি অস্বাভাবিক দৃশ্যের সাক্ষী হয়েছেন। ম্যানিপুলেটররা কোনো পূর্ব প্রস্তুতি ছাড়াই নির্দিষ্ট কাজের জন্য নিজেদের প্রস্তুত করছিল: তারা কাপ সামলাচ্ছিল, সেগুলো স্তূপ করছিল, এক বাটি থেকে অন্য বাটিতে ব্লক সরাচ্ছিল। যা দরকার ছিল তা হল — কাজটি প্রদর্শনকারী একটি ছোট ভিডিও ক্লিপ, তারপর রোবট তার জন্য নতুন বস্তু নিয়ে কাজ শুরু করত।
কিছু পর্ব প্রায় প্রকৌশল বিস্ময়ের ছোট অলৌকিক ঘটনার মতো দেখায়। উদাহরণস্বরূপ, রোবটের সামনে একটি বাটিতে ব্লক ঠেলে দেওয়ার কাজ রাখা হয়েছিল, তাকে সাহায্যের জন্য একটি ব্রাশ এবং ডাস্টপ্যান দেওয়া হয়েছিল। ব্রাশটি সরিয়ে নেওয়া হলে, মেশিনটি থেমে যায়নি, বরং এই উদ্দেশ্যে ডাস্টপ্যানটি মানিয়ে নিয়েছিল — সেটিকে গ্রিপারে নিয়ে ব্রাশের মতো ব্যবহার করতে শুরু করে, সফলভাবে কাজটি শেষ করে। আরেকটি ঘটনা ঘটেছিল একটি দুই-বাহু ম্যানিপুলেটরের সাথে। সে একটি ভিডিও দেখেছিল যেখানে একজন মানুষ একটি ওয়ালেট খুলে তা থেকে কাগজের নোট বের করছে। রোবটটি অন্য একটি ওয়ালেটের সাথে চমৎকারভাবে মোকাবিলা করেছিল, এবং যখন ডান হাতটি নোটটি তুলতে পারেনি, তখন সে বাম হাতে সুইচ করে, কোণ পরিবর্তন করে এবং অবশেষে টাকাটা বের করেছিল।

কেন এটি কাজ করে: "ভৌত কল্পনার" উপর বাজি
Generalist AI-এর প্রধান নির্বাহী কর্মকর্তা এবং সহ-প্রতিষ্ঠাতা পিট ফ্লোরেন্স তার রোবটের আচরণকে GPT-3-এর সাথে তুলনা করেন। একটি ভাষা মডেলের জন্য একটি নতুন কাজ সেট করলেই যথেষ্ট, সে বিশেষ প্রশিক্ষণ ছাড়াই সমাধান খুঁজে পায়। রোবটদের ক্ষেত্রেও প্রায় একই ঘটনা ঘটে, তবে বস্তুগত জগতের সাথে সামঞ্জস্য রেখে: তাদের শুধু শব্দ তৈরি করতে হয় না, বস্তুর পদার্থবিদ্যা বিবেচনা করে নড়াচড়া সমন্বয় করতে হয়। একটি ডাস্টপ্যান ব্রাশ প্রতিস্থাপন করতে পারে, একটি ওয়ালেট বিভিন্নভাবে খুলতে পারে, এবং একটি কলা ঝাড়ু দেওয়ার হাতিয়ার হয়ে উঠতে পারে।
শেষ ঘটনাটি সত্যিই ঘটেছিল: রোবটের সামনে একটি কলা রাখা হয়েছিল, এবং সে কোনো দ্বিধা ছাড়াই তা দিয়ে টেবিল থেকে যন্ত্রাংশ ঝাড়তে শুরু করেছিল। এটি মজার লাগছিল, কিন্তু এর পিছনে একটি গুরুত্বপূর্ণ ধারণা রয়েছে — সিস্টেমটি একটি নির্দিষ্ট নড়াচড়া শেখে না, বরং পদার্থবিদ্যার স্বজ্ঞাত অনুভূতি শেখে, যা মানুষের জন্মগতভাবে থাকে। প্রতিষ্ঠাতা দল এই কারণেই বাজি ধরছে: পিট ফ্লোরেন্স, অ্যান্ড্রু ব্যারি এবং অ্যান্ডি জেং আগে Google DeepMind এবং Boston Dynamics-এ কাজ করতেন, এবং এখন তারা এমন মডেল তৈরি করছেন যা স্থানের মধ্যে জিনিসের "আচরণ" বুঝতে সক্ষম।
এই বোঝাপড়ার রহস্য — ভৌত মিথস্ক্রিয়া সম্পর্কে বিপুল পরিমাণ মানসম্পন্ন ডেটা। যতটা সম্ভব দক্ষতার সাথে সংগ্রহ করতে, Generalist AI-তে রোবটের নখরের মতো বিশেষ গ্লাভস তৈরি করা হয়েছে। সেগুলিতে ক্যামেরা বসানো আছে, এবং গ্লাভসগুলো মানুষের জন্য তৈরি: সারা বিশ্বের অপারেটররা, মেক্সিকো সহ, সাধারণ গৃহস্থালি বা উৎপাদন কাজ করে, এবং সিস্টেম সেই রেকর্ডিংগুলোকে শিক্ষার উপাদানে রূপান্তরিত করে। লেখককে এমনকি একটি বাক্স দেখানো হয়েছিল যেখানে শত শত এমন গ্লাভস ছিল, ডেটা সংগ্রহকারীদের কাছে পাঠানোর জন্য প্রস্তুত। একই সাথে, কোম্পানি নিজেই নিউরাল নেটওয়ার্কগুলো স্ক্র্যাচ থেকে তৈরি করে, সচেতনভাবে রেডিমেড ওপেন-সোর্স ভাষা মডেল ব্যবহার করতে অস্বীকার করে।

নির্ভরযোগ্যতা, সংশয় এবং শিল্পের জন্য সম্ভাবনা
নির্মাতারা দুর্বল দিকগুলো লুকান না। বর্তমানে রোবটটি দেখানো কাজটি গড়ে ৫৯% ক্ষেত্রে সফলভাবে সম্পাদন করে। এটি শিল্প মান থেকে অনেক দূরে, যেখানে ৯৯% এর বেশি নির্ভরযোগ্যতা প্রয়োজন। দক্ষতা সম্পূর্ণ অপরিচিত পরিস্থিতিতে কতটা স্থানান্তরিত হবে, এবং পরিস্থিতির আকস্মিক পরিবর্তনে মডেলটি কীভাবে আচরণ করবে তা স্পষ্ট নয়। কিন্তু করা কাজটি ইতিমধ্যেই বহিরাগত বিশেষজ্ঞদের মুগ্ধ করেছে।
Georgia Tech-এর রোবোটিক্স বিশেষজ্ঞ ড্যানফেই জু বলেছেন, সার্বজনীন রোবোটিক মডেল তৈরি করা কোম্পানিগুলোর মধ্যে Generalist AI-ই বাস্তব বাণিজ্যিক প্রয়োগের সবচেয়ে কাছাকাছি। তার মতে, দলটি তাদের ধারণাকে চরমে নিয়ে গেছে এবং গুণগতভাবে তা বাস্তবায়ন করেছে, বিপুল পরিমাণ ভালো ডেটা সংগ্রহ করেছে। স্ট্যানফোর্ডের কারেন লিউ যোগ করেছেন যে, কোম্পানির পদ্ধতি আকর্ষণীয় কারণ ডেটা ব্যাপক স্কেলে সংগ্রহ করা হয় এবং কোনো একটি নির্দিষ্ট রোবটের কাঠামোর সাথে আবদ্ধ নয়। এটি শেখাকে একটি উন্মুক্ত প্ল্যাটফর্মের মতো করে তোলে, এককালীন কৌশল নয়।
উৎপাদনের জন্য সম্ভাব্য সুবিধা বিশাল। একটি কনভেয়ার বেল্ট কল্পনা করুন যাকে তাৎক্ষণিকভাবে বোতল প্যাকিং থেকে যন্ত্রাংশ একত্রিত করার কাজে সুইচ করা যায় — রোবটকে শুধু একটি ছোট ভিডিও দেখালেই যথেষ্ট। কোনো দীর্ঘ পুনঃসামঞ্জস্য নেই, কোনো ম্যানিপুলেশন প্রোগ্রামিং নেই।
সম্ভবত, সবচেয়ে অর্থবহ পর্বটি স্টার্টআপের অফিসে গভীর রাতে ধারণ করা হয়েছিল। একজন প্রকৌশলী ম্যানুয়ালি দুই-বাহু রোবটের সামনে ছোট কাপ সাজাচ্ছিলেন। হঠাৎ, ম্যানিপুলেটরটি, কোনো আদেশের অপেক্ষা না করেই, কাপগুলো ধরে মানুষের পিছনে পিছনে একটি পরিপাটি স্তূপে সাজাতে শুরু করে। এই স্বতঃস্ফূর্ত কাজটি — যদিও সহজ এবং ক্ষণস্থায়ী — ইঙ্গিত দেয় যে মেশিনটি নির্দেশের নিষ্প্রাণ নির্বাহকের সীমা ছাড়িয়ে যাচ্ছে। এবং সম্ভবত, এই ধরনের "উদ্যোগ"ই সেই যুগান্তকারী হয়ে উঠবে, যা রোবটদের কারখানা ওয়ার্কশপের খাঁচা থেকে বের করে বাস্তব জগতে নিয়ে যাবে।




