3D Humans from images and videos
ছবি এবং ভিডিওর মাধ্যমে ৩ডি মডেল তৈরি করার জন্য একটি টুল, যা একাধিক ব্যক্তির একত্রিত করাকে সমর্থন করে।.
সারসংক্ষেপ
এই টুলটি কী?
ছবি এবং ভিডিও থেকে ৩ডি মানুষ নিয়মিত ছবি এবং ভিডিও রেকর্ডিং থেকে স্বয়ংক্রিয় ভাবে মানব মডেলদের পুনর্গঠনের জন্য নির্মিত একটি নিউরাল নেটওয়ার্ক। টুল-টিপের প্রধান কাজ বহুমুখী ডিজিটাল মডেলে দুটি ভিন্ন ভিন্ন চিত্রকে রূপান্তরিত করার জন্য এটি ব্যবহার করা যেতে পারে। কম্পিউটারের দৃষ্টি এবং মেশিন শেখার অ্যালগরিদমের উপর ভিত্তি করে এই প্রযুক্তি ব্যবহার করা হয় যা একজন ব্যক্তির আকৃতি, গঠন আর ভাবধারার বিশ্লেষণ করে।
প্রযুক্তি কীভাবে কাজ করে
নিউরাল নেটওয়ার্ক এর অপারেটিং নীতি হচ্ছে দৃশ্যমান তথ্য বিশ্লেষণের জন্য. মূল অঙ্গগুলো উৎসের ছবি বা ভিডিও থেকে নেওয়া হয়েছে, সেই ব্যক্তির অবস্থান নির্ধারণ করা হয়েছে, এবং তাদের শরীরের পরামিতি হিসাব করা হয়েছে। এই তথ্য উপর ভিত্তি করে, নিউরাল নেটওয়ার্ক একটি তিন-ডিমেনাল মেশ তৈরী করে যেটা শরীরের সীমানার পরে। বর্তমানে অনেক লোক যে - দৃশ্যগুলো দেখে থাকে — সিস্টেম প্রত্যেক আলাদা আলাদা আলাদাভাবে আলাদা আলাদাভাবে শনাক্ত করে এবং তাদের জন্য একটা স্বাধীন ত্রিমাত্রিক মডেল গঠন করে । এটি প্রয়োগ করে কোন বস্তুর উপর শুধুমাত্র একটি বস্তুর সঙ্গে একটি বস্তুর ওপর কাজ করা হয় ।
চিত্র এবং ভিডিওর মাধ্যমে ত্রিমাত্রিক মানুষ
| অক্ষর | মান |
|---|---|
| উদ্দেশ্য | দ্বিমাত্রিক বিষয়বস্তু থেকে ত্রিমাত্রিক মানব মডেলের পুনর্গঠন |
| ইনপুটের ধরন | ছবি, ভিডিও রেকর্ডিং |
| ফ্রেমে প্রদর্শিত মানুষের সংখ্যা | একাধিক, একসাথে |
| ডিস্ট্রিবিউশন মডেল | অজানা |
| অ্যাপ্লিকেশন | ডিজাইন, অ্যানিমেশন, গেম শিল্প, ত্রিমাত্রিক মডেল |
| আউটপুট বিন্যাস | ভলিউমের মডেল (৩ডি) |
ছবি ও ভিডিওর জন্য ৩ডি মানুষ কে?
নকশাকারী এবং ত্রিমাত্রিক শিল্পী
ডিজিটাল দৃশ্য তৈরি করতে এবং দ্রুত মানব মডেল অর্জন করতে হবে এমন পেশাজীবীদের জন্য এই টুল কার্যকর হবে। এর পরিবর্তে একজন ডিজাইনার নিউরাল নেটওয়ার্ক ব্যবহার করতে পারেন নতুন করে তৈরী করার জন্য। এটা বিশেষ করে ধারণার জন্য প্রাসঙ্গিক। - পরিবেশ সৃষ্টি, এবং প্রাথমিক স্কেচ।
অ্যানিমেশন বিশেষজ্ঞ এবং খেলা ডেভেলপারবৃন্দ
একটি ভিত্তি মডেল পাওয়া খুব দ্রুতই জরুরি। তারপর দড়ি এবং অ্যানিমেশন সেট করা। গেইম ইন্ডাস্ট্রিতে, এনপিসি (এনপিসি)-এর চরিত্র তৈরি করার সুযোগ করে দিয়েছে। উপাত্ত উৎস রূপে ফোকাস না করা হলে, অ্যানিমেশন অনুক্রমের জন্য অ্যানিমেশন নির্মাণের সম্ভাবনা বৃদ্ধি পাবে।
চিত্র এবং ভিডিও থেকে ৩ডি মানুষ কিভাবে ব্যবহার করতে হয়?
সাধারণ কর্মফ্লো
একটি নির্দিষ্ট ধাপবিশিষ্ট পাথের মধ্যে সুনির্দিষ্ট পাথ উপস্থিত নেই, যেহেতু টুলের বিতরণ মডেল সুনির্দিষ্ট নয়। কিন্তু, একই ধরনের সেবা করার সাধারণ যুক্তিকে সাধারণত এই প্রক্রিয়াগুলোতে অন্তর্ভুক্ত করা হয় । ব্যবহারকারী একটি ছবি অথবা ভিডিও ফাইল আপলোড করতে চান। পদ্ধতি স্বয়ংক্রিয়ভাবে সিস্টেমের পদ্ধতি এবং তিনটি ভিন্ন ভিন্ন মডেলগুলির মধ্যে এক্সপোর্ট করা যাবে। আরো সম্পাদনার জন্য তৃতীয় পর্যায়ের সফটওয়্যার এক্সপোর্ট করা হবে।
ইনপুট তথ্য পরামর্শসমূহ
সঠিক ফলাফল পেতে হলে, সেই ব্যক্তির ভালো আলো এবং পরিষ্কার ইমেজ ব্যবহার করা গুরুত্বপূর্ণ। তার চেয়ে ভালো চেহারা আর শরীর দেখা যায়, নিউরাল নেটওয়ার্ক মডেলের আকৃতি নির্ধারণ করতে পারে। ভিডিওর সাথে কাজ করার সময়, এটা সুপারিশ করা হয় যে বেশিরভাগ সময় ধরে যে অক্ষরগুলো থাকে এবং ক্যামেরার কোণ স্থিরভাবে পরিবর্তিত হয়।
চিত্র এবং ভিডিও থেকে ত্রিমাত্রিক মানুষটির কি বৈশিষ্ট্য
ফটো থেকে প্রতিক্রিয়া
নিউরাল নেটওয়ার্ক একক ছবি থেকে একটি ত্রিমাত্রিক মডেল তৈরি করতে পারে। এই অ্যালগরিদমটি ছবির আর্কাইভ অথবা ভিডিও রেকর্ডের মাধ্যমে কাজ করার সময় সুবিধাজনক।
ভিডিও থেকে প্রতিক্রিয়া
ভিডিও প্রসেস সমাপ্ত করা হচ্ছে অথবা ট্র্যাকের তথ্য ব্যবহার করে ভিডিও প্রসেস করা হচ্ছে। নিউরাল নেটওয়ার্ক একজন ব্যক্তির ভাব এবং আন্দোলনকে পরিবর্তন করে, যা আরো সঠিক এবং ৩ডি মডেলকে অনুমোদন করে। কোনো পরিবর্তন করা হলে ভিডিও বিন্যাস কার্যকর করা আবশ্যক।
একাধিক লোকের একতা
একটা গুরুত্বপূর্ণ বৈশিষ্ট্য হল, একক ছবিতে বা ভিডিওতে যে সংখ্যক অক্ষর ব্যবহার করা যায়, তার একটি নির্দিষ্ট সংখ্যা থাকতে পারে । নিউরাল নেটওয়ার্ক প্রতিটি আলাদা আলাদাভাবে সনাক্ত করে এবং প্রতিটি আলাদা আলাদা মডেলের জন্য একটি আলাদা মডেল তৈরি করে। যখন গ্রুপ তৈরি হচ্ছে তখন সময় বাঁচায়.
চিত্র এবং ভিডিও থেকে ৩ডি মানুষের সৌজন্যে
ফলাফলের গতি
প্রচলিত পদ্ধতি ব্যবহার করে ত্রিমাত্রিক মডেল তৈরি করা হচ্ছে, এমনকি বিশেষ করে ম্যানুয়াল কাজের দিন। একটি নিউরাল নেটওয়ার্ক ব্যবহার করে এই প্রক্রিয়া স্বয়ংক্রিয় প্রক্রিয়াকে হ্রাস করে, যা উল্লেখযোগ্যভাবে দ্রুত চলবে। এটা স্টুডিওতে দ্রুত উৎপাদন লাইনগুলোকে কাজ করতে সাহায্য করে ।
একদল লোকের সাথে কাজ করে
গ্রুপিং খুবই প্রতিযোগিতামূলক সুযোগ। ব্যবহারকারীকে ছবিগুলোকে বিভিন্ন অংশে কাটাতে হয় না এবং প্রতিটি ব্যক্তি একে অপরের সাথে প্রক্রিয়া করতে হয়- এই সিস্টেম একটি মাত্র মেয়াদেই সবকিছু করে। দলের দৃশ্য, দলগত ছবি, চলচ্চিত্র বা খেলার দৃশ্যের জন্য এটি সুবিধাজনক।
ইনপুট সংক্রান্ত তথ্যের বহুতত্ব
এই টুল ছবি এবং ভিডিও উপাদানের মাধ্যমে কাজ করে। এই বিষয়টি পেশাজীবি: তারা এখনো বিদ্যমান ভিডিও আর্কাইভ থেকে ফ্রেম ব্যবহার করতে পারে, অথবা বিশেষ করে যে সমস্ত লেখা তারা পছন্দ করে তা পাওয়ার জন্য।
৩ডি মানুষের প্রতি হতাশা
সীমা সংক্রান্ত তথ্য
বিতরণ মডেলটি যেহেতু "অজানা" হিসেবে চিহ্নিত হয়েছে, সিস্টেমের চাহিদা, সোর্স রেজল্যুশন সীমা অথবা মডেল সম্পর্কে কোন সুনির্দিষ্ট তথ্য নেই। আগে থেকে ব্যবহারকারীদের মূল্যায়ন করা কঠিন যে এই যন্ত্র তাদের কারিগরি স্ট্যাক ব্যবহার করবে কিনা।
অজানা নীতি
কোন API ইন্টারফেস, স্থানীয়ভাবে ইনস্টল সফটওয়্যার অথবা মেঘ ওয়েব সার্ভিসের মাধ্যমে নিউরাল নেটওয়ার্ক কাজ করে কিনা তা এখনো অস্পষ্ট। এই জটিল কাজ শুরু হবে. আউটপুট মডেল ফরম্যাটে (ওবিজে, ফেডম, জিএলএফ) কোন তথ্য নেই, যা অন্যান্য সফটওয়্যারের সঙ্গে একটি পাইপলাইন সংযুক্ত করার পরিকল্পনা করা কঠিন করে তোলে।
চিত্র এবং ভিডিও থেকে ৩ডি মানুষ কোন সমস্যার সমাধান করতে পারে?
টুলের প্রধান উদ্দেশ্য মানুষকে আক্রান্ত করার প্রক্রিয়াটা চালু করা। ৩ডি স্ক্যানার ব্যবহার না করে খন্ডনকার মডেল তৈরি করার প্রয়োজন এটি। বিশেষ যন্ত্রপাতি দিয়ে গুলি করার পরিবর্তে নিয়মিত ক্যামেরা যথেষ্ট।
একটা নকশায়, পোশাক - আশাক, আলো বা দৃশ্য সাজানোর চেষ্টা করার জন্য একজন মানব মডেলকে একজন মানুষ হিসেবে ব্যবহার করা হয় । অ্যানিমেশনের মধ্যে, ত্রিমাত্রিক মডেল কাঠামোর জন্য ভিত্তিে পরিণত হয় এবং আরও চরিত্র অ্যানিমেশনের জন্য। গেইম শিল্পের ক্ষেত্রে নির্মাতারা দ্রুত দ্বিতীয় চরিত্রের মাত্রা পরিমাপ করতে পারেন। এই হাতিয়ারটি শিক্ষা উদ্দেশ্যে ব্যবহার করা যেতে পারে, যেখানে দেহ গঠন করা প্রয়োজন, অথবা উপযুক্ত পরিবেশের জন্য উপযুক্ত পরিবেশ তৈরি করা প্রয়োজন ।
ত্রিমাত্রিক মানুষ এর জন্য কৃতজ্ঞতা ছবি এবং ভিডিও
নিউরাল নেটওয়ার্ক ব্যবহার করার সঠিক মূল্য অজানা। উন্মুক্ত ডাটার তথ্য নেই ব্যক্তিগত পরিকল্পনা, মুক্ত বিচারের সময় বা পেমেন্ট মডেলের কাছে কোন তথ্য নেই - সাবস্ক্রিপশন ভিত্তিক অথবা একটি সময়ের ঋণ। সম্ভাব্য সকল ব্যবহারকারীকে সরকারি তাজা সংবাদ অনুসরণ করার পরামর্শ প্রদান করা হয়েছে এবং নির্মাতার গোপনীয় নীতির মুক্তি প্রদান করা হবে। যতক্ষণ না এই তথ্য পাওয়া যায়, ততক্ষণ পর্যন্ত এই যন্ত্র উৎপাদন প্রক্রিয়ার জন্য অর্থনৈতিক দক্ষতা নির্ধারণ করা অসম্ভব।
৩-ডি মানুষের ছবি এবং ভিডিওর জন্য ব্যবহার করা
বর্তমানে লাইসেন্সের নিয়ম ও ব্যবহারের নিয়ম প্রকাশ করা হয়নি । অজানা বন্টন মডেলটির কারণে, মডেলটির বাণিজ্যিক ব্যবহার নিষিদ্ধ কিনা সে বিষয়ে কোন স্পষ্ট তথ্য নেই। প্রতি মিনিটে কাজের সংখ্যা। এটি অজানা যে কোথায় ব্যবহারকারীর তোলা ছবি এবং ভিডিও সংরক্ষণ করা হয় এবং বিষয়বস্তু আপলোড করার ক্ষেত্রে গোপনীয়তা নীতি প্রয়োগ করা হয় কিনা। টুল নিয়ে কাজ করার আগে, এটা অফিসিয়াল কাগজপত্রের জন্য অপেক্ষা করছে।
চিত্র এবং ভিডিও থেকে ত্রিমাত্রিক মানুষটির আভার
যেহেতু উৎস সাইটের বিতরণ মডেলকে “অজানা” হিসেবে চিহ্নিত করা হয়েছে, তাই এই টুলটি ব্যাপক শ্রোতাদের কাছে অনুপস্থিত কি না তা নিয়ে তথ্য রয়েছে। এটি ডাউনলোড করা যাবে কিনা তা জানা নেই, সাবস্ক্রাইব করা অথবা অনলাইনে। এছাড়াও এটা পরিষ্কার নয় যে নিউরাল নেটওয়ার্ক কোন ব্রাউজারে কাজ করে কিনা - তার জন্য ক্লায়েন্ট সফটওয়্যার ইন্সটল করতে হবে, বা শুধুমাত্র মেঘের API দ্বারা পরিচালিত হবে। আঞ্চলিক নিষেধাজ্ঞা বা নিবন্ধন চাহিদা নিয়ে প্রশ্ন করার উত্তরগুলোও অনুপস্থিত। এই প্রকল্প হয়ত গবেষণাগারে সীমিত প্রবেশের মাধ্যমে তৈরি হতে পারে।
কিভাবে ৩ডি মানুষ ছবি আর ভিডিও বিকল্প থেকে আলাদা
এই টুলের মূল পার্থক্য হলো ফ্রেমের মধ্যে একাধিক মানুষের পুন:নির্মাণ। অনেক সমাধানকে একটি নির্দিষ্ট অবজেক্টের প্রক্রিয়া হিসেবে প্রতিদ্বন্দ্বিতা করার জন্য কনফিগার করা হয়: তারা সঠিকভাবে কাজ করে যখন কোন ব্যক্তি ফ্রেমের মধ্যে থাকে কিন্তু তারা ব্যর্থ হয় কোন দলের দৃশ্যের ক্ষেত্রে অথবা কোন বিশেষ ধরনের লোকদের অপসারণের প্রয়োজন হয়। এই যন্ত্রটি সাথে সাথেই জানা যাবে বর্তমান এবং আউটপুট তৈরি করা মডেলগুলো।
ডাটা ফরম্যাটের জন্য অতিরিক্ত পার্থক্য দেয়া হয় — স্থায়ী ছবি এবং ভিডিও স্ট্রিম। ইনপুট তথ্য প্রবাহের ক্ষেত্রে সীমিততা বিভিন্ন দৃশ্যকে বিস্তৃত করে এবং এর নিউরাল নেটওয়ার্ককে আরো নমনীয় করে তোলে। সাধারণত, এই ধরনের হাতিয়ারগুলো ছবি বা ভিডিওর উপর মনোযোগ কেন্দ্রীভূত করে; একটি সম্মিলিত পদ্ধতি কম।
অন্তর্ভুক্ত
৩ডি মানুষ ছবি এবং ভিডিও থেকে নেওয়া মানুষ নিয়মিত ছবি ও ভিডিও থেকে শুরু করে ৩ জন মানুষের আদর্শ পুন:নির্মাণের একটি প্রতিশ্রুতিশীল টুল। এর মূল শক্তি হচ্ছে একই সময়ে একাধিক লোককে প্রভাবিত করার ক্ষমতা, যা দলের বিভিন্ন দৃশ্যের জন্য সুবিধাজনক। মূল অ্যাপ্লিকেশন সমূহ হচ্ছে ডিজাইন, অ্যানিমেশন এবং গেইম শিল্প। একইভাবে, এই পণ্যের চারিদিকে উল্লেখযোগ্য অনিশ্চয়তা — অজানা বিতরণ মডেল, ব্যক্তিগত এবং সীমিত তথ্যর অভাব — কাজের ফলে ব্যবহারিকভাবে ব্যবহার করার ক্ষেত্রে সীমা আরোপ করে । এই টুলকে ৩ডি বিশেষজ্ঞের কাছে সম্ভাব্য হিসাবে বিবেচনা করা উচিত, কিন্তু এই ক্ষেত্রে দত্তক নেবার চূড়ান্ত সিদ্ধান্ত নেওয়া উচিত।
সাধারণ প্রশ্নোত্তর
অতিরিক্ত দেখুন
ক্রোম এক্সটেনশন যা আপনাকে শিক্ষা খেলায় জয়ী হতে সাহায্য করবে, তা উত্তর এবং উদ্ভাবনের পরামর্শ দিয়ে।.

একটি ত্রিমাত্রিক মডেলের সাথে দ্রুত একটি ছবি রূপান্তর করার জন্য ওপেন সোর্স টুল।.

এমিন আর্ট, কমিকস, এবং ভিডিওর জন্য প্লাটফর্ম।.

AI চরিত্রগুলির সাথে কথোপকথনের জন্য একটি প্ল্যাটফর্ম, যার মধ্যে পূর্বনির্ধারিত তৈরি এবং ব্যবহারকারী তৈরি করা হয়েছে।.

টেক্সট বর্ণনা অথবা ছবি থেকে সংক্ষিপ্ত ভিডিও তৈরি করার জন্য একটি নিউরাল নেটওয়ার্ক।.

খেলাধুলা এবং ক্যাসিনোর জন্য AI সহকারী, ব্যবহারকারীর অতীত কাজ বিশ্লেষণ করে ব্যক্তিগত উপদেশ দেয়ার জন্য।.

টেক্সট বর্ণনা, ছবি অথবা স্কেচের উপর ভিত্তি করে ত্রিমাত্রিক মডেল তৈরি করার জন্য একটি টুল।.

একটি নিউরাল নেটওয়ার্ক লোড করার জন্য ত্রিমাত্রিক মডেল, টেক্সচার, এবং টেক্সট বর্ণনা অথবা ছবি তৈরী করার জন্য অ্যানিমেশনের একটি নিউরাল মেঘ সার্ভিস।.