
এটি মূল ইংরেজি নথির একটি মেশিন অনুবাদ। এই অনুবাদ এবং মূল ইংরেজি সংস্করণের মধ্যে কোনো বিরোধ দেখা দিলে, ইংরেজি সংস্করণটিই প্রাধান্য পাবে। মূল ইংরেজি সংস্করণটি পড়ুন
ব্যক্তিগত ডেটা প্রশিক্ষণের বিশাল পাইপলাইন
2026-09-24 · Alex Wall, AIGP, CIPM, CIPP/US, CIPP/E, FIP, PLS, CISSP
বৃহস্পতিবার বিকেল ৪:৪০। অনুমোদিত সহকারীটির লিমিট শেষ হয়ে গেছে, চুক্তির পর্যালোচনার ক্ষেত্রে এটি এমন কোনো মডেল নয় যাকে সে ভরসা করে, অথবা চুক্তিটি যে ড্রাইভে রয়েছে সেখানে পৌঁছাতে পারছে না। ডেডলাইন তো পেছায়নি, এবং তার কাছ থেকে প্রত্যাশা সে "AI Native" হবে। তাই সে চুক্তিটি তার ব্যক্তিগত ChatGPT-তে পেস্ট করে এবং ত্রিশ সেকেন্ডের মধ্যে সহজবোধ্য ব্যাখ্যা ও সিদ্ধান্ত পেয়ে যায়।
এই গল্পের কেউই মনে করে না যে কোনো কিছু ফাঁস হয়েছে, এবং এটি AI-এর সম্পূর্ণ যুক্তিসঙ্গত একটি ব্যবহার। আমার মতে এটি এই শিল্পের সবচেয়ে বড় ডেটা পাইপলাইন, এবং এটি সেবার শর্তাবলীর কয়েকটি ছোট শব্দের মধ্য দিয়ে চলে।
দুটি নিয়মপুস্তক
ডিফল্টভাবে OpenAI ব্যবসায়িক গ্রাহকদের ডেটা দিয়ে মডেল প্রশিক্ষণ দেয় না, তবে ব্যক্তিগতভাবে ChatGPT ব্যবহারকারীদের ক্ষেত্রে এটি "আমাদের মডেল প্রশিক্ষিত করতে আপনার বিষয়বস্তু ব্যবহার করতে পারে।" Anthropic "যখন এই সেটিংটি চালু থাকে" তখন ভোক্তাদের চ্যাট দিয়ে প্রশিক্ষণ দেয়; তবে ব্যবসায়িক ও API ব্যবহার এর আওতামুক্ত। ইউরোপের বাইরে, Google-এর বিনামূল্যের ডেভেলপার API যা পায় তা দিয়ে প্রশিক্ষণ দেয়; পেইড সংস্করণে তা করে না। xAI আরও এক ধাপ এগিয়ে: EU এবং UK-এর বাইরের কিছু অঞ্চলে আপনি যদি লগ ইন না করে Grok ব্যবহার করেন, তবে আপনি কোনোভাবেই প্রশিক্ষণ থেকে অপ্ট আউট করতে পারবেন না।
ভোক্তা পর্যায়ের বিষয়টি একটি সহজ অনুমানের ওপর দাঁড়িয়ে আছে: যিনি টাইপ করছেন, যা লিখেছেন তার মালিক তিনিই এবং তিনি তা শেয়ার করতে সম্মত হয়েছেন। OpenAI-এর শর্তাবলীতে ব্যবহারকারীদের "ঘোষণা ও নিশ্চয়তা দিতে হয়" যে এটি সরবরাহ করার পূর্ণ অধিকার তাদের রয়েছে।
সমস্যা হলো, এই চুক্তিটি তার নিয়োগকর্তার গোপনীয় তথ্য এবং এতে থাকা নামগুলো গ্রাহকের ব্যক্তিগত ডেটা। কেউই কোনো কিছুর অনুমোদন দেয়নি, আর এখন এটি ক্লাউডের ডেটা সংরক্ষণের বিশাল আঠালো ফাঁদে আটকে গেছে। চাকরি হারানোর ভয়, দ্রুত কাজ শেষ করার প্রত্যাশা এবং "AI Native" সাজার চাপ এক পদ্ধতিগত ও অবিরাম প্রযুক্তিগত ডেটা লঙ্ঘনের জন্ম দিয়েছে: যা গ্রাহকের আস্থা এবং কোম্পানির লিখিত নীতিমালার সুস্পষ্ট লঙ্ঘন।
লন্ড্রি লুপ
ভোক্তা শর্তাবলীর অধীনে, সে যা পেস্ট করেছে, যেভাবে কাজটি করেছে এবং যে সিদ্ধান্তে পৌঁছেছে—সবকিছুই প্রশিক্ষণের ডেটা হয়ে উঠতে পারে। পরবর্তীতে যখন তার প্রতিষ্ঠান এন্টারপ্রাইজ সংস্করণ কেনে, তখন এটি সেই শেখা তথ্যগুলোই উৎস মুছে ফেলে ফিরে পায়, যা ধারণার পার্টিকাল বোর্ড হিসেবে পুনরায় ব্যবহৃত হয় এবং পার-সিট হিসেবে বিক্রি হয়। ব্যক্তিগত এবং বাণিজ্যিক শর্তাবলীর মধ্যকার এই বিভাজন গোপনীয় ও ব্যক্তিগত ডেটার জন্য একটি লন্ড্রি লুপ, এবং এমন একটি ব্যবসায়িক গোপনীয়তার ঝুঁকি যার দিকে কেউ নজর দিচ্ছে না। এর আর্থিক ক্ষতিও রয়েছে: IBM দেখেছে যে প্রতি পাঁচটি প্রতিষ্ঠানের মধ্যে একটি শ্যাডো AI-এর কারণে ডেটা লঙ্ঘনের শিকার হয়েছে, এবং অতিরিক্ত শ্যাডো AI বিলের সাথে আরও $670,000 যোগ করেছে।
কোনো নীতি কেন এই তথ্য ফাঁস আটকাতে পারবে না
Netskope-এর তথ্যানুযায়ী কর্মক্ষেত্রে জেনারেটিভ AI ব্যবহারকারীদের ৪৭% ব্যক্তিগত AI অ্যাপ ব্যবহার করেন, অথচ প্রতি দশটি প্রতিষ্ঠানের মধ্যে নয়টি ইতিমধ্যেই অন্তত একটি AI অ্যাপ ব্লক করেছে। এটি তবুও ঘটে, কারণ অনুমোদিত টুলে কোনো একটি জিনিসের অভাব থাকে: ব্যবহারকারীর পছন্দের মডেল, অথবা যে ফাইল, রিপোজিটরি বা সিস্টেমের ওপর কাজটি নির্ভর করে তাতে প্রবেশের সুবিধা। AI-এর জন্য অর্থ প্রদান করে এমন সংস্থাগুলির ওপর Zapier-এর জরিপে দেখা গেছে, ব্যক্তিগত-অ্যাকাউন্ট ব্যবহারকারীদের ৫৩% তাদের নিজস্ব টুল পছন্দ করেছেন এবং ৩৩% বলেছেন প্রতিষ্ঠানের টুল তাদের চাহিদা মেটাতে পারেনি। ব্লক করলে পেস্ট করার কাজটি কেবল ফোনে স্থানান্তরিত হয়।
যা এই লন্ড্রি লুপ বন্ধ করে
আমি মনে করি না যে ল্যাবগুলো খলনায়ক। এই অস্পষ্ট ক্ষেত্রটি প্রায় সবারই সুবিধাজনক মনে হয়: কর্মীরা কাজ শেষ করতে পারেন, নিয়োগকর্তারা আউটপুট পান, আর ল্যাবগুলো ডেটা পায়। এই চুক্তিতে বাদ পড়েছে কেবল সেই পক্ষ, যার মালিকানাধীন এই ডেটা।
যা এটি বন্ধ করতে পারে তা হলো এমন একটি অনুমোদিত টুল যা মানুষ এমনিতেই বেছে নেবে। আর সেজন্যই আমি Caiioo তৈরি করেছি।
এটি প্রতিটি শীর্ষস্থানীয় মডেল এবং আপনার নিজস্ব হার্ডওয়্যারে ওপেন মডেল পরিচালনা করে। মডেল পরিবর্তন করা যেন গাড়ির ইঞ্জিন অদলবদল করার মতো: আপনার কথোপকথন, ফাইল এবং সেটিংস আগের মতোই থাকে।
এটি AI-কে আপনার কাজের কাছে নিয়ে আসে। ফাইল, মেল এবং ক্যালেন্ডার অন্য কোনো ক্লাউডে আপলোড না করেই আপনার নিজস্ব ডিভাইস থেকে ব্যবহার করা যায়, এবং কথোপকথনগুলো এন্ড-টু-এন্ড এনক্রিপ্টেড অবস্থায় সিঙ্ক হয়, যাতে শুধুমাত্র আপনার ডিভাইসগুলোই তা পড়তে পারে।
এবং প্রতিটি অনুরোধ কোথায় যাচ্ছে তা এটি দেখায়। Trust Boundary তালিকাভুক্ত করে কোন AI কোম্পানিগুলো আপনার ডেটা গ্রহণ করছে এবং তাদের শর্তাবলী কী অনুমোদন করে, এবং একটিমাত্র সুইচের মাধ্যমে এমন যেকোনো প্রদানকারীকে প্রত্যাখ্যান করা যায় যা ডেটা প্রশিক্ষণে ব্যবহার করতে পারে। আমরা একই ধরনের নিয়ন্ত্রণ তৈরি করছি যাতে একটি কোম্পানি তার কাগজের নীতিকে এমন নিয়মে রূপান্তর করতে পারে যা সবার জন্য কার্যকর হয়।
আমি Caiioo শুরু করেছি কারণ আমি সক্ষমতা, স্বায়ত্তশাসন এবং নিরাপত্তাকে গুরুত্ব দিই। আমি কাউকে একক বিজয়ী হিসেবে বেছে নিতে বা একটি AI কোম্পানির ওপর নির্ভরশীল হতে চাই না; ইতিমধ্যেই ক্ষমতার অতিরিক্ত কেন্দ্রীকরণ ঘটেছে। কোম্পানিগুলোর এই টুলগুলো ব্যবহার করা, তাদের ডেটা সুরক্ষিত রাখা এবং স্বাধীন থাকা প্রয়োজন।