ورقة علمية أحدثت لغطاً في الميادين العلمية والبحثية من خلال طرحها تساؤلاً حول احتمالية انهيار النماذج التوليدية للذكاء الاصطناعي؛ بسبب الذكاء الاصطناعي ذاته، حيث جاء ذلك في ورقة علمية بعنوان The Curse of Recursion: Training on Generated Data Makes Models Forget.
رابط الورقة العلمية https://lnkd.in/dT4AKHNk وقد شارك في إعداد هذه الورقة باحثون من جامعات كامبريدج وأكسفورد وإمبريال كوليدج لندن، حيث أبرزت الورقة مفهوماً أطلق عليه ظاهرة «انهيار النماذج» (Model Collapse).
وقد بيّنت الورقة أن ظاهرة انهيار النماذج يحدث عند تدريب أجيال متعاقبة من نماذج الذكاء الاصطناعي على بيانات مولدة أصلاً بواسطة نماذج ذكاء اصطناعي أخرى عوضاً عن البيانات البشرية الأصليّة. حيث تبدأ بعض المعلومات والأنماط النادرة بالتلاشي تدريجياً مع كل جيل جديد، كما يُصبح النموذج أكثر اعتماداً على الأنماط الشائعة والمتكررة، فضلاً عن انخفاض قدرة النموذج على تمثيل التنوع الحقيقي الموجود في العالم.
كما أثبتت الورقة أن تكرار عملية تدريب النماذج على بيانات مولّدة اصطناعياً تتسبب في إخفاء الحالات النادرة والاستثنائية بشكل تدريجي، كما تتسبب في تشابه المخرجات بشكل أكبر مع مرور الوقت وتكرار الاستخدام، وتتراجع جودة المعرفة التي يتعلمها النموذج، بل يُصبح تمثيل الواقع أقل دقة وأقل تنوعاً. لذا، أطلق الباحثون على هذه الظاهرة اسم «لعنة التكرار. “(Curse of Recursion).
ولاشك بأن هذه الظاهرة محل البحث تترك آثاراً سلبية، خاصة وأن فضاء الإنترنت يشهد نمواً كبيراً في المحتوى المُولّد بواسطة الذكاء الاصطناعي مثل المقالات والبيانات والسرديات والصور والفيديوهات والأكواد البرمجية. ومع توسُّع هذا المحتوى، قد تواجه النماذج المستقبلية صعوبة أكبر في الوصول إلى بيانات بشرية أصلية ذات جودة عالية.
وقد استنتجت الورقة أن البيانات تعتبر أصلاً استراتيجياً لا يقل أهمية عن النماذج ذاتها، فجودة البيانات وتنوعها يُعد العنصر الأكثر تأثيراً في المنافسة بين منتجي نماذج الذكاء الاصطناعي، وقد تكون العامل المرجّح لكفة منافس على آخر خلال السنوات القادمة.
وبناء عليه، اقترحت الورقة حلولاً جذرية من أجل الحفاظ على جودة النماذج مستقبلاً، منها وجوب التركيز على جمع بيانات بشرية أصلية ومتنوعة، التحقق من مصادر البيانات المستخدمة في التدريب، تمييز المحتوى البشري عن المحتوى المولد آلياً، وضرورة الاستثمار في قواعد بيانات موثوقة وعالية الجودة.