قدّمت شركة Anthropic مجموعة بيانات تضم 1440 بروتينًا صغيرًا مصممًا بالذكاء الاصطناعي واختُبرت مقابل 16 هدفًا مختلفًا. تتميز المجموعة بأنها تشمل التنبؤات الحسابية والنتائج الفعلية من تجارب معملية أجرتها مختبرات مستقلة، مما يتيح تقييمًا دقيقًا لقدرة هذه النماذج على التنبؤ بالنجاح العملي.

كشفت التحليلات أن عوامل عديدة تؤثر على فعالية التصميم، لكن اختيار المستضد المستهدف برز كأقوى محدّد للنتائج. عند الدمج بين عدة نماذج تنبؤية مختلفة، حققت الفرق تحسينًا متواضعًا في الأداء، لكن الاعتماد على أي نموذج منفرد ظل غير كافٍ لضمان النجاح في المختبر.

اختبرت الدراسة عشرة نماذج تنبؤية مختلفة باستخدام مقاييس متعددة ومجالات ثقة محسوبة إحصائيًا. أظهرت النتائج اختلافات حقيقية بين النماذج، وأوضحت أن الجمع بينها يستفيد من عدم اتفاقها التام. عند تحويل الترتيبات إلى دقة نسبية، تبيّن أن الميزانيات العملية تفرض قيودًا حقيقية على عدد التصاميم التي يمكن اختبارها.

واجهت الدراسة تحديًا آخر يتعلق بمستويات التعبير البروتيني وجودة الأداء المعملية. اتضح أن بعض الفشل المسجّل للبروتينات قد لا يعكس فشلًا حقيقيًا في الارتباط، بل قصورًا في التعبير عنها داخل الخلايا المضيفة. بفصل تأثير الذوبانية عن جودة الواجهة، أمكن الحصول على صورة أوضح عن قدرات التصميم الفعلية.

خلصت الدراسة إلى أن التقييم الحذر أهم من السعي وراء مؤشرات منفردة مثيرة للإعجاب. التنبؤات الحسابية وفّرت إشارات مفيدة، لكنها لم تحكِ القصة كاملة. اعتبار تأثير المستضد عند مقارنة النماذج يوفر صورة أكثر واقعية لقدرتها على التعميم على أهداف جديدة لم تُختبر من قبل.