اشتراک
مدل‌های مبتنی بر هوش مصنوعی ساختار پروتئین می‌توانند با ادغام داده‌های شرکت‌های داروسازی بهبود یابند.
مدل‌های مبتنی بر هوش مصنوعی ساختار پروتئین می‌توانند با ادغام داده‌های شرکت‌های داروسازی بهبود یابند.
فناوری علوم

داده‌های محرمانه شرکت‌های دارویی، مدل‌های هوش مصنوعی پروتئین را متحول می‌کند

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

مدل‌های هوش مصنوعی پیشرفته برای پیش‌بینی ساختار پروتئین مانند آلفافولد، با چالش کمبود داده‌های عمومی در مورد تعامل پروتئین‌ها با مولکول‌های دارویی مواجه هستند. این کمبود داده، دقت مدل‌ها را در فرآیند کشف دارو کاهش می‌دهد؛ چرا که منابع عمومی فعلی مانند «بانک داده پروتئین» (PDB) تنوع کافی از تعاملات پروتئین-لیگاند را ارائه نمی‌دهند. در همین راستا، کنسرسیومی از شرکت‌های داروسازی تحت عنوان «شبکه زیست‌شناسی ساختاری هوش مصنوعی» (AISB) با تجمیع داده‌های محرمانه و اختصاصی خود، گام مهمی در جهت بهبود این ابزارها برداشته‌اند. این محققان با استفاده از مدل متن‌باز OpenFold3 و «تنظیم دقیق» آن بر روی بیش از ۲۰ هزار ساختار پروتئینی اختصاصی که تاکنون منتشر نشده بودند، موفق شدند عملکرد مدل را به شکل چشمگیری افزایش دهند. نتایج نشان می‌دهد که مدل آموزشی AISB در پیش‌بینی تعاملات پروتئین-لیگاند، نسبت به نسخه‌های عمومی و سایر مدل‌های رقیب، دقت بسیار بالاتری دارد. این دستاورد نه تنها بر اهمیت حیاتی داده‌های نهفته در خزانه‌های شرکت‌های دارویی تأکید می‌کند، بلکه نشان می‌دهد که تجمیع این اطلاعات، بدون افشای اسرار تجاری شرکت‌ها، می‌تواند تحولی در طراحی داروهای جدید ایجاد کند. اکنون کارشناسان بر ضرورت ایجاد پروژه‌های عمومی مشابه، مانند طرح OpenBind، برای تقویت زیرساخت‌های داده‌ای هوش مصنوعی در حوزه زیست‌شناسی تأکید دارند تا دقت پیش‌بینی‌ها برای نیازهای درمانی افزایش یابد.

نمای نزدیک از ساختار روبان پروتئین، رندر دیجیتال سیم‌بندی شده با مارپیچ‌های صورتی و آبی روی پس‌زمینه سیاه.

مدل‌های مبتنی بر هوش مصنوعی ساختار پروتئین می‌توانند با ادغام داده‌های شرکت‌های داروسازی بهبود یابند.

برای کشف دارو، مدل‌های تاخوردگی پروتئین مانند آلفافولد (AlphaFold) با مشکل داده مواجه هستند: مقدار کافی از آن در پایگاه‌های داده عمومی وجود ندارد. برخی دانشمندان استدلال می‌کنند که بهبود عملکرد این ابزارهای مبتنی بر هوش مصنوعی نیازمند داده‌های اضافی است که نمونه‌هایی از نحوه تعامل پروتئین‌ها و داروها را ارائه دهند.

ساختارهای پروتئینی – که هزاران مورد از آن‌ها در خزانه‌های شرکت‌های دارویی قفل شده‌اند – یکی از منابع امیدوارکننده را ارائه می‌دهند. امروز، کنسرسیومی از شرکت‌های داروسازی گزارش داد که استفاده از چنین داده‌هایی برای آموزش مدل‌های هوش مصنوعی تاخوردگی پروتئین، عملکرد مدل را به طور چشمگیری بهبود می‌بخشد.

این گروه از OpenFold3 — یک بازتولید متن‌باز از آلفافولد ۳ — برای توسعه مدلی جدید استفاده کرد که بر روی بیش از ۲۰,۰۰۰ ساختار پروتئینی اختصاصی آموزش دیده بود. این سیستم هم از موارد مشابه آموزش‌دیده فقط با داده‌های عمومی و هم از آن‌هایی که با مجموعه داده‌های جزیره‌ای شرکت‌های انفرادی آموزش دیده بودند، عملکرد بهتری داشت. این مطالعه که در یک پست وبلاگ توصیف شده، هنوز داوری نشده و مدل به صورت عمومی در دسترس نیست.

«شما تمام این داده‌ها را اضافه می‌کنید و جهش قابل توجهی در عملکرد دریافت می‌کنید»، می‌گوید محمد القریشی (Mohammed AlQuraishi)، زیست‌شناس محاسباتی در دانشگاه کلمبیا در نیویورک، که بخشی از این تلاش بوده است.

به گفته او، این یافته‌ها از ضرورت تولید مجموعه داده‌های عمومی مشابه برای تقویت هوش مصنوعی‌های تاخوردگی پروتئین حمایت می‌کند. یکی از چنین پروژه‌هایی به نام OpenBind که با حمایت تا ۸ میلیون پوند (۱۰.۸ میلیون دلار آمریکا) از بودجه دولت بریتانیا پشتیبانی می‌شود، ماه گذشته صدها ساختار پروتئینی جدید منتشر کرد و هزاران مورد دیگر نیز در دست کار هستند.

یک رگه دست‌نخورده

بانک داده پروتئین (PDB)، یک مخزن متن‌باز شامل بیش از ۲۰۰,۰۰۰ ساختار پروتئینی تعیین‌شده تجربی، پایه و اساس داده‌های آموزشی آلفافولد ۲ بود. این امر به ابزار اجازه داد تا ساختارهای پروتئینی را با دقت حیرت‌انگیزی پیش‌بینی کند — یک تحول که با جایزه نوبل شیمی ۲۰۲۴ به رسمیت شناخته شد.

جانشینان این مدل، از جمله آلفافولد ۳، قابلیت پیش‌بینی نحوه تعامل پروتئین‌ها با سایر مولکول‌ها، از جمله داروهای بالقوه را افزودند. اما PDB نمونه‌های نسبتاً کمی از ساختارهای تعیین‌شده تجربی دارد که با مولکول‌های شبه‌دارویی تعامل دارند – شاید تنها ۱۰,۰۰۰ مورد، به گفته پل مورتِنسون (Paul Mortenson)، معاون شیمی محاسباتی و انفورماتیک در شرکت داروسازی Astex در کمبریج، بریتانیا.

این کمبود داده برای تلاش‌های کشف دارو مشکلی ایجاد می‌کند. تحقیقات نشان داده‌اند که دقت آلفافولد ۳ و سایر مدل‌های «هم‌تاخورد» (co-folding) — که ساختار پروتئین‌های در حال تعامل با یکدیگر را پیش‌بینی می‌کنند — به شدت کاهش می‌یابد زمانی که مدل‌ها چالش پیش‌بینی تعاملات بین مولکول‌هایی را داشته باشند که بسیار متفاوت از آن‌هایی هستند که با آن‌ها آموزش دیده‌اند1.

پژوهشگران می‌گویند برای مفیدتر کردن چنین ابزارهایی در کشف دارو، آن‌ها نیاز به دسترسی به داده‌های بیشتری دارند – به همین دلیل است که آن‌ها به خزانه‌های ساختارهای مولکولی شرکت‌های داروسازی روی آورده‌اند.

این داده‌ها در طول برنامه‌های کشف دارو، با استفاده از تکنیک‌هایی مانند بلورشناسی اشعه ایکس و میکروسکوپی الکترونی کرایو تولید می‌شوند. بسیاری از ساختارهای پروتئینی هرگز در پایگاه‌های داده عمومی ثبت نشده‌اند زیرا مربوط به تلاش‌های اختصاصی توسعه دارو هستند. اندازه کل این خزانه‌ها ناشناخته است، اما برخی تخمین زده‌اند که ممکن است حاوی داده‌های بیشتری نسبت به PDB باشند.

«داده‌هایی که در PDB غایب هستند، دقیقاً همان داده‌هایی هستند که در داده‌های داخلی ما وجود دارند»، جان کارانیکولا (John Karanicolas)، رئیس کشف داروی محاسباتی در شرکت داروسازی AbbVie در شیکاگو، ایلینوی، سال گذشته به مجله Nature گفت.

پیش‌بینی‌های بهتر

برای آزمایش اینکه آیا داده‌های آن‌ها می‌تواند برای مدل‌های تاخوردگی پروتئین مفید باشد، AbbVie، Astex و چندین شرکت دارویی دیگر سال گذشته همکاری‌ای را به نام شبکه زیست‌شناسی ساختاری هوش مصنوعی (AISB) تشکیل دادند.

این فرآیند شامل «تنظیم دقیق» (fine-tuning) OpenFold3 – که قبلاً فقط با داده‌های PDB آموزش دیده بود – بر روی ۲۰,۱۶۷ ساختار اضافی بود که پروتئین‌های متصل به داروهای بالقوه، یا لیگاندها را ثبت می‌کردند. این ساختارها از پنج شرکت تهیه شدند و به گونه‌ای به مدل ارائه شدند که داده‌های اختصاصی محرمانه باقی بمانند.

مطالعه AISB یافت که داده‌های اضافی پیش‌بینی‌ها را تقویت کردند. هنگامی که بر روی ۱,۰۵۶ ساختار پروتئین–لیگاند که از داده‌های آموزشی کنار گذاشته شده بودند آزمایش شد، مدل AISB بیش از نیمی از آن‌ها را با سطح بالایی از دقت پیش‌بینی کرد. در مقابل، نسخه عمومی OpenFold3 همان عملکرد را فقط در یک سوم ساختارها داشت و یک مدل متن‌باز رقیب به نام Boltz-2 حدود ۴۰ درصد موفقیت کسب کرد. این تیم قصد دارد مقاله‌ای را که این کار را توصیف می‌کند برای انتشار در یک ژورنال داوری‌شده ارسال کند.

کارانیکولا می‌گوید این واقعیت که مدل AISB همچنین از ابزارهای هم‌تاخوردی که فقط بر روی داده‌های انفرادی هر شرکت آموزش دیده بودند، عملکرد بهتری داشت، مزایای تجمیع اطلاعات را برجسته می‌کند.

اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: nature.com