شناسایی گونه های شاخص در زیستگاه های زیست محیطی با استفاده از یادگیری بهینه بهینه

ساخت وبلاگ

بخش اعظم تحقیقات فعلی در مورد مدل سازی تحت نظارت بر حداکثر رساندن دقت پیش بینی نتیجه است. با این حال ، در رشته های مهندسی ، یک هدف مهمتر مهمتر از آن است که استخراج ویژگی ها ، شناسایی ویژگی های مربوطه مرتبط با نتایج مختلف است. به عنوان مثال ، در جوامع میکروبی ، شناسایی گونه های سنگی اغلب می تواند منجر به پیش بینی بهبود یافته تغییرات رفتاری در آینده شود. در این مقاله یک استخراج کننده ویژگی جدید مبتنی بر یادگیری عمیق ارائه شده است ، که عمدتاً برای فرضیات اساسی در مورد داده های آموزشی آگنوستیک است. با شروع مجموعه ای از تعداد فراوانی گونه های میکروبی ، مدل یادگیری عمیق ابتدا خود را برای طبقه بندی زیستگاه های مجزا انتخاب شده آموزش می دهد. سپس گونه های شاخص مرتبط با زیستگاه ها را مشخص می کند. سپس نتایج با نتایج به دست آمده توسط تکنیک های آماری سنتی مقایسه و تضاد می شود. گونه های شاخص با وجود تفاوت های قابل مشاهده در سطوح پایین تر مانند کلاس و نظم ، در مقادیر طبقه بندی برتر مانند دامنه و پناهنده مقایسه می شوند. مهمتر از همه ، هنگامی که از شاخص های تخمین زده شده ما برای پیش بینی برچسب های زیستگاه نهایی با استفاده از مدل های ساده تر (مانند ماشین های بردار پشتیبانی و شبکه های عصبی مصنوعی سنتی) استفاده می شود ، دقت پیش بینی بهبود می یابد. به طور کلی ، این مطالعه به عنوان یک مرحله مقدماتی است که مدل های یادگیری ماشین مدرن و جعبه سیاه را با تکنیک های سنتی و غنی از تخصص در دامنه قرار می دهد.

استناد: Tsai Y ، Baldwin SA ، Gopaluni B (2021) شناسایی گونه های شاخص در زیستگاه های زیست محیطی با استفاده از یادگیری بهینه بهینه. PLOS ONE 16 (9): E0256782. https://doi. org/10. 1371/joual. pone. 0256782

ویراستار: Zaher Mundher Yaseen ، Ton Duc Thang University ، Viet Nam

دریافت: 3 مه 2021 ؛پذیرفته شده: 14 اوت 2021 ؛منتشر شده: 10 سپتامبر 2021

کپی رایت: © 2021 Tsai و همکاران. این یک مقاله دسترسی آزاد است که تحت شرایط مجوز انتساب Creative Commons توزیع شده است ، که اجازه استفاده ، توزیع و تولید مثل بدون محدودیت را در هر رسانه ای می دهد ، مشروط بر اینکه نویسنده و منبع اصلی اعتبار داشته باشند.

در دسترس بودن داده ها: ما پرونده های داده خام مربوطه ، و همچنین کد پایتون حاوی مراحل پیش پردازش داده ها را به مخزن عمومی GitHub (https://github. com/yitingtsai90/indicatorotu) بارگذاری کرده ایم.

بودجه: نویسنده (ها) بودجه خاصی برای این کار دریافت نکردند.

منافع رقابتی: نویسندگان اعلام کرده اند که هیچ منافع رقابتی وجود ندارد.

معرفی

انگیزه اصلی این کار پیشنهاد یک استخراج کننده ویژگی مبتنی بر ماشین است که به طور کلی برای مجموعه داده های غیر خطی از ابعاد بالا کار می کند ، سپس اثربخشی آن را در یک مورد بیولوژیکی واقعی با ویژگی های از پیش تعیین شده ارزیابی می کند ، تا تعیین کند که آیا به اندازه کافی قابل اعتماد استبرای سایر مطالعات مشابه مورد استفاده قرار می گیرد. رشته های مربوط به بیولوژیکی اغلب با وظیفه مدل سازی در مجموعه داده های با ابعاد بالا (یعنی بسیاری از متغیرهای ورودی خام) روبرو هستند. در رشته هایی مانند تشخیص و پیشگیری از بیماری ، بخش عمده ای از تحقیقات فعلی بر حداکثر رساندن دقت پیش بینی برچسب های نتیجه است. به عنوان مثال ، نویسندگان [1] عملکردهای موجود در زرادخانه بزرگی از مدلهای پیش بینی کننده (مانند رگرسیون لجستیک ، دستگاه های بردار پشتیبانی ، جنگل های تصادفی ، بیوه های بیس K-nearest همسایگان) را برای انجام کار تشخیص دیابت 2 مقایسه و تضاد کردند. با این حال ، در سایر رشته ها مانند بوم شناسی ، کاهش ابعاد و مهندسی ویژگی ها وظایف به همان اندازه مهم هستند که به درک بصری این مجموعه داده ها کمک می کنند. در مجموعه داده های زیست محیطی ، تعامل جامعه بین گونه های فردی (متغیرهای ورودی) می تواند برای مدل سازی دشوار باشد. بنابراین ، وظایفی مانند شناسایی گونه های شاخص (به عنوان مثال سنگی یا گونه های رهبر) می تواند چالش برانگیز باشد ، زیرا کاربر اغلب در مورد اینکه کدام الگوریتم کاهش ابعاد مناسب است ، گیج می شود. در ادبیات گذشته ، از روش هایی مانند Indval [2] به طور سنتی برای شناسایی گونه های شاخص استفاده شده است. پیاده سازی های موفق را می توان در نشریاتی مانند [3-5]) مشاهده کرد ، که در آن تعداد فراوانی گونه های میکروبی از سایت های مختلف در دسترس است. روش Indval از مقیاس بندی چند بعدی [6] و به دنبال آن تجزیه و تحلیل مکاتبات (CA) و تجزیه و تحلیل مکاتبات محروم (DCA) [7] برای رتبه بندی توپولوژی سایت ها استفاده می کند. گروه های گونه شاخص سپس با استفاده از خوشه بندی سلسله مراتبی [8] و K-means [9] شناسایی می شوند. مقدار شاخص نهایی یک گونه خاص را می توان تقریباً به عنوان فرکانس وقوع آن در تمام خوشه ها ، در تمام سایت ها توصیف کرد. با این حال ، با توجه به پیچیدگی روزافزون و ماهیت غیرخطی مجموعه داده های مدرن ، استفاده از این ابزارهای آماری سنتی ممکن است توانایی الگوریتم کلی را در تعمیم طیف گسترده ای از تعامل بین ویژگی ها کاهش دهد.

شناسایی گونه های شاخص را می توان یک مورد خاص از یک دسته کلی تر از کارهای مدل سازی ، که به عنوان تجزیه و تحلیل ویژگی شناخته می شود ، در نظر گرفت. با توجه به یک ماتریس داده X با نمونه های کل N به عنوان ردیف و ستون های D به عنوان متغیرهای خام ، تعریف دقیق تجزیه و تحلیل ویژگی را می توان به طور ظریف به شرح زیر تشخیص داد:

  1. انتخاب ویژگی: تعیین اینکه آیا هر متغیر خام xj(j ∈ [1 ، ⋯ ، d]) به طور قابل توجهی در خروجی مدل (ها) نقش دارد.
  2. استخراج ویژگی: تعیین ترکیبات خطی یا غیرخطی از متغیرهای خام (مثال X1log log (x2)) که به طرز چشمگیری در خروجی مدل (ها) کمک می کند.

محدودیت های روشهای استخراج ویژگی فعلی فعلی دو برابر است. مشکل اول این است که بسیاری از استخراج کنندگان به سادگی از تکنیک های انتخاب ویژگی استفاده می کنند ، که از نظر ماهیت یک متغیر هستند و بنابراین قادر به تشخیص تعامل چند متغیره نیستند. به طور خاص ، در بعضی موارد متغیرهای فردی ممکن است به خودی خود مرتبط نباشند ، اما هنگام همزیستی (در مد های خطی یا غیرخطی) به نتیجه نهایی کمک می کنند. مشکل دوم فرضیات محدود کننده الگوریتم های کاهش ابعاد مورد استفاده در استخراج کننده های ویژگی چند متغیره است. به عنوان مثال ، استخراج کننده هایی که در اولویت شهود و تفسیر ویژگی های نهان قرار دارند ، اغلب از تجزیه و تحلیل مؤلفه اصلی (PCA) [10] به عنوان ابزاری استفاده می کنند. این الگوریتم فرض می کند که فضای نهفته اساسی ترکیبی خطی از ورودی های خام (یعنی گونه ها) است که ممکن است نمایشی دقیق از بسیاری از سیستم های بیولوژیکی نباشد. الگوریتم مثال دیگر K-Means است که فرض می کند توزیع اساسی داده ها گاوسی های چند متغیره است (به دلیل K-means یک مورد خاص از مخلوط های گاوسی است [11]). اگر از K-Means برای تجزیه و تحلیل یک مجموعه داده که بسیار غیر گاوسی است استفاده می شد ، نتایج به دست آمده می تواند گمراه کننده یا بی معنی باشد.

در ادبیات فعلی ، اکثر تکنیک های انتخاب ویژگی ها رویکردهای یک متغیره هستند که برچسب های "بله" یا "نه" را با توجه به اهمیت آن اختصاص می دهند. یک مثال ساده اضافه کردن یک1یا Lasso Repinizer [12] به هر عملکرد هدف مدل. روشهای دیگر شامل میانگین کاهش دقت (MDA) و میانگین کاهش در جینی (MDG) [13] است که در رابطه با مدل های جنگل تصادفی (RF) استفاده می شود. در MDA ، ویژگی های فردی به طور تصادفی مجاز (scrambled) هستند و اثر حاصل از آن بر دقت مدل تعیین می شود ، در مقایسه با پرونده پایه که در آن هیچ ویژگی مورد استفاده قرار نمی گیرد. در MDG ، با مشاهده چند بار از یک ویژگی برای ایجاد یک تقسیم تصمیم در مدل RF ، اهمیت ویژگی تعیین می شود. مضرات این روشها عمدتاً ماهیت تک متغیره آنها و همچنین میزان قابل توجهی کشف کاذب (مثبت یا منفی) است.< SPAN> یا Lasso Disperizer [12] به هر عملکرد هدف مدل. روشهای دیگر شامل میانگین کاهش دقت (MDA) و میانگین کاهش در جینی (MDG) [13] است که در رابطه با مدل های جنگل تصادفی (RF) استفاده می شود. در MDA ، ویژگی های فردی به طور تصادفی مجاز (scrambled) هستند و اثر حاصل از آن بر دقت مدل تعیین می شود ، در مقایسه با پرونده پایه که در آن هیچ ویژگی مورد استفاده قرار نمی گیرد. در MDG ، با مشاهده چند بار از یک ویژگی برای ایجاد یک تقسیم تصمیم در مدل RF ، اهمیت ویژگی تعیین می شود. مضرات این روشها عمدتاً ماهیت تک متغیره آنها و همچنین نرخ کشف کاذب قابل توجهی (مثبت یا منفی) است. تنظیم کننده Lasso [12] برای هر عملکرد هدف مدل. روشهای دیگر شامل میانگین کاهش دقت (MDA) و میانگین کاهش در جینی (MDG) [13] است که در رابطه با مدل های جنگل تصادفی (RF) استفاده می شود. در MDA ، ویژگی های فردی به طور تصادفی مجاز (scrambled) هستند و اثر حاصل از آن بر دقت مدل تعیین می شود ، در مقایسه با پرونده پایه که در آن هیچ ویژگی مورد استفاده قرار نمی گیرد. در MDG ، با مشاهده چند بار از یک ویژگی برای ایجاد یک تقسیم تصمیم در مدل RF ، اهمیت ویژگی تعیین می شود. مضرات این روشها عمدتاً ماهیت تک متغیره آنها و همچنین میزان قابل توجهی کشف کاذب (مثبت یا منفی) است.

از طرف دیگر ، تکنیک های استخراج ویژگی سعی در تشخیص تعامل چند متغیره بین متغیرهای خام دارند. بررسی دقیق روشهای پیشرفته در این زمینه را می توان در کار [14] یافت. یک روش ساده و محاسباتی از نظر محاسباتی PCA فوق الذکر است که ترکیبات خطی از ورودی های خام را کشف می کند. انتشار قبلی موضوع مشابه [15] است که از PCA برای تعیین نشانگرهای زیستی پروتئومیک استفاده می کند. مثال موفق دیگر کار [16] است که در آن نویسندگان از یک الگوریتم پیشرفته PCA برای تعیین صحیح ویژگی های نهفته که به بهترین وجه پیش بینی رتینوپاتی دیابتی در بیماران است ، استفاده می کنند. در موارد دیگر ، با این حال ، PCA به دلیل وجود ویژگی های نهفته غیر خطی ممکن است تقریبی ضعیفی داشته باشد. این غیرخطی ها با استفاده از روشهایی مانند نقشه برداری ایزومتریک (ISOMAP) [17] ، تعبیه محلی خطی (LLE) [18] ، تعبیه همسایه t-sontochastic ( T-Sne) [19] و یکنواخت می توانند تا حدی کاهش یابد. تقریب و پیش بینی منیفولد [20]. الگوریتم های فوق الذکر بازنمودهای بعدی کمتری از داده ها را ارائه می دهند که به راحتی قابل تجسم هستند. به عنوان مثال ، یک مقاله اخیر توسط [21] نشان داد که T-SNE می تواند برای گروه بندی های سازگار با محیط زیست مشابه به منظور روشن شدن ساختارهای جامعه در هر منطقه استفاده شود. با این حال ، یک کاستی عمده از این روشهای غیرخطی این است که ویژگی های نهفته استخراج شده از نظر متغیرهای خام اصلی دشوار است. نمونه ای از این مقاله ، مقاله تعبیه شده خطی محلی (SLLE) توسط [22] است. در این کار ، نویسندگان نشان دادند که سه کلاس گل در مجموعه داده های فیشر آیریس [23] را می توان در یک فضای 2- D به سه منطقه مجزا فشرده کرد. با این حال ، روابط شهودی بین 2 مؤلفه نهفته و 4 ویژگی اصلی هرگز به صراحت مورد بررسی قرار نمی گیرد. اکثر روشهای کاهش ابعادی چند متغیره ، درک ویژگی های استخراج شده (مثال PCA) یا تجسم آسان خوشه ها (مثال t-sne) را در اولویت قرار می دهند ، اما تعداد کمی از آنها وجود دارد که هر دو را برآورده می کند. سرانجام ، انتخاب روش کاهش ابعاد نیز به میزان دانش دامنه موجود بستگی دارد. به عنوان مثال ، هنگامی که ساختار عملکردی ویژگی های نهفته کاملاً مشهور است ، سپس هسته ها [24] (لیستی از توابع پایه مانند چند جمله ای ، ریشه های مربع ، نمایی و غیره) می توانند برای پیش تعیین کننده نمایش ویژگی مورد نظر استفاده شوند. بشراز طرف دیگر ، اگر دانش دامنه کمی در دسترس نباشد ،

سپس کاربر برای یافتن یک مورد مناسب به متناسب با هر هسته متوسل می شود. اگر ساختار غیر خطی خیلی پیچیده باشد ، هیچ یک از توابع پایه از پیش تعیین شده مناسب نیستند. بنابراین ، نیاز روشنی به یک روش کاهش ابعاد وجود دارد ، که به مقادیر فراوان دانش قبلی متکی نیست.

پیشرفت های اخیر در قدرت محاسبات از ظهور یک کلاس قدرتمند از مدل های معروف به یادگیری عمیق (DL) پشتیبانی کرده است [25]. این مدلها قادر به آموزش مدلهای بسیار دقیق برای حل مشکلات طبقه بندی هستند ، به دلیل اینکه شبکه های عصبی عمیق تقریب های جهانی خوب هستند [26 ، 27] (یعنی قادر به تناسب هرگونه غیرخطی با استفاده از توابع فعال سازی ، در صورت آموزش کافی). آثاری مانند [28-31] توانایی پیش بینی بالای DL را که در موارد یادگیری تحت نظارت استفاده می شود ، نشان می دهد. در این مطالعات ، ویژگی های مورد نظر یا با استفاده از PCA از قبل مهندسی شده اند ، یا توسط شبکه های عصبی در مد های جعبه سیاه که تفسیر آنها را دشوار می کند. در برنامه هایی که دقت پیش بینی را در اولویت قرار می دهند ، دانش از هویت دقیق ویژگی های نهفته ممکن است مهم نباشد. با این حال ، در برنامه های دیگر که در اولویت تشخیص و تجزیه و تحلیل ریشه قرار می گیرند ، مرحله استخراج ویژگی در گفتن به کاربر که متغیرهای ترکیبی را جستجو می کنند ، بسیار مهم است و از آن جلوگیری می کند. به بهترین دانش ما ، کار ما یکی از معدودی است که به بررسی اثربخشی مدلهای DL در هنگام طراحی برای پرداختن به هر دو جبهه می پردازد: دقت پیش بینی و توانایی شناسایی ویژگی های صحیح مرتبط.

  1. در این کار ، ما کاربرد این مدل DL را برای مشکلات بیوانفورماتیک متمرکز می کنیم ، که نمونه ای از پیش بینی زیستگاه زیست محیطی و شناسایی گونه های شاخص مرتبط با هر زیستگاه است. این مجموعه داده ها شامل تعداد فراوانی گونه ها به عنوان نمونه هستند. هر نمونه شامل تعداد زیادی از واحدهای طبقه بندی شده توسط توالی آمپلیکون 16 ثانیه RNA است که یا به عنوان واحدهای طبقه بندی عملیاتی (OTUS) [32] یا انواع توالی آمپلیکون (ASV) نشان داده شده است [33]. نتیجه مربوطه معمولاً یک برچسب کلاس است که منبع خود را متمایز می کند (به عنوان مثال دریاچه ، رودخانه ، اقیانوس و غیره) یا زیستگاه آن (طبیعی ، آشفته و غیره). هدف از مدل سازی پیش بینی ، تخمین برچسب زیستگاه صحیح نمونه های جدید ، با توجه به تعداد فراوانی آنها در مورد همه گونه ها است. در حالی که دقت پیش بینی آزمون مدل ، تمرکز بسیاری از تلاشهای تحقیقاتی ML است ، می توان استدلال کرد که برنامه های اصلاح اطلاعات بیشتر از استخراج ویژگی ها به دست می آورند. بنابراین ، انگیزه کار ما در زمینه برنامه های کاربردی بیوانفورماتیک می تواند به شرح زیر روشن شود:
  2. برچسب زیستگاه هر سایت را با استفاده از مدل های یادگیری ماشین تخمین بزنید ، برای تولید مجموعه دوم برچسب هایی که می توان با آن مقایسه و در تضاد با روشهای به دست آمده با استفاده از روشهای سنتی است.

گونه های شاخص مرتبط با هر زیستگاه را شناسایی کرده و از این طریق نیاز به دانستن تعداد فراوانی از همه گونه های موجود را از بین می برد. این به طور قابل توجهی هزینه های زمان و مالی مرتبط با جمع آوری نمونه دستی و تجزیه و تحلیل آزمایشگاهی را کاهش می دهد.

  1. ما این بخش را با خلاصه کردن دامنه ، اهداف و مزایای کار خود به شرح زیر پایان می دهیم: یک استخراج کننده ویژگی مبتنی بر یادگیری عمیق برای مشکلات طبقه بندی باینری ، با دو مزیت اصلی نسبت به استخراج کننده های موجود ایجاد کنید:
  2. این به ساختار غیرخطی واقعی فضای ویژگی زیرین است.

این هنوز ویژگی های نهفته قابل تفسیر را تولید می کند.

  1. ما این کار را با بهره گیری از خاصیت مورد تجاوز جهانی از یادگیری عمیق ، یعنی توانایی شبکه های عصبی برای یادگیری هرگونه ساختار غیر خطی از طریق ترکیبات بی رحمانه از توابع فعال سازی انجام می دهیم (مثال Relu ، Selu ، Sigmoid ، Tanh و غیره.). به منظور حفظ تفسیر ویژگی های نهفته ، ما از فعال سازی های RELU استفاده می کنیم ، که منجر به ترکیبات وابسته به ورودی های خام ، مشابه موارد بدست آمده از PCA می شود. سرانجام ، اهداف عمومی و مورد خاص کار ما را می توان به شرح زیر خلاصه کرد:
  2. برای طبقه بندی باینری ، یک مدل یادگیری عمیق را بسازید و آموزش دهید ، که برچسب های کلاس نمونه های جدید را با دقت کافی پیش بینی می کند.
  3. یک فضای نهفته را که بهینه دو کلاس را از هم جدا می کند ، شناسایی می کند ، که سپس برای استخراج مهمترین ویژگی ها برای پیش بینی استفاده می شود.

اثربخشی روش پیشنهادی را در یک مجموعه داده اکولوژیکی واقعی ، با مقایسه برچسب های کلاس پیش بینی شده و ویژگی های استخراج شده با مواردی که قبلاً با استفاده از روشهای سنتی مشخص شده بودند ، نشان می دهد.

در این مقاله ، ما با نماد یادگیری ماشین استاندارد در مورد ماتریس های عددی و بردارهای مرتبط با مجموعه داده ها مطابقت خواهیم داشت. این نامگذاری آنهایی را که در متونی مانند [25] و [11] استفاده می شود ، آینه می کند.

نامگذاری

کتاب دستیار معامله گر...
ما را در سایت کتاب دستیار معامله گر دنبال می کنید

برچسب : نویسنده : پرویز صیاد بازدید : <-PostHit-> تاريخ : سه شنبه 1 فروردين 1402 ساعت: 17:11