SiameseFuse: شبكة ذات كفاءة حسابية وغير عميقة لدمج الصور المرئية والأشعة تحت الحمراء

العنوان SiameseFuse: شبكة ذات كفاءة حسابية وغير عميقة لدمج الصور المرئية والأشعة تحت الحمراء
المؤلف أوزر، سيدات، إيجي، م.، أوزكان أوغلو، M.A.
تاريخ النشر: 2022-09
مكان النشر - إلسفير
الموضوع التعلم الفعال، الانصهار متعدد الوسائط، الانصهار المتعدد الزماني
النوع دورية
اللغة الإنجليزية
رقمي نعم
مخطوط لا
المكتبة: جامعة اوزيجين
معرف أصل المكتبة 0031-3203
رقم السجل 55adc5dc-a7b3-43cc-b100-b75f240fb973
موقع المكتبة علوم الكمبيوتر
التاريخ 2022-09
ملاحظات توبيتاك
نص عينة حفزت التطورات الأخيرة في تحليل الأنماط العديد من الباحثين على التركيز على تطوير الحلول القائمة على التعلم العميق في تطبيقات معالجة الصور المختلفة. لقد كان دمج الصور متعددة الوسائط أحد مجالات التطبيق حيث يكون الاهتمام هو الجمع بين المعلومات المختلفة الواردة من طرائق مختلفة بطريقة أكثر وضوحًا وغنية بالمعلومات. ولهذا الغرض، من المهم أولاً استخلاص السمات البارزة من كل طريقة ثم دمجها بأكبر قدر ممكن من الكفاءة والمعلومات. تشير الأدبيات الحديثة حول دمج الصور متعددة الوسائط إلى حلول عميقة متعددة تجمع بين الصور المرئية (RGB) والأشعة تحت الحمراء (IR). في هذا البحث، ندرس أداء مختلف الحلول العميقة المتوفرة في الأدبيات بينما نبحث عن إجابة للسؤال: "هل نحتاج حقًا إلى شبكات أعمق لدمج الصور متعددة الوسائط؟" للحصول على إجابة لهذا السؤال، نقدم بنية جديدة تعتمد على الشبكات السيامية لدمج صور RGB (المرئية) مع صور الأشعة تحت الحمراء (IR) والإبلاغ عن أحدث النتائج. نقدم تحليلًا شاملاً حول زيادة أعداد الطبقات في البنية مع وضع السؤال المذكور أعلاه في الاعتبار لمعرفة ما إذا كان استخدام شبكات أعمق (أو إضافة طبقات إضافية) يضيف أداءً كبيرًا في الحل المقترح لدينا. نقوم بالإبلاغ عن أحدث النتائج المتعلقة بالدمج البصري في ضوء أزواج الصور المرئية والأشعة تحت الحمراء في مقاييس أداء متعددة، مع الحاجة إلى أقل عدد من المعلمات القابلة للتدريب. تشير نتائجنا التجريبية إلى أن الشبكات الضحلة (كما هو الحال في حلولنا المقترحة في هذه الورقة) يمكنها دمج كل من الصور المرئية وصور الأشعة تحت الحمراء بالإضافة إلى الشبكات العميقة التي تم اقتراحها مسبقًا في الأدبيات (تمكنا من تقليل العدد الإجمالي للمعلمات القابلة للتدريب حتى 96.5٪، ومقارنة 2625 معلمة قابلة للتدريب إلى 74193 معلمة قابلة للتدريب).
DOI 10.1016/j.patcog.2022.108712
Cilt 129
عرض في المصدر جامعة اوزيجين جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات
جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات جامعة اوزيجين

SiameseFuse: شبكة ذات كفاءة حسابية وغير عميقة لدمج الصور المرئية والأشعة تحت الحمراء

المؤلف أوزر، سيدات، إيجي، م.، أوزكان أوغلو، M.A.
تاريخ النشر 2022-09
مكان النشر - إلسفير
الموضوع التعلم الفعال، الانصهار متعدد الوسائط، الانصهار المتعدد الزماني
النوع دورية
اللغة الإنجليزية
رقمي نعم
مخطوط لا
المكتبة جامعة اوزيجين
معرف أصل المكتبة 0031-3203
رقم السجل 55adc5dc-a7b3-43cc-b100-b75f240fb973
موقع المكتبة علوم الكمبيوتر
التاريخ 2022-09
ملاحظات توبيتاك
نص عينة حفزت التطورات الأخيرة في تحليل الأنماط العديد من الباحثين على التركيز على تطوير الحلول القائمة على التعلم العميق في تطبيقات معالجة الصور المختلفة. لقد كان دمج الصور متعددة الوسائط أحد مجالات التطبيق حيث يكون الاهتمام هو الجمع بين المعلومات المختلفة الواردة من طرائق مختلفة بطريقة أكثر وضوحًا وغنية بالمعلومات. ولهذا الغرض، من المهم أولاً استخلاص السمات البارزة من كل طريقة ثم دمجها بأكبر قدر ممكن من الكفاءة والمعلومات. تشير الأدبيات الحديثة حول دمج الصور متعددة الوسائط إلى حلول عميقة متعددة تجمع بين الصور المرئية (RGB) والأشعة تحت الحمراء (IR). في هذا البحث، ندرس أداء مختلف الحلول العميقة المتوفرة في الأدبيات بينما نبحث عن إجابة للسؤال: "هل نحتاج حقًا إلى شبكات أعمق لدمج الصور متعددة الوسائط؟" للحصول على إجابة لهذا السؤال، نقدم بنية جديدة تعتمد على الشبكات السيامية لدمج صور RGB (المرئية) مع صور الأشعة تحت الحمراء (IR) والإبلاغ عن أحدث النتائج. نقدم تحليلًا شاملاً حول زيادة أعداد الطبقات في البنية مع وضع السؤال المذكور أعلاه في الاعتبار لمعرفة ما إذا كان استخدام شبكات أعمق (أو إضافة طبقات إضافية) يضيف أداءً كبيرًا في الحل المقترح لدينا. نقوم بالإبلاغ عن أحدث النتائج المتعلقة بالدمج البصري في ضوء أزواج الصور المرئية والأشعة تحت الحمراء في مقاييس أداء متعددة، مع الحاجة إلى أقل عدد من المعلمات القابلة للتدريب. تشير نتائجنا التجريبية إلى أن الشبكات الضحلة (كما هو الحال في حلولنا المقترحة في هذه الورقة) يمكنها دمج كل من الصور المرئية وصور الأشعة تحت الحمراء بالإضافة إلى الشبكات العميقة التي تم اقتراحها مسبقًا في الأدبيات (تمكنا من تقليل العدد الإجمالي للمعلمات القابلة للتدريب حتى 96.5٪، ومقارنة 2625 معلمة قابلة للتدريب إلى 74193 معلمة قابلة للتدريب).
DOI 10.1016/j.patcog.2022.108712
Cilt 129
جامعة اوزيجين - محرك بحث الآثار التاريخية والأرشيفات والدوريات
جامعة اوزيجين يتم إعادة توجيهك...

يرجى الانتظار