مجله ماشین بینایی و پردازش تصویر

مجله ماشین بینایی و پردازش تصویر

ارائه روشی نوین برای توصیف ناحیه مورد علاقه در استاندارد کدگذاری ویدئو برای ماشین‌ها

نوع مقاله : مقاله پژوهشی

نویسندگان
1 گروه اینترنت اشیا، دانشکده مهندسی کامپیوتر، دانشگاه صنعتی خواجه نصیرالدین طوسی تهران، ایران
2 گروه اینترنت اشیا، دانشکده مهندسی کامپیوتر، دانشگاه صنعتی خواجه نصیرالدین طوسی
چکیده
با گسترش کاربردهای تحلیل ویدئو در کاربردهایی مانند نظارت ویدئویی و خودروهای خودران، نیاز به روش‌های کارآمد برای کاهش پیچیدگی پردازش و فشرده‌سازی داده بیش از پیش اهمیت یافته است. در کدگذاری ویدئویی برای ماشین‌ها برخلاف استانداردهای سنتی، تمرکز بر انتقال کارآمد اطلاعات معنادار برای تحلیل ماشینی است. چالش اصلی در این حوزه، پیچیدگی بالای شبکه‌های تشخیص اشیاء و هزینه‌ سنگین پردازش آن‌ها در دستگاه‌های بلادرنگ است. در این پژوهش، یک نسخه ساده‌سازی‌شده از YOLOv8 ارائه می‌شود که با بهره‌گیری از چنددقتی‌سازی محاسبات، هرس وزنی و تقطیر دانش، پیچیدگی مدل را بدون افت محسوس عملکرد کاهش می‌دهد. همچنین یک ساختار کدگذار/کدگشا مبتنی بر تولید سه جریان ایجاد شده است تا نرخ بیت ورودی در مرحله کدگذاری کاهش یابد. نتایج تجربی نشان می‌دهد که روش پیشنهادی زمان تاخیر در تشخیص اشیاء را تا 50 درصد کاهش می‌دهد درحالی که، دقت را تنها ۰٫۰۵درصد تحت‌تأثیر قرار می‌دهد و امکان پردازش بلادرنگ ویدئو را فراهم می‌سازد. افزون بر این، تقسیم‌بندی جریان ورودی سبب کاهش نرخ بیت بدون افت محسوس در دقت تشخیص می‌شود.نوآوری اصلی این کار، ترکیب ساده‌سازی ساختاری شبکه با معماری جدید کدگذاری سه‌جریانی است که به‌طور هم‌زمان موجب کاهش پیچیدگی محاسباتی و بهبود فشرده‌سازی در سناریوهای بلادرنگ می‌شود.
کلیدواژه‌ها

   [1]      C. Chen, S. Liu, and F. Wu, “Towards Intelligent Video Coding for Machines,” IEEE Transactions on Circuits and Systems for Video Technology, vol. 30, no. 7, pp. 2114–2128, 2020.
   [2]      ISO/IEC JTC1/SC29/WG11 (MPEG), “Draft Call for Proposals on Video Coding for Machines (VCM),” 2019.
   [3]      Ultralytics, “YOLOv8 Documentation,” 2023.
   [4]      H. Ye, et al., “Edge Intelligence for Video Analytics: Challenges and Opportunities,” IEEE Network, vol. 35, no. 3, pp. 38–45, 2021.
   [5]      Z. Chen, J. Li, and F. Wu, “Machine-Centric Video Coding: A New Paradigm,” IEEE Transactions on Image Processing, vol. 29, pp. 3336–3351, 2020.
   [6]      Z. Ma, J. Liu, and F. Wu, “A Framework for Video Coding for Machines,” IEEE Communications Magazine, vol. 58, no. 7, pp. 54–59, 2020.
   [7]      S. Maćkowiak, et al., “Video coding for machines: Partial transmission of SIFT features,” arXiv preprint arXiv:2201.02689, 2022..
   [8]      J. Redmon, S. Divvala, R. Girshick, and A. Farhadi, “You Only Look Once: Unified, Real-Time Object Detection,” Proc. IEEE Computer Society Conference on Computer Vision and Pattern Recognition, 2016.
   [9]      L. Zhang, et al., “ROI-Based Video Coding for Object Detection,” Proc. IEEE International Conference on Image Processing, pp. 3314–3318, 2019.
[10]      M. Domański, O. Stankiewicz, S. Maćkowiak, S. Różek, T. Grajek, J. Szekiełda, D. Cywiński, "[VCM] Poznań University of Technology Proposal C in response to CfP on Video Coding for Machines," ISO/IEC JTC 1/SC 29/WG 4 m61520 , Oct. 2020.
[11]      Video Coding for Machines," ISO/IEC JTC 1/SC 29/WG 4 m61520, Oct. 2020.
[12]      X. Xu, S. Liu and Z. Li, "A Video Dataset for Learning-based Visual Data Compression and Analysis," 2021 International Conference on Visual Communications and Image Processing (VCIP), Munich, Germany, 2021.
[13]      M. Domański, O. Stankiewicz, S. Maćkowiak, J. Stankowski, S. Różek, M. Wawrzyniak, M. Lorkiewicz, T. Grajek, "Region-of-Interest-Based Video Coding for Machines," IEEE International Conference on Visual Communications and Image Processing (VCIP), 2023, pp. 1-6.
[14]      A. Balasubramaniam, F. Sunny and S. Pasricha, "R-TOSS: A Framework for Real-Time Object Detection using Semi-Structured Pruning," 2023 60th ACM/IEEE Design Automation Conference (DAC), San Francisco, CA, USA, 2023.
[15]      Y. Zhang, X. Wu, and L. Li, “A lightweight model of underwater object detection based on YOLOv8n for an edge computing platform,” Journal of Marine Science and Engineering, vol. 12, no. 5, p. 697, 2024.
[16]      P. Wang and J. Li, “Evaluation of Modern Interpolation and Resampling Filters for Image Scaling,” Journal of Mathematical Imaging and Vision, 2021.
[17]      P. Micikevicius, S. Narang, J. Alben, G. Diamos, E. Elsen, D. Garcia, B. Ginsburg, M. Houston, O. Kuchaiev, S. Venkatesh, and H. Wu, "Mixed precision training," International Conference on Learning Representations (ICLR), 2018.
[18]      T. Gale, E. Elsen, and S. Hooker, "The state of sparsity in deep neural networks," arXiv preprint arXiv:1902.09574, 2019.
[19]      M. Domański, O. Stankiewicz, S. Maćkowiak, S. Różek, T. Grajek, J. Szekiełda, and D. Cywiński, "[VCM] Poznań University of Technology Proposals A and B in response to CfP on Video Coding for Machines," ISO/IEC JTC 1/SC 29/WG 4, Document m61519 , Oct. 2020.
[20]      CfP on Video Coding for Machines," ISO/IEC JTC 1/SC 29/WG 4, Document m61519, Oct. 2020.
[21]      H. Yang, et al., “Scalable Video Coding for Human and Machine Vision,” IEEE Transactions on Multimedia, vol. 22, no. 10, pp. 2573–2585, 2020.
[22]      N. Carion, et al., “End-to-End Object Detection with Transformers,” The European Conference on Computer Vision (ECCV), 2020.
[23]      S. Ren, K. He, R. Girshick, and J. Sun, “Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks,” IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 39, no. 6, pp. 1137–1149, 2017.
[24]      ITU-T Rec. H.265 and ISO/IEC 23008-2 HEVC, “High Efficiency Video Coding,” 2013.
[25]      X. Xu, et al., “Efficient Video Analytics with Deep Learning on Edge Devices,” ACM Computing Surveys, vol. 53, no. 3, pp. 1–36, 2021.
[26]      ITU-T Rec. H.264 and ISO/IEC 14496-10 AVC, “Advanced Video Coding for Generic Audiovisual Services,” 2010.
[27]      K. Iida, T. Moriyoshi, and K. Chono, "[VCM] Improvement of luma enhancement process in decoder complexity," ISO/IEC JTC 1/SC 29/WG 4, m72188, Apr. 2025.
[28]      S. Raschka, "Noteworthy AI Research Papers of 2024 (Part Two)," Amyris Switzerland, Jan. 2025.
[29]      M. Jani, J. Fayyad, Y. Al-Younes, and H. Najjaran, "Model Compression Methods for YOLOv5: A Review," arXiv, Jul. 2023.
[30]      A. Chan, A. Gujarati, K. Pattabiraman, and S. Gopalakrishnan, “The fault in our data     stars: Studying mitigation techniques against faulty training data in machine learning applications,” 52nd Annu. IEEE/IFIP Int. Conf. Dependable Syst.  Netw. (DSN), Jun. 2022, pp. 163–171.
[31]      M. A. Santana, R. Calinescu, and C. Paterson, “Risk-aware real-time object detection,” 18th Eur. Dependable Comput. Conf. (EDCC), Sep. 2022, pp. 105–108.
[32]      W. Gao, X. Xu, M. Qin, and S. Liu, “An open dataset for video coding for machines    standardization,” IEEE Int. Conf. Image Process. (ICIP), Oct. 2022, pp. 4008 4012.