توضیحات
تشخیص خودکار ارقام دستنویس یکی از کاربردیترین مسائل بینایی ماشین است — از خواندن پلاک خودرو تا پردازش چکهای بانکی. این شبیهسازی، بر پایه یک مقاله علمی معتبر، یک شبکه عصبی کانولوشنی (CNN) را از صفر در متلب پیادهسازی میکند و به دقتی نزدیک به ۹۹٪ روی دیتاست استاندارد MNIST دست مییابد.
توضیحات
شبیهسازی تشخیص ارقام دستنویس با شبکه عصبی کانولوشنی (CNN) در متلب
عنوان اصلی مقاله:
Improved Handwritten Digit Recognition Using Convolutional Neural Networks (CNN)
این پروژه در نرمافزار MATLAB (نسخه 2025b) و با استفاده از Deep Learning Toolbox پیادهسازی و تست شده است. همراه محصول، یک گزارش فارسی ۳۰ صفحهای (فرمت Word) شامل مبانی نظری، شرح کامل کد، و تحلیل نتایج ارائه میشود.
ترجمه تخصصی چکیده
سامانههای سنتی تشخیص دستنویس همواره بر ویژگیهای دستیساز و حجم زیادی از دانش پیشین متکی بودهاند. آموزش یک سامانه تشخیص نویسه نوری بر پایه چنین پیشنیازهایی، کاری دشوار محسوب میشود. پژوهش در حوزه تشخیص دستنویس در سالهای اخیر حول محور فنون یادگیری عمیق متمرکز شده است. شبکههای عصبی کانولوشنی در درک ساختار نویسههای دستنویس بسیار مؤثر عمل میکنند و استخراج خودکار ویژگیهای ممیز را تسهیل میکنند. هدف این پژوهش، بررسی گزینههای طراحی گوناگون (تعداد لایهها، اندازه گام حرکت، میدان دریافتی، اندازه هسته، حاشیهگذاری و اتساع) برای تشخیص ارقام دستنویس مبتنی بر CNN، و ارزیابی چند الگوریتم بهینهسازی گرادیان کاهشی است. نویسندگان با یک معماری خالص CNN (بدون معماری ترکیبی) به دقت ۹۹.۸۹٪ روی دیتاست MNIST دست یافتهاند که رکوردی بهتر از روشهای ترکیبی پیشین، با پیچیدگی محاسباتی کمتر، محسوب میشود.
توضیحات شبیهسازی تشخیص ارقام دستنویس در MATLAB
در این شبیهسازی، دو خانواده معماری CNN مقاله (شبکه سهلایه و شبکه چهارلایه) بهطور کامل پیادهسازی و آموزش داده شدهاند. برای هر خانواده، تمام حالتهای طراحی گزارششده در مقاله (۶ حالت برای معماری سهلایه و ۵ حالت برای معماری چهارلایه، هرکدام با چند ترکیب مختلف تعداد فیلتر) بازسازی و روی دیتاست استاندارد MNIST تست شدهاند.
ویژگی متمایزکننده این پیادهسازی، ساخت یک حلقه آموزش سفارشی مبتنی بر dlnetwork و dlarray است که امکان پیادهسازی دقیق هر چهار الگوریتم بهینهسازی مقاله (از جمله Adagrad و Adadelta که در توابع استاندارد آموزش شبکه متلب پشتیبانی نمیشوند) را فراهم کرده است.
موضوعات مورد بررسی در پروژه
- طراحی و مقایسه معماریهای شبکه عصبی کانولوشنی سهلایه و چهارلایه
- تأثیر پارامترهای کانولوشن (اندازه هسته، گام حرکت، اتساع، حاشیهگذاری) بر دقت تشخیص
- مفهوم و محاسبه میدان دریافتی (Receptive Field) در شبکههای عمیق
- نرمالسازی دستهای (Batch Normalization) و مدیریت آمار در حال اجرا در حلقه آموزش سفارشی
- پیادهسازی و مقایسه چهار الگوریتم بهینهسازی: SGD با ممنتوم، Adagrad، Adadelta و Adam
- پیشپردازش و نرمالسازی دیتاست تصویری MNIST
- جاروب سیستماتیک هایپرپارامتر (نرخ یادگیری، تعداد Epoch) برای یافتن بهترین پیکربندی
- ارزیابی عملکرد با ماتریس درهمریختگی (Confusion Matrix)
مشخصات فنی پروژه
نرمافزار مورد استفاده:
MATLAB 2025b + Deep Learning Toolbox
بخشهای اصلی کد:
main.m— فایل اصلی و تنها فایلی که برای اجرای کامل پروژه لازم استdata/— دانلود خودکار و آمادهسازی دیتاست MNISTsrc/— توابع سازنده معماری شبکه و حلقه آموزش سفارشی چهار بهینهسازexperiments/— بازتولید جدولهای ۲، ۳ و ۴ مقاله و تولید نمودارهای خروجی
این شبیهسازی برای چه کسانی مناسب است؟
این پروژه برای پژوهشگران و علاقهمندان به حوزههای زیر کاربرد دارد:
- یادگیری عمیق و شبکههای عصبی کانولوشنی
- پردازش تصویر و بینایی ماشین
- تشخیص نویسه نوری (OCR) و کاربردهای مرتبط (تشخیص پلاک، پردازش اسناد)
- مقایسه الگوریتمهای بهینهسازی در یادگیری عمیق
فایلهای موجود در پروژه
پس از خرید، فایلهای زیر در اختیار شما قرار میگیرد:
- کد کامل و ماژولار MATLAB (فایل
main.m+ پوشههایsrc,data,experiments) - گزارش فنی فارسی (Word، ۳۰ صفحه)
- نمودارهای خروجی شبیهسازی (۶ نمودار، فرمت PNG)
نتایج قابل مشاهده
با اجرای پروژه میتوان نتایج زیر را استخراج و تحلیل نمود:
نتایج معماریها — بازتولید کامل جدول ۲، ۳ و شکل ۸ مقاله
- دقت هر ۳۶ حالت معماری سهلایه و ۲۵ حالت معماری چهارلایه مقاله
- بهترین معماری سهلایه (Case 3، ترکیب فیلتر 12-24-32): دقت ۹۸.۸۶٪
- بهترین معماری چهارلایه (Case 5، ترکیب فیلتر 12-24-28-32): دقت ۹۸.۸۶٪

✅ بازتولید شکل ۸(الف) مقاله: مقایسه دقت ۶ حالت معماری سهلایه

✅ بازتولید شکل ۸(ب) مقاله: مقایسه دقت ۵ حالت معماری چهارلایه
نتایج مقایسه بهینهسازها — بازتولید جدول ۴ مقاله
- مقایسه دقت چهار بهینهساز (SGD+Momentum، Adam، Adagrad، Adadelta) روی بهترین معماریهای سهلایه و چهارلایه
- دقت در بازه ۹۸.۶٪ تا ۹۹.۰٪ برای تمام بهینهسازها

✅ مقایسه دقت چهار بهینهساز روی دو معماری منتخب
نتایج نهایی مدل منتخب

✅ منحنی افت خطای آموزش (Training Loss) مدل نهایی

✅ ماتریس درهمریختگی روی ۱۰,۰۰۰ تصویر آزمایشی (دقت نهایی ۹۸.۹۰٪)

✅ نمونه پیشبینیهای مدل روی تصاویر آزمایشی واقعی
علاوه بر این، تمامی معماریها و بهینهسازها در محیط شبیهسازی بهصورت پارامتریک قابل تغییر بوده و کاربر میتواند با تنظیم مجدد پارامترها، آزمایشهای تکمیلی مورد نیاز خود را انجام دهد.
پرسشهای متداول
این پروژه با کدام نسخه متلب تست شده؟
کد در MATLAB 2025b بهطور کامل تست شده است. مقاله اصلی آزمایشهای خود را در نسخه 2018b انجام داده؛ کد این محصول با نسخههای جدیدتر متلب (که Deep Learning Toolbox دارند) نیز باید سازگار باشد.
چه Toolboxهایی لازم است؟
فقط Deep Learning Toolbox. دیتاست MNIST توسط خود کد بهصورت خودکار دانلود میشود.
آیا نتایج دقیقاً با مقاله یکسان است؟
دقت نهایی این پیادهسازی (حدود ۹۸.۹٪) با دقت گزارششده در مقاله (۹۹.۸۹٪) تطابق بسیار بالایی دارد. اختلاف حدود یک درصد، به دلیل ابهامی در مستندسازی جزئیات لایه Pooling در خود مقاله است که در گزارش فنی بهطور کامل توضیح داده شده.
کد را از کجا شروع کنم؟
فقط کافی است فایل main.m را اجرا کنید؛ این فایل تمام مراحل (دانلود دیتاست، بازتولید جدولها، تولید نمودارها) را بهترتیب انجام میدهد.
آیا گزارش فارسی همراه محصول است؟
بله، یک گزارش فنی ۳۰ صفحهای (Word) شامل مبانی نظری، شرح کد و تحلیل کامل نتایج ارائه میشود.
مزایای پروژه
- کد کاملاً اورجینال و نوشتهشده از صفر بر اساس معادلات مقاله (بدون استفاده از کد دمو یا نمونههای آماده)
- بازتولید کامل و مستند هر سه جدول اصلی مقاله (جدول ۲، ۳ و ۴)
- پیادهسازی سفارشی چهار الگوریتم بهینهسازی، از جمله دو الگوریتمی که در ابزارهای استاندارد متلب پشتیبانی نمیشوند
- ساختار ماژولار و تکنقطهورودی (اجرا فقط با یک فایل
main.m) - گزارش فنی فارسی کامل و مستند (۳۰ صفحه)
نکات مهم
دقت نهایی این پیادهسازی (حدود ۹۸.۹٪) در مقایسه با دقت گزارششده در مقاله (۹۹.۸۹٪) حدود یک واحد درصد پایینتر است. دلیل این اختلاف، ابهامی در خودِ مقاله است: جدولهای ۲ و ۳ مقاله فقط پارامترهای لایه کانولوشن را گزارش کردهاند و پیکربندی دقیق لایه Pooling را مشخص نکردهاند. همچنین برخی پارامترها (اندازه دسته آموزشی، ضریب فراموشی بهینهساز Adadelta) در مقاله ذکر نشده و با مقادیر استاندارد رایج جایگزین شدهاند. جزئیات کامل این تحلیل در گزارش فنی همراه محصول آمده است.
شاید به موارد زیر نیز علاقهمند باشید:
- طبقهبند تشخیص رقم تایپی (Pattern Recognition)
- تشخیص شماره شاسی خودرو با OCR و شبکه عصبی مصنوعی
- تشخیص پلاک خودرو
شبیهسازی تشخیص ارقام دستنویس با شبکه عصبی کانولوشنی (CNN) در متلب
طبق توضیحات فوق توسط کارشناسان سایت متلبی تهیه شده است و به تعداد محدودی قابل فروش میباشد.
سفارش انجام پروژه مشابه
درصورتیکه این محصول دقیقاً مطابق خواسته شما نمیباشد،
با کلیک بر روی کلید زیر پروژه دلخواه خود را سفارش دهید.







