تلاش برای ساخت مجموعه دادههای آموزشی هوش مصنوعی»گرگوری کورتزر (Gregory Kurtzer)، بنیانگذار پروژه…
انتشار: 2026/08/14 15:40 UTCدریافت: 2026/08/18 02:23 UTCآخرین مشاهده: 2026/08/18 02:23 UTC
تلاش برای ساخت مجموعه دادههای آموزشی هوش مصنوعی»گرگوری کورتزر (Gregory Kurtzer)، بنیانگذار پروژههایی مانند CentOS، Rocky Linux، Warewulf و Apptainer، پروژه جدیدی به نام OpenWALDO را معرفی کرد.هدف OpenWALDO ساخت یک مجموعهداده آموزشی مشترک، متنباز، دارای مجوز، قابل ردیابی و قابل ممیزی که جامعه هوش مصنوعی بتواند روی آن مدلهای مختلف بسازد.🔹 چرا OpenWALDO مهم است؟امروز تقریباً هر شرکت یا آزمایشگاه هوش مصنوعی برای آموزش مدلهای خود باید بخش زیادی از دادههای آموزشی را از ابتدا جمعآوری و آماده کند.این یعنی:❌ کارهای تکراری❌ هزینه زیاد❌ مشخص نبودن منبع بسیاری از دادهها❌ ابهام در مجوز استفاده❌ دشواری بررسی دادههای آموزشی مدلهااما OpenWALDO میخواهد یک پایه مشترک و عمومی ایجاد کند تا این کارها بهصورت مشارکتی انجام شوند.🔍 مهمترین ویژگیها1️⃣ دادههای قابل ردیابیبرای دادهها مشخص میشود:منبع داده چیست؟چه مجوزی دارد؟چه کسی آن را اضافه کرده؟چه تغییراتی روی آن انجام شده؟در چه مجموعهدادهای قرار گرفته است؟2️⃣و AI BOMایده AI Bill of Materials یا AI BOM نیز در این پروژه اهمیت زیادی دارد.مشابه SBOM در دنیای نرمافزار، هدف این است که بتوان مشخص کرد یک مدل هوش مصنوعی از چه منابع و اجزایی ساخته شده است.یعنی بتوان مسیر زیر را دنبال کرد:Data → Dataset → Training → Model → Release3️⃣ مقابله با Model Collapseیکی از مشکلات آینده هوش مصنوعی، چیزی است که به آن Model Collapse گفته میشود.اگر مدلهای جدید مرتباً روی خروجی مدلهای قبلی آموزش ببینند، کیفیت و تنوع دادهها میتواند بهمرور کاهش پیدا کند.این OpenWALDO تلاش میکند با ایجاد دادههای دارای منبع مشخص و قابل تأیید، بخشی از این مشکل را از ریشه مدیریت کند.4️⃣ شفافیت در مجوزهایکی از پرسشهای مهم در آموزش مدلهای AI این است:آیا دادهای که برای آموزش استفاده شده، واقعاً اجازه استفاده داشته است؟بهخصوص برای:محتوای دارای Copyrightکدهای نرمافزاریدادههای منتشرشده با مجوزهای مختلفدادههای تولیدشده توسط مدلهای دیگراین OpenWALDO میخواهد اطلاعات مجوز و منشأ دادهها را همراه آنها نگه دارد.🌐 یک مدل جدید برای همکاریبهجای اینکه:هر شرکت → همه چیز را از صفر بسازدمدل پیشنهادی این است:Community → Shared Dataset → Multiple AI Modelsیک نفر دادهای اضافه میکند.فرد دیگری آن را بررسی میکند.یک محقق داده را بهبود میدهد.یک شرکت دادههای اختصاصی خودش را به آن اضافه میکند.و در نهایت، همه میتوانند روی این پایه مشترک، مدل و محصول خودشان را توسعه دهند.🐧 فلسفهای شبیه Open Sourceکورتزر معتقد است همان فلسفهای که متنباز را در دنیای نرمافزار موفق کرد، میتواند در AI نیز استفاده شود:قابل مشاهده → قابل بررسی → قابل اصلاح → قابل انشعاب → قابل اعتمادو شاید مهمترین تغییر این باشد:آینده رقابت AI فقط بر سر «بهترین مدل» نخواهد بود؛ بلکه بر سر بهترین داده، منشأ داده و قابلیت اعتماد آن نیز خواهد بود.

