نابودی میلیونها کتاب چاپی برای آموزش هوش مصنوعی؛ بهای پنهان رقابت بر سر دادههای باکیفیت
به گزارش خبرنگار «نبض فناوری»، با گسترش رقابت میان شرکتهای توسعهدهنده مدلهای هوش مصنوعی، دسترسی به منابع متنی باکیفیت به یکی از مهمترین چالشهای این صنعت تبدیل شده است. در همین راستا، برخی شرکتها اقدام به خرید گسترده کتابهای چاپی کرده و پس از جداسازی شیرازه و برش صفحات، آنها را با استفاده از اسکنرهای صنعتی پرسرعت به نسخههای دیجیتال تبدیل میکنند.
در این فرآیند، نسخه فیزیکی کتابها عملاً از بین میرود و فایلهای دیجیتال حاصل، برای آموزش مدلهای هوش مصنوعی مورد استفاده قرار میگیرد. گزارشها نشان میدهد شرکتهایی از جمله آنتروپیک از این روش برای ایجاد مجموعههای داده اختصاصی بهره گرفتهاند.
حامیان این رویکرد معتقدند کتابهای چاپی در مقایسه با بسیاری از محتوای موجود در اینترنت، از کیفیت و دقت بالاتری برخوردارند و میتوانند به بهبود عملکرد مدلهای هوش مصنوعی کمک کنند. از سوی دیگر، منتقدان هشدار میدهند که نابودی فیزیکی میلیونها جلد کتاب، بهویژه آثار کمیاب یا کمتیراژ، میتواند بخشی از میراث مکتوب را برای همیشه از دسترس خارج کند.
کارشناسان همچنین نسبت به ایجاد پایگاههای داده خصوصی هشدار میدهند؛ زیرا نسخههای دیجیتال تهیهشده معمولاً در اختیار عموم قرار نمیگیرد و صرفاً برای استفاده داخلی شرکتها نگهداری میشود. به اعتقاد آنان، این روند علاوه بر ایجاد انحصار در دسترسی به منابع ارزشمند، میتواند فرصت بهرهبرداری پژوهشگران و نسلهای آینده از این آثار را نیز محدود کند.
همزمان با افزایش نیاز صنعت هوش مصنوعی به دادههای آموزشی، انتظار میرود بحثهای حقوقی، اخلاقی و فرهنگی درباره شیوه تأمین این دادهها و ضرورت حفظ میراث مکتوب، بیش از گذشته مورد توجه قرار گیرد.