فرهنگ سایبری

معرفی کتاب چگونه مثل یک ماشین ببینیم

در مطالعات کلاسیک تصویر معمولاً می‌پرسیم یک عکس چه چیزی را بازنمایی می‌کند، اما در دنیای «بینایی ماشین» بسیاری از تصاویر دیگر برای چشم انسان ساخته نمی‌شوند. پرسش مرکزی کتاب را می‌توان اینگونه بیان کرد: اگر بخش بزرگی از کار «دیدن» را به ماشین‌ها سپرده‌ایم، پس آنچه ماشین «دیدن» می‌نامد دقیقاً چیست و چه کسی آن را تعریف کرده است؟ شاید به همین دلیل نتوانیم این کتاب را صرفاً کتابی درباره «تصاویر تولید شده با هوش مصنوعی» بدانیم. آنچه در دل آن جریان دارد رابطه‌ای بنیادی‌تر میان انسان، تصویر و قدرت است.

به‌قلم:سید محمد یحیی هاشمی 

برای همه ما پیش آمده که عکسی را در اینترنت ببینیم و چند ثانیه بعد فراموشش کنیم: یک چهره ناشناس، یک خیابان، یک حیوان، یا تصویری عجیب که نمی‌دانیم اصلاً واقعی است یا نه! اما اگر همین عکس را جلوی یک سیستم هوش مصنوعی بگذاریم، ماجرا کاملاً فرق می‌کند. ماشین آن را به اشیا و چهره‌ها و الگوها تبدیل می‌کند، دسته بندی انجام می دهد و گاهی بر اساس همین دسته‌بندی تصمیم می ‌گیرد. ترِوِر پاگلن (Trevor Paglen)، هنرمند و جغرافیدان آمریکایی، در کتاب تازه‌اش How to See Like a Machine: Images After AI از همین تجربه شروع می‌کند تا نشان دهد مسئله فقط تصاویری نیست که هوش مصنوعی تولید می‌کند. آنچه در پس این ماجرا رخ می دهد بسیار عمیق تر است. نکته‌ای که این کتاب را از بسیاری از آثار مشابه متمایز می‌کند، جایگاه خود نویسنده است. پاگلن سال‌ها درباره نظارت، زیرساخت‌های نظامی و تصاویر ماهواره‌ای کار کرده و همین سابقه باعث شده نگاهش به هوش مصنوعی از دل مطالعات تصویر و قدرت بیاید، نه از دل یک نگاه مهندسی محور. این کتاب که در سال ۲۰۲۶ توسط انتشارات Verso منتشر شده را می توان تقاطع چندین حوزه مختلف مانند هنر، رسانه، فناوری و سیاست در نظر گرفت.

پرسشی که پاگلن دنبالش است این نیست که هوش مصنوعی چه تصویری می‌سازد یا چطور می‌شود جعلی را از واقعی تشخیص داد. او می‌پرسد ماشین اصلاً تصویر را چگونه می‌بیند؟ در مطالعات کلاسیک تصویر معمولاً می‌پرسیم یک عکس چه چیزی را بازنمایی می‌کند، اما در دنیای «بینایی ماشین» بسیاری از تصاویر دیگر برای چشم انسان ساخته نمی‌شوند. چهره‌ای که برای ما فقط یک چهره است، برای سیستم تشخیص چهره مجموعه‌ای از ویژگی‌های عددی است، و خودرویی که برای ما یک خودروست، برای سامانهٔ نظارتی یک پلاک است و یک مسیر و یک ردیف در پایگاه داده. به همین دلیل پاگلن پیشنهاد می‌کند به‌جای «تصویر چه معنایی دارد؟» بپرسیم «تصویر چه کاری انجام می‌دهد؟». این جابه‌جایی کوچک، در واقع ستون اصلی کتاب است.

این یک سیب است!

برای توضیح این چرخش، پاگلن به مفهوم قدیمی‌تری به نام Umwelt ارجاع می‌دهد که یاکوب فون اوکسکول (زیست‌شناس آلمانی) برای توصیف جهان ادراکی جانداران مطرح کرده بود: سگ و انسان و حشره در یک اتاق‌اند، اما هرکدام اتاق را طور دیگری تجربه می‌کنند. پاگلن همین منطق را به ماشین منتقل می‌کند، البته نه به این معنا که ماشین آگاهی دارد، بلکه به این معنا که دوربین، سنسور و الگوریتم تعیین می‌کنند چه چیزی برای ماشین دیدنی باشد و چه چیزی اساساً از دیدرس آن بیرون بماند. یکی از جذاب‌ترین مثال‌های کتاب هم به تابلوی «پسر انسان» اثر رنه ماگریت برمی‌گردد، همان مردی با کلاه که سیبی سبز جلوی صورتش را گرفته است. انسان می‌تواند ساعت‌ها درباره این تصویر حرف بزند (چرا صورت پنهان شده؟ سیب چه می‌گوید؟) اما اگر آن را به یک سیستم تشخیص تصویر بدهیم، جواب احتمالاً یک کلمه است: «سیب». ماشین، ابهام و طنز و استعاره را نمی‌بیند و فقط ویژگی‌هایی را می‌بیند که در داده‌های آموزشی با مفهوم «سیب» گره خورده‌اند. پاگلن به این وضعیت «واقع‌گرایی ماشینی» می‌گوید. ماشین برای تشخیص اشیا و چهره‌ها و حتی احساسات باید با حجم عظیمی از داده آموزش ببیند، اما این داده‌ها چیزی خنثی و طبیعی نیستند. کسی تصمیم گرفته چه تصویری وارد مجموعه شود، چه برچسبی بخورد و کدام تفاوت‌ها اهمیت داشته باشند. بنابراین مسئله دیگر فقط این نیست که الگوریتم گاهی اشتباه می‌کند. پرسش اصلی این است که چه کسی، با چه منطقی، جهان را از قبل به دسته‌ها تقسیم کرده است.

وقتی پشت تصویر هیچ واقعیتی نیست

بخش دیگر کتاب به هوش مصنوعی مولد می پردازد. در عکاسی، دست‌کم در تصور کلاسیک ما، تصویر از چیزی گرفته شده که واقعاً آنجا بوده است. تاریخ عکاسی البته پر از دستکاری و صحنه‌سازی است، اما هنوز یک فرض اولیه برقرار است: چیزی در جهان وجود داشته که عکس به آن اشاره می‌کند. تصاویر تولیدشده با هوش مصنوعی این فرض را از بین می‌برند. تصویری که کاملاً شبیه عکس است ممکن است هیچ دوربینی ثبتش نکرده باشد و هیچ‌وقت چنین صحنه‌ای در جهان بیرون وجود نداشته باشد. پس مسئله دیگر صرفاً «عکس جعلی» نیست؛ گاهی از ابتدا هیچ واقعیتی پشت تصویر نبوده است.

کتاب اینجا مسیر غیرمنتظره‌ای در پیش می‌گیرد و به تاریخ UFOها، عملیات روانی، سازمان‌های اطلاعاتی و حتی جادو می‌رسد. در نگاه اول شاید ربطی به بینایی ماشین نداشته باشد، اما منطقش این است که دستکاری ادراک چیز تازه‌ای نیست. تصویر مبهم یک جسم در آسمان به‌تنهایی معنایی ندارد؛ آنچه اثر می‌گذارد داستانی است که دورش ساخته می‌شود. پاگلن از همین‌جا به امروز برمی‌گردد و از چیزی حرف می‌زند که می‌شود «جامعه عملیات روانی» نامید: اینکه الگوریتم می‌فهمد به چه چیزی بیشتر نگاه می‌کنیم و روی چه چیزی مکث می‌کنیم و از همین برای انتخاب تصویر بعدی استفاده می‌کند.

چه کسی تصمیم می‌گیرد ماشین چه ببیند؟

می دانیم که سال‌هاست درباره حریم خصوصی، تشخیص چهره، دیپ‌فیک، نظارت، تبلیغات و تولید تصویر مصنوعی سخن گفته می‌شود. پاگلن همه این مباحث پراکنده را در یک چارچوب بزرگ‌تر کنار هم می‌گذارد و به یک پرسش برمی‌گرداند: چه کسی می‌بیند، چه چیزی دیده می‌شود، و این دیدن برای چه کاری به کار می‌رود؟ اهمیت این کتاب برای مخاطب حوزه سایبر هم دقیقاً در همین جابه‌جایی زاویه دید است، زیرا اساساً موضوع محدود به یک ابزار یا یک شرکت نیست. تصویر دیگر الزاماً برای چشم انسان تولید نمی‌شود. دوربینی که برای ما عکس می‌گیرد، برای الگوریتم داده تولید می‌کند؛ تصویری ممکن است هرگز به چشم انسان نرسد و مستقیم توسط ماشین تحلیل شود؛ و ماشینی هم ممکن است تصویری بسازد که ماشین دیگری آن را بخواند. در چنین زنجیره‌ای، انسان فقط یکی از حلقه‌هاست.

با این توصیف، پرسش مرکزی کتاب را می توان اینگونه بیان کرد: اگر بخش بزرگی از کار «دیدن» را به ماشین‌ها سپرده‌ایم، پس آنچه ماشین «دیدن» می‌نامد دقیقاً چیست و چه کسی آن را تعریف کرده است؟ شاید به همین دلیل نتوانیم این کتاب را صرفاً کتابی درباره «تصاویر تولید شده با هوش مصنوعی» بدانیم. آنچه در دل آن جریان دارد رابطه‌ای بنیادی‌تر میان انسان، تصویر و قدرت است.

نوشته های مشابه

دکمه بازگشت به بالا