معرفی کتاب چگونه مثل یک ماشین ببینیم
در مطالعات کلاسیک تصویر معمولاً میپرسیم یک عکس چه چیزی را بازنمایی میکند، اما در دنیای «بینایی ماشین» بسیاری از تصاویر دیگر برای چشم انسان ساخته نمیشوند. پرسش مرکزی کتاب را میتوان اینگونه بیان کرد: اگر بخش بزرگی از کار «دیدن» را به ماشینها سپردهایم، پس آنچه ماشین «دیدن» مینامد دقیقاً چیست و چه کسی آن را تعریف کرده است؟ شاید به همین دلیل نتوانیم این کتاب را صرفاً کتابی درباره «تصاویر تولید شده با هوش مصنوعی» بدانیم. آنچه در دل آن جریان دارد رابطهای بنیادیتر میان انسان، تصویر و قدرت است.
بهقلم:سید محمد یحیی هاشمی
برای همه ما پیش آمده که عکسی را در اینترنت ببینیم و چند ثانیه بعد فراموشش کنیم: یک چهره ناشناس، یک خیابان، یک حیوان، یا تصویری عجیب که نمیدانیم اصلاً واقعی است یا نه! اما اگر همین عکس را جلوی یک سیستم هوش مصنوعی بگذاریم، ماجرا کاملاً فرق میکند. ماشین آن را به اشیا و چهرهها و الگوها تبدیل میکند، دسته بندی انجام می دهد و گاهی بر اساس همین دستهبندی تصمیم می گیرد. ترِوِر پاگلن (Trevor Paglen)، هنرمند و جغرافیدان آمریکایی، در کتاب تازهاش How to See Like a Machine: Images After AI از همین تجربه شروع میکند تا نشان دهد مسئله فقط تصاویری نیست که هوش مصنوعی تولید میکند. آنچه در پس این ماجرا رخ می دهد بسیار عمیق تر است. نکتهای که این کتاب را از بسیاری از آثار مشابه متمایز میکند، جایگاه خود نویسنده است. پاگلن سالها درباره نظارت، زیرساختهای نظامی و تصاویر ماهوارهای کار کرده و همین سابقه باعث شده نگاهش به هوش مصنوعی از دل مطالعات تصویر و قدرت بیاید، نه از دل یک نگاه مهندسی محور. این کتاب که در سال ۲۰۲۶ توسط انتشارات Verso منتشر شده را می توان تقاطع چندین حوزه مختلف مانند هنر، رسانه، فناوری و سیاست در نظر گرفت.
پرسشی که پاگلن دنبالش است این نیست که هوش مصنوعی چه تصویری میسازد یا چطور میشود جعلی را از واقعی تشخیص داد. او میپرسد ماشین اصلاً تصویر را چگونه میبیند؟ در مطالعات کلاسیک تصویر معمولاً میپرسیم یک عکس چه چیزی را بازنمایی میکند، اما در دنیای «بینایی ماشین» بسیاری از تصاویر دیگر برای چشم انسان ساخته نمیشوند. چهرهای که برای ما فقط یک چهره است، برای سیستم تشخیص چهره مجموعهای از ویژگیهای عددی است، و خودرویی که برای ما یک خودروست، برای سامانهٔ نظارتی یک پلاک است و یک مسیر و یک ردیف در پایگاه داده. به همین دلیل پاگلن پیشنهاد میکند بهجای «تصویر چه معنایی دارد؟» بپرسیم «تصویر چه کاری انجام میدهد؟». این جابهجایی کوچک، در واقع ستون اصلی کتاب است.
این یک سیب است!
برای توضیح این چرخش، پاگلن به مفهوم قدیمیتری به نام Umwelt ارجاع میدهد که یاکوب فون اوکسکول (زیستشناس آلمانی) برای توصیف جهان ادراکی جانداران مطرح کرده بود: سگ و انسان و حشره در یک اتاقاند، اما هرکدام اتاق را طور دیگری تجربه میکنند. پاگلن همین منطق را به ماشین منتقل میکند، البته نه به این معنا که ماشین آگاهی دارد، بلکه به این معنا که دوربین، سنسور و الگوریتم تعیین میکنند چه چیزی برای ماشین دیدنی باشد و چه چیزی اساساً از دیدرس آن بیرون بماند. یکی از جذابترین مثالهای کتاب هم به تابلوی «پسر انسان» اثر رنه ماگریت برمیگردد، همان مردی با کلاه که سیبی سبز جلوی صورتش را گرفته است. انسان میتواند ساعتها درباره این تصویر حرف بزند (چرا صورت پنهان شده؟ سیب چه میگوید؟) اما اگر آن را به یک سیستم تشخیص تصویر بدهیم، جواب احتمالاً یک کلمه است: «سیب». ماشین، ابهام و طنز و استعاره را نمیبیند و فقط ویژگیهایی را میبیند که در دادههای آموزشی با مفهوم «سیب» گره خوردهاند. پاگلن به این وضعیت «واقعگرایی ماشینی» میگوید. ماشین برای تشخیص اشیا و چهرهها و حتی احساسات باید با حجم عظیمی از داده آموزش ببیند، اما این دادهها چیزی خنثی و طبیعی نیستند. کسی تصمیم گرفته چه تصویری وارد مجموعه شود، چه برچسبی بخورد و کدام تفاوتها اهمیت داشته باشند. بنابراین مسئله دیگر فقط این نیست که الگوریتم گاهی اشتباه میکند. پرسش اصلی این است که چه کسی، با چه منطقی، جهان را از قبل به دستهها تقسیم کرده است.
وقتی پشت تصویر هیچ واقعیتی نیست
بخش دیگر کتاب به هوش مصنوعی مولد می پردازد. در عکاسی، دستکم در تصور کلاسیک ما، تصویر از چیزی گرفته شده که واقعاً آنجا بوده است. تاریخ عکاسی البته پر از دستکاری و صحنهسازی است، اما هنوز یک فرض اولیه برقرار است: چیزی در جهان وجود داشته که عکس به آن اشاره میکند. تصاویر تولیدشده با هوش مصنوعی این فرض را از بین میبرند. تصویری که کاملاً شبیه عکس است ممکن است هیچ دوربینی ثبتش نکرده باشد و هیچوقت چنین صحنهای در جهان بیرون وجود نداشته باشد. پس مسئله دیگر صرفاً «عکس جعلی» نیست؛ گاهی از ابتدا هیچ واقعیتی پشت تصویر نبوده است.
کتاب اینجا مسیر غیرمنتظرهای در پیش میگیرد و به تاریخ UFOها، عملیات روانی، سازمانهای اطلاعاتی و حتی جادو میرسد. در نگاه اول شاید ربطی به بینایی ماشین نداشته باشد، اما منطقش این است که دستکاری ادراک چیز تازهای نیست. تصویر مبهم یک جسم در آسمان بهتنهایی معنایی ندارد؛ آنچه اثر میگذارد داستانی است که دورش ساخته میشود. پاگلن از همینجا به امروز برمیگردد و از چیزی حرف میزند که میشود «جامعه عملیات روانی» نامید: اینکه الگوریتم میفهمد به چه چیزی بیشتر نگاه میکنیم و روی چه چیزی مکث میکنیم و از همین برای انتخاب تصویر بعدی استفاده میکند.
چه کسی تصمیم میگیرد ماشین چه ببیند؟
می دانیم که سالهاست درباره حریم خصوصی، تشخیص چهره، دیپفیک، نظارت، تبلیغات و تولید تصویر مصنوعی سخن گفته میشود. پاگلن همه این مباحث پراکنده را در یک چارچوب بزرگتر کنار هم میگذارد و به یک پرسش برمیگرداند: چه کسی میبیند، چه چیزی دیده میشود، و این دیدن برای چه کاری به کار میرود؟ اهمیت این کتاب برای مخاطب حوزه سایبر هم دقیقاً در همین جابهجایی زاویه دید است، زیرا اساساً موضوع محدود به یک ابزار یا یک شرکت نیست. تصویر دیگر الزاماً برای چشم انسان تولید نمیشود. دوربینی که برای ما عکس میگیرد، برای الگوریتم داده تولید میکند؛ تصویری ممکن است هرگز به چشم انسان نرسد و مستقیم توسط ماشین تحلیل شود؛ و ماشینی هم ممکن است تصویری بسازد که ماشین دیگری آن را بخواند. در چنین زنجیرهای، انسان فقط یکی از حلقههاست.
با این توصیف، پرسش مرکزی کتاب را می توان اینگونه بیان کرد: اگر بخش بزرگی از کار «دیدن» را به ماشینها سپردهایم، پس آنچه ماشین «دیدن» مینامد دقیقاً چیست و چه کسی آن را تعریف کرده است؟ شاید به همین دلیل نتوانیم این کتاب را صرفاً کتابی درباره «تصاویر تولید شده با هوش مصنوعی» بدانیم. آنچه در دل آن جریان دارد رابطهای بنیادیتر میان انسان، تصویر و قدرت است.




