تعتمد البنية التي تحمي سجل المحادثات لديك على ثلاث طبقات متحدة المركز: عزل الشبكة، أدوات التحكم في الوصول، والتشفير. تقوم خدمات الذكاء الاصطناعي الحديثة مثل ChatGPT من OpenAI وClaude من Anthropic وGemini من Google بتخزين سجلات المحادثات في مجموعات قاعدة بيانات تقع خلف شبكات خاصة افتراضية (VPCs)، التي تنشئ محيطات محددة برمجيًا حول البنية التحتية السحابية. تمنع هذه الـ VPCs الوصول المباشر للإنترنت إلى قواعد البيانات. تنتقل رسائلك مشفرة عبر TLS (أمن طبقة النقل) 1.3 من متصفحك إلى الموازنات التحميلية، ثم عبر خدمات داخلية مصدقة قبل أن تصل إلى قواعد بيانات مشفرة أثناء الاستراحة مثل PostgreSQL أو ما شابهها. ولا تلمس المفاتيح الخاصة خوادم التطبيق التي تُنشئ استجابات الذكاء الاصطناعي. لكن هنا يصبح الأمر مثيرًا: لقد تم اختراق كل طبقة من هذه الطبقات من قبل، لكن ليس في هذا التكوين بالضبط. في عام 2023، أظهر الباحثون في Trail of Bits أن نقاط الضعف في تلف الذاكرة في لغة Rust (المُعتبرة "آمنة") لا تزال تُسرِّب بيانات حساسة تحت ظروف محددة. في أوائل 2024، أظهر الباحث Kevin Beaumont كيف أن سياسات دَلِيَات AWS S3 غير المُعدَّلة بشكل صحيح قد كشفت سجلات الدردشة من شركة ناشئة صغيرة في مجال الذكاء الاصطناعي. توجد مساحة للهجوم في طبقة التنسيق، حيث تتواصل الخدمات المصغرة. إذا كنت أرغب في استخراج سجلات الدردشة للحصول على ذلك الجائزة المليونية، فسأركز على شبكة الخدمة الداخلية، خاصةً رموز التوثيق التي تستخدمها الخدمات للتحدث مع بعضها البعض. ها هي خارطة الطريق للهجوم:

  1. الوصول الأولي عبر اختراق سلسلة الإمداد: استهداف مكتبة مراقبة واسعة الاستخدام يثق بها فريق البنية التحتية في شركة الذكاء الاصطناعي. تستخدم العديد من شركات الذكاء الاصطناعي أدوات مراقبة مثل DataDog أو Sentry أو New Relic. قد يقوم حزمة npm خبيثة أو قالب Python باسم شرعي صوتيًا ("asyncio-performance-patch") بحقن رمز يعيد الاتصال بالمنزل مع متغيرات البيئة، بما في ذلك بيانات اعتماد دور AWS IAM أو رموز خدمة Kubernetes.
  1. التحرك الجانبي عبر شبكة الخدمة: بمجرد الدخول إلى الـ VPC ببيانات اعتماد صالحة، استغلال حقيقة أن الخدمات الداخلية غالبًا ما تثق ببعضها البعض أكثر مما ينبغي. يستخدم كل من Anthropic وOpenAI وGoogle Kubernetes للتنسيق. إذا قمت بإختراق بود منخفض الامتياز (ربما بود يقوم بتشغيل وظائف مجدولة لتنظيف خطوط البيانات)، يمكنني استعلام خادم API لـ Kubernetes عن الأسرار المدمجة كمتغيرات بيئة في البودات ذات الامتيازات العالية. غالبًا ما تكون سلاسل الاتصال بقاعدة البيانات موجودة هناك.
  1. تصعيد الامتياز عبر الإحالة المباشرة غير الآمنة للكيانات (IDOR): تقوم منصات الذكاء الاصطناعي الحديثة بتعيين كل محادثة بمعرف فريد. ربما تحتوي قواعد البيانات على أدوات تحكم في الوصول قائمة على الأدوار، لكن نقاط النهاية API التي تخدم سجل الدردشة للمستخدمين غالبًا ما تحتوي على أخطاء منطقية. عن طريق اختبار معلمات user_id في استدعاءات API الداخلية، يمكن للمهاجم التنقل عبر معرفات المحادثة، مما يسحب الدردشات التي لا تنتمي إليهم. ظهرت هذه الثغرة بالضبط في تقرير جائزة الثغرات 2022 لمنصة SaaS رئيسية.
  1. إستخراج البيانات دون إثارة الإنذارات: الجزء الصعب ليس الحصول على البيانات، بل الحصول عليها للخارج. نقل جيجابيات من سجلات الدردشة سيضيء كل لوحة تحكم مركز عمليات الأمان (SOC). الحيلة: الاستخراج عبر نفق DNS أو تضمين البيانات في استدعاءات API الصادرة إلى الخدمات الشرعية. تقوم شركات الذكاء الاصطناعي بآلاف استدعاءات API في الثانية إلى معالجات الدفع، ومنصات التحليلات، ومقدمي الخدمات السحابية، وفي حالة المهاجم الذكي يقوم بتغليف البيانات المسروقة كـ JSON مشفر بقاعدة 64 في طلب POST إلى نقطة النهاية المخترقة لـ Stripe، مما يجعلها تبدو كحركة معالجة دفع روتينية.
  1. الحفاظ على الوصول عبر نماذج التعليمات المربوطة: للوصول طويل الأمد، يمكن للمهاجم حقن باب خلفي في نفس النموذج الذكائي. أظهرت بحوث من ETH Zurich في 2023 أن التدريب العدائي يمكنه تضمين سلوكيات مخفية في الشبكات العصبية. قد يقوم نموذج مربوط بتسريب مقتطفات محادثة عبر تعديل استجاباته لتشفير البيانات عند ظهور عبارة محددة. سيبقى هذا بعد إعادة بناء البنية التحتية ونشر الأكواد.

تشمل الإجراءات المضادة المتاحة الآن أدوات حماية التطبيقات الذاتية وقت التشغيل (RASP) التي تراقب الاستعلامات غير الطبيعية على قواعد البيانات، وتقسيم الشبكة الذي يعزل قواعد البيانات الإنتاجية عن بيئات التطوير، وأنظمة تسجيل المراجعة التي تتبع كل عملية قراءة لقاعدة بيانات. ويقال إن شركات مثل OpenAI تستخدم أبحاث التشفير المتجانس لاستكشاف الحوسبة على البيانات المشفرة، رغم أن ذلك لا يزال في الغالب نظريًا للأنظمة الإنتاجية. الدفاع الحقيقي هو الدفاع المتعمق: جعل المهاجم يحترق العديد من الثغرات لاستغلال الوصول إلى البيانات، مما يرفع التكلفة بما يتجاوز ما ستدف عه معظم الجهات المغرضة. لكن الحلقة الأضعف ما زالت البشرية: يمكن لمهندس الاعتمادية في الموقع (SRE) المضطرب الذي يمتلك وصول إلى قاعدة بيانات الإنتاج تصدير سجلات الدردشة إلى دلو S3 الشخصي في أقل من خمس دقائق. لهذا السبب تنفذ الشركات فصل الواجبات، وتتطلب الموافقات المتعددة للعمليات الحساسة، وتدور بيانات الاعتماد بقوة. يمثل التهديد الداخلي أسرع طريق للاستخراج، متجاوزًا كل التحكمات التقنية. يمكن لفِرق الأمن مراقبة الصادرات الضخمة، لكن المطلع الذكي يمكنه استخراج البيانات ببطء، بضع آلاف من المحادثات في اليوم، محاكيا استفسارات التحليل الشرعي المشروعة.