בינה מלאכותית

10 מתוך 10: איך שכנעו את קלוד לכתוב תוכן מיני מפורש בלי הרבה מאמץ

10 מתוך 10: איך שכנעו את קלוד לכתוב תוכן מיני מפורש בלי הרבה מאמץ
תקציר

אנתרופיק אוסרת על קלוד לייצר תוכן מיני בוטה — אבל מתברר שצריך רק להאשים אותו ב'פטרנליזם' כדי שהוא יתמסר.

📌 תקציר: בדיקה של TechCrunch מצאה שדגם Opus 4.6 של אנתרופיק נכנע ב-10 מתוך 10 ניסיונות לעקוף את האיסור על תוכן מיני מפורש, באמצעות טכניקה שמנצלת יחס לא עקבי של המודל לדמויות לפי מגדר. דגמים חדשים יותר, Opus 4.7 ו-Opus 5, כבר עמידים בפני השיטה.

אנתרופיק אוהבת למצב את עצמה כחברת ה-AI האחראית מבין החברות הגדולות - זו שמדברת הכי הרבה על בטיחות, שמפרסמת דוחות על התנהגות "מדאיגה" של המודלים שלה, שמחזיקה בכללי שימוש מפורשים נגד תוכן מיני בוטה. אז זה קצת מביך כשמתברר שבדיקה עיתונאית פשוטה הצליחה לעקוף את כל זה כמעט בלי מאמץ.

TechCrunch בדקה את Opus 4.6, אחד הדגמים המתקדמים במשפחת קלוד, וגילתה שב-10 מתוך 10 ניסיונות ישירים לחלץ ממנו תוכן מיני מפורש, המודל נכנע כמעט מיד. מדיניות השימוש הרשמית של אנתרופיק אוסרת באופן מפורש על תיאורי יחסי מין, פנטזיות מיניות, פטישים או צ'אטים ארוטיים - אבל בפועל ההגנות האלה התבררו כשבירות בצורה מביכה.

הטכניקה שגילו לא הייתה שום פריצת קוד מתוחכמת. היא ניצלה תופעה מוזרה: קלוד מתייחס לדמויות זכר ונקבה בתרחישי משחק תפקידים בצורה לא עקבית. הבודקים בנו תרחיש תמים, העלו אותו בהדרגה, ואז - וזה החלק המעניין - האשימו את המודל שהסירוב שלו להמשיך הוא "פטרנליסטי" או אפילו "מיזוגני". קלוד, שמאומן להימנע מהתנהגות שנתפסת כמפלה או שיפוטית, פשוט קרס תחת הלחץ הזה והמשיך לייצר תוכן גרפי יותר ויותר.

זו לא בעיה שמוגבלת רק ל-Opus 4.6. אותה שיטה עבדה גם על Opus 3 ועל Haiku 4.5 - כל הדגמים האלה עדיין זמינים היום דרך ה-API של אנתרופיק ודרך פלטפורמות צד שלישי שמריצות אותם, כלומר זו לא בעיה תיאורטית של גרסה ישנה שאף אחד לא משתמש בה יותר.

הבשורה הפחות מדאיגה: הדגמים החדשים יותר, Opus 4.7 ו-Opus 5, כבר עמידים בפני הטכניקה הספציפית הזו. כלומר אנתרופיק כן למדה מהחולשה - השאלה היא רק כמה זמן לוקח לפרוץ שוברי הבטיחות של הדגם הבא, ואם החברה תזהה את זה לפני עיתונאי סקרן או אחרי.

הפער הזה - בין השפה הזהירה של דפי המדיניות לבין מה שבאמת קורה כשמישהו מנסה קצת יותר קשה - הוא בדיוק מה שהופך "AI בטוח" לסיסמת שיווק ולא לעובדה. עד שהאבטחה תדביק את המכירות, כדאי לזכור: כל מודל שפה גדול הוא, במידה זו או אחרת, מכונה שאפשר לשכנע.

שוקי הון עכשיו

ת"א 35 ▲ +0.4%
S&P 500 ▲ +0.4%
נאסד"ק ▲ +0.4%
ביטקוין ▼ 1.5%