ציון בהבעה: 60% אנושי
- לפני 4 ימים
- זמן קריאה 3 דקות

מאת: פרופ ליאור זלמנסון
באדיבות הקתדרה במוז״א ופרופ׳ ליאור זלמנסון, במסגרת הסדרה ״בינה בזמן אמת-עונה חדשה!״ - חדשות ועדכונים שוטפים על עולמות הבינה המלאכותית
16.08.2026

מחקר חדש ביקש לבדוק מה הבינה המלאכותית מעוללת לשוק הספרים כבר בהווה. החוקרים אספו את הטקסט המלא של 14,419 ספרי ז'אנר שפורסמו, רובם בהוצאה עצמית, באמזון בין השנים 2023 ועד 2026, והצליבו אותם עם נתוני המכירות.
הממצא המרכזי מראה כי בינה מלאכותית אינה כותבת ספרים מוצלחים יותר. למעשה, ספרים שסומנו ככאלה הכוללים כמות משמעותית של טקסט שנוצר או עובד בידי מודלי שפה, נמכרו פחות בממוצע. ואולם, הם מציפים את השוק בכמויות עצומות. בתקופה שנבדקה, מספר הספרים שנמכרו בעותק אחד לפחות גדל פי 19.2, בשעה שההכנסות גדלו רק פי 8.9. המשמעות היא שהרבה יותר ספרים מתחרים על אותה עוגה. כאשר ניתן לייצר ספר נוסף כמעט ללא עלות, גם תוכן בינוני מסוגל לשנות את פני השוק פשוט בזכות המסה.
כדי להוכיח זאת, יש לפתור תחילה שאלה קשה בהרבה: כיצד בכלל ניתן לדעת איזה ספר נכתב באמצעות בינה מלאכותית?
כאן נכנס לתמונה הספר Daggermouth מאת H. M. Wolfe. הרומן החל את דרכו כספר בהוצאה עצמית, הפך ללהיט, נמכר להוצאה גדולה בעסקה של שבע ספרות, והשבוע כבש את המקום הראשון ברשימת ספרי העלילה בכריכה קשה של .Publishers Weekly עם זאת, הוא היווה את אחד המקרים החריגים במחקר: מערכת הזיהוי Pangram סיווגה חלק ניכר מהטקסט שלו ככזה שנראה כי נוצר או נערך באמצעות כלי בינה מלאכותית.
אך כיצד באמת מזהים מעורבות של מכונה? גלאים מהווים את השכבה הראשונה והחלשה יחסית. כלים אלו אינם מחפשים חותמת דיגיטלית או קוד סמוי בין המילים, כיוון שמחוללי שפה אינם משאירים עקבות כאלה. פעולתם מתמקדת בניתוח סטטיסטי: הם מודדים עד כמה בחירת המילים צפויה ועד כמה המקצב ואורך המשפטים אחידים, בהשוואה לכתיבה אנושית המתאפיינת בקפיצות ובגיוון.
מסיבה זו, החוקרים לא הסתפקו בציון מספרי יבש של תוכנה וחיפשו ראיות נוספות כדי לגבש תיק מקיף. הם הוסיפו בדיקות סטיילומטריה המשוות את ההרגלים הלשוניים בספר לכתיבתו הקודמת של המחבר, ואיתרו רצפי מילים נדירים המופיעים גם בספרים חשודים אחרים – בדיוק אותן חפיפות בלתי שגרתיות שנמצאו בספר Daggermouth.
על אף מאמצים אלו, הראיות החזקות ביותר מצויות דווקא מחוץ לספר המוגמר: טיוטות, הערות, קבצים נושאי חותמות זמן או קובצי תיעוד שבהם המודל ייצר את הטקסט עצמו. גם כאן אין ודאות מוחלטת. אפשר להתחיל מטיוטה של מודל שפה ולערוך אותה במשך חודשים ארוכים. מנגד, סופר שלא שמר טיוטות עלול להתקשות להוכיח שכתב הכל בעצמו. הימצאות של קובץ תיעוד עשויה להוכיח שימוש, אך היעדרו כמעט לעולם אינו שולל זאת.
Wolfe
מצדה מכחישה מכול וכול שהשתמשה בבינה מלאכותית לכתיבת הספר, וההוצאה לאור עומדת מאחוריה. כאן טמונה הבחנה קריטית: כלי שאינו מושלם עשוי להיות שימושי מאוד לזיהוי מגמה כללית בקרב 14 אלף ספרים, ועדיין לשמש בסיס רעוע למדי לקביעה שסופרת ספציפית רימתה. מחקר סטטיסטי רחב מסוגל להכיל טעויות מסוימות, תכונה שאינה קיימת כלל כשמדובר בהאשמה אישית פומבית
והנה הדבר המשונה באמת: כל שיטות הזיהוי הללו מניחות כי כתיבה אנושית וכתיבה של מכונה הן שתי קטגוריות נפרדות. ייתכן, עם זאת, שהן כבר מתחילות להתערבב זו בזו.
מדי יום אנו קוראים טקסטים שמכונות כתבו, משוחחים עמן ולומדים מהן, גם מבלי להעתיק דבר. חישבו על ילד שיגדל כאשר חלק ניכר מהטקסט האינטראקטיבי בחייו יורכב משאלות ותשובות מול צ'טבוט. שפת המכונה תהפוך לחלק בלתי נפרד מהסביבה הלשונית המעצבת את שפתו שלו.
במילים אחרות צריך לזכור: אנו מלמדים מכונות לזהות מי נשמע כמו מכונה, בדיוק ברגע שבו המכונות מתחילות לשנות את האופן שבו בני אדם נשמעים ובמובן הזה, זו משימה שעלולה להשאיר חוקרים רבים ללא מילים.


תגובות