BNB $750.45 +1.69%
XRP $1.41 +1.38%
ETH $2,510.39 +1.38%
BTC $82,990.67 +0.83%
BNB $750.45 +1.69%
XRP $1.41 +1.38%
ETH $2,510.39 +1.38%
BTC $82,990.67 +0.83%
عاجل
دراسة من Coinbase تكشف عن فشل النماذج الجديدة للذكاء الاصطناعي في كشف الاحتيال في 16,140 معاملة قواعد جديدة لتصنيف المقايضات تجعل CFTC تستولي على سوق عقود بقيمة 1.5 مليار دولار انهيار بيتكوين بقيمة 19 مليار دولار يكشف عن 4500 مركز مرفوع المخاطر لا تزال قيد اللعب باين كابيتال كريبتو وسام ألتمان يدعمان جمع تمويل تأمين بيتكوين بقيمة $37.5 مليون بين كابيتال كريبتو تقود جولة تمويل بـ37.5 مليون دولار لتوسيع التأمين على الحياة بعملة بيتكوين انتقادات حادة من المدير التنفيذي السابق لـ FTX لمسلسل نتفليكس "المحسنون" لتصويره المضلل لقصة الحب دراسة من Coinbase تكشف عن فشل النماذج الجديدة للذكاء الاصطناعي في كشف الاحتيال في 16,140 معاملة قواعد جديدة لتصنيف المقايضات تجعل CFTC تستولي على سوق عقود بقيمة 1.5 مليار دولار انهيار بيتكوين بقيمة 19 مليار دولار يكشف عن 4500 مركز مرفوع المخاطر لا تزال قيد اللعب باين كابيتال كريبتو وسام ألتمان يدعمان جمع تمويل تأمين بيتكوين بقيمة $37.5 مليون بين كابيتال كريبتو تقود جولة تمويل بـ37.5 مليون دولار لتوسيع التأمين على الحياة بعملة بيتكوين انتقادات حادة من المدير التنفيذي السابق لـ FTX لمسلسل نتفليكس "المحسنون" لتصويره المضلل لقصة الحب
منصات التداول

دراسة من Coinbase تكشف عن فشل النماذج الجديدة للذكاء الاصطناعي في كشف الاحتيال في 16,140 معاملة

دراسة من Coinbase تكشف عن فشل النماذج الجديدة للذكاء الاصطناعي في كشف الاحتيال في 16,140 معاملة
دراسة من Coinbase تكشف عن فشل النماذج الجديدة للذكاء الاصطناعي في كشف الاحتيال في 16,140 معاملة

درجة ثقة المجتمعLikely Real

75%
حقيقي
Likely Real8 أصوات
آخر تحديث 5 دقائق مضت

قامت Coinbase بتحليل الأرقام. وكانت النتائج غير متوقعة بالنسبة للصناعة.

اختبرت منصة التداول إصدارات أحدث من ثلاث عائلات رئيسية من نماذج الذكاء الاصطناعي مقابل مجموعة بيانات تاريخية من خدمة الدفع Onramp الخاصة بها — 16,140 معاملة، 7,293 مستخدمًا، و813 معاملة احتيالية مؤكدة. نفس التوجيه الثابت. نفس سياسة تصنيف المخاطر طوال الوقت. المتغير الوحيد كان إصدار النموذج. وفي كل مقارنة، كان النموذج الأحدث يكتشف احتيالات أقل من النموذج الأقدم.

ليس أقل بشكل هامشي. بل أقل بشكل ملحوظ.

إعلان

الأرقام المرجعية يصعب تجاهلها

قامت Coinbase بمقارنة Opus 4.5 مع Opus 5، وSonnet 4.6 مع Sonnet 5، وGPT-5.4 مع GPT-5.6. أظهرت كل مقارنة انخفاضًا في الاستدعاء، وانخفاضًا في درجة F1، وانخفاضًا في الاستدعاء المرجح بالدولار عند تشغيل الإصدار الأحدث. Sonnet تلقى الضربة الأكبر — حيث انخفض الاستدعاء بنسبة 22.2 نقطة مئوية، وانخفض الاستدعاء المرجح بالدولار بنسبة 22.9 نقطة. هذا ليس خطأً في التقريب. إنه تراجع كبير في قدرة النموذج على اكتشاف الأموال الاحتيالية التي تمر عبر النظام.

كان أداء Opus أفضل. انخفض استدعاؤه بمقدار 0.8 نقطة فقط، وهو ما قد يكون قريبًا من الضوضاء. لكن نتيجة GPT كانت الأكثر إثارة للاهتمام، وبصراحة، الأكثر تضليلاً على السطح. ارتفعت الدقة بالفعل — 11.5 نقطة أعلى مع GPT-5.6 مقارنة بـ GPT-5.4. يبدو وكأنه تحسين. لكن الاستدعاء انخفض بمقدار 20.7 نقطة، وانخفض الاستدعاء المرجح بالدولار بمقدار 21.8 نقطة. لذا أصبح النموذج الأحدث أفضل في تحديد الاحتيال الذي اكتشفه، لكنه حدد حالات احتيال أقل بكثير بشكل عام. أكثر ثقة. أقل شمولية. هذه صفقة سيئة في فحص المدفوعات.

الفجوة بين الدقة والاستدعاء مهمة للغاية في اكتشاف الاحتيال. النموذج الذي يكون دقيقًا جدًا ولكنه يفوت معظم حالات الاحتيال يكون عديم الفائدة في بيئة الأموال الحقيقية. جعل اختبار Coinbase هذا التوتر ملموسًا.

النموذج المخصص الذي تفوق على الجميع

هنا يصبح الأمر مثيرًا للاهتمام. قامت Coinbase أيضًا باختبار نموذج Qwen3.5-9B المخصص، والذي تم تدريبه خصيصًا باستخدام نتائج الاحتيال التاريخية. تفوق على Opus 4.5 — الذي كان قد تفوق بالفعل على Opus 5 الأحدث — في عدة مقاييس رئيسية. تحسنت درجة F1 بمقدار 9.6 نقطة مقارنة بـ Opus 4.5. وتحسن الاستدعاء المرجح بالدولار بمقدار 35.4 نقطة. ولم يكن الأمر مجرد جودة الاكتشاف. قلل نموذج Qwen المخصص من زمن التأخير المتوسط للطلبات من البداية إلى النهاية بنسبة 55% مقارنة بـ Opus 4.5. أسرع وأكثر دقة. هذا المزيج مهم جدًا عند فحص المدفوعات في الوقت الفعلي.

تم تدريب النموذج على بيانات الاحتيال التاريخية الخاصة بـ Coinbase، مع توازن متعمد بين الأمثلة الاحتيالية والشرعية. هذا التخصيص ربما يفسر معظم فجوة الأداء. النموذج العام المدرب على بيانات الإنترنت الواسعة ليس محسنًا لأنماط الاحتيال في مدفوعات العملات الرقمية. النموذج المتخصص المدرب على نتائج الاحتيال الفعلية من منصة محددة هو أداة مختلفة تمامًا.

ومع ذلك، لا يزال الافتراض الافتراضي للصناعة هو “النموذج الأحدث = النموذج الأفضل”. بيانات Coinbase تدفع بقوة ضد ذلك.

بشكل منفصل، سبق أن اختبرت Coinbase إضافة مراجعة LLM انتقائية فوق النماذج الحالية — دون استبدالها، فقط إضافة مراجعة إضافية لحالات معينة. قلل ذلك التجربة من المعاملات الاحتيالية بنسبة 30% وقلل من قيمة الاحتيال بنسبة 22%. لم تقيم الإعادة الحديثة ما إذا كانت إصدارات النماذج الأحدث ستنتج مكاسب مشابهة، لذا لا يمكن إجراء تلك المقارنة مباشرة. فجوة في البيانات. غير واضح ما الذي ستفعله الإصدارات الأحدث في هذا الإعداد الطبقي.

ما الذي يجب على مقدمي خدمات الدفع أخذه من هذا

توصية Coinbase واضحة جدًا: اختبر المرشحين في إعداد القرار المحدد الخاص بك قبل نشرهم. قيم زمن التأخير، والموثوقية، والتكلفة بجانب جودة الاكتشاف. لا تفترض أن التحديث يعني تحسين فحص الاحتيال. قم بإعادة التشغيل. تحقق من أرقام الاستدعاء. تحقق من الاستدعاء المرجح بالدولار، وليس فقط رقم الدقة الرئيسي.

هناك قيد حقيقي هنا يستحق الذكر. مجموعة بيانات Coinbase مملوكة، لذا لا يمكن للباحثين في SR-Fraud تكرار النتائج بشكل مستقل. هذا قيد على مدى تعميم هذه النتائج بشكل واسع. منصات مختلفة، أنماط احتيال مختلفة، قواعد مستخدمين مختلفة — الأرقام قد تبدو مختلفة جدًا في مكان آخر. لا يمكن لـ Coinbase أن تعرف ذلك حقًا، ولا يمكن لأي شخص من الخارج.

ما لم يلتقطه الاختبار أيضًا: خسائر العملاء من نشر النماذج الأحدث فعليًا. كانت الإعادة تاريخية. يمكن أن تخبرك بعدد تلك المعاملات الاحتيالية الـ 813 التي كان يمكن للنموذج أن يكتشفها. لا يمكن أن تخبرك بما يحدث للمستخدمين الحقيقيين عندما يمر تراجع مثل انخفاض استدعاء Sonnet بنسبة 22.2 نقطة دون اكتشاف قبل النشر.

هذا هو الجزء الذي ربما يبقي فريق الاحتيال مستيقظًا في الليل. تحسين الاستدعاء المرجح بالدولار لنموذج Qwen3.5-9B بمقدار 35.4 نقطة عن Opus 4.5.

الأسئلة الشائعة

ما الذي وجدته اختبار اكتشاف الاحتيال في الذكاء الاصطناعي لـ Coinbase بالفعل؟

وجدت Coinbase أن الإصدارات الأحدث من نماذج Opus وSonnet وGPT جميعها اكتشفت معاملات احتيالية أقل من سابقاتها عند اختبارها مقابل 16,140 معاملة تاريخية، بما في ذلك 813 حالة احتيال مؤكدة، باستخدام نفس سياسة القرار الثابتة.

كيف قارن نموذج Qwen3.5-9B المخصص بالنماذج الأخرى التي تم اختبارها؟

تفوق نموذج Qwen3.5-9B المخصص على Opus 4.5 بتحسين قدره 9.6 نقطة في درجة F1 وتحسين قدره 35.4 نقطة في الاستدعاء المرجح بالدولار، بينما قلل أيضًا من زمن التأخير المتوسط للطلبات من البداية إلى النهاية بنسبة 55%.

مؤشر ثقة المجتمعModerate Confidence
75%
حقيقي
حقيقي75%25%مزيف
8 إشارة من المجتمع

Evie Vavasseur

إيفي فافاسور هو كاتب متخصص في مجال العملات الرقمية ومحتوى رقمي يغطي أحدث التطورات في تكنولوجيا البلوكشين والتمويل اللامركزي والنظام البيئي الأوسع للأصول الرقمية. يتمتع إيفي بقدرة على رصد التوجهات الناشئة، ويقدم تغطية ميسرة وعميقة لأسواق العملات الرقمية، والرموز غير القابلة للاستبدال (NFTs)، وابتكارات الويب 3 لصالح صحيفة The Currency Analytics.

إعلان

قصص ذات صلة