احجز عرضًا

حين يرسل العميل فيديو

بدا السماح للعملاء بأن يُظهروا العطل بدل أن يصفوه مجرد ترقية للنموذج. تبيّن أنه قرار معماري قيمته نحو ٤٬٨٠٠ دولار شهريًا — وأن الخاصية الأهم لم تكن الدقة ولا السعر، بل هل يعترف النموذج بما لا يستطيع قراءته.

كل من أدار دعمًا لأجهزة منزلية أو سيارات أو إلكترونيات يعرف هذه المحادثة. «هناك ضوء يومض». أي ضوء؟ «الذي على اليسار، قرب الأسفل». بأي لون؟ وبعد ثلاث رسائل يطلب أحدهم صورة، فتصل الصورة مهزوزة. يرسل العملاء مقاطع الفيديو إلى المحادثة منذ سنوات لأنها الخطوة البديهية، لكن الذكاء الاصطناعي على الطرف الآخر لم يكن قادرًا على مشاهدتها حتى وقت قريب.

هذا الأسبوع أطلقنا فهم الفيديو داخل المحادثة. يرسل العميل مقطعًا حتى دقيقة واحدة، فيشاهده النظام ويقرأ أي شاشة أو رمز خطأ ويسمع ما يُقال، ثم يجيب المساعد وهذه المعلومات بين يديه. استغرق البناء وقتًا أقل من قرار أين يجب أن تعيش هذه القدرة، وهذا القرار هو ما يستحق الكتابة.

طريقتان لمنح المحادثة عينين

الخيار الأول هو الأنيق. انقل المحادثة كلها إلى نموذج يستقبل الفيديو مباشرة. عندها يرى النموذج الذي يجيب اللقطات الفعلية إلى جانب تاريخ المحادثة والمعرفة المسترجَعة، ويستطيع العودة إليها حين يسأل العميل سؤالًا لاحقًا. من الناحية التقنية هو التصميم الأقوى.

الخيار الثاني أبسط. أبقِ المحادثة حيث هي تمامًا، وأضف قبلها خطوة مستقلة: نموذج متعدد الوسائط يشاهد الفيديو ويكتب وصفًا، ثم يُمرَّر هذا الوصف إلى النموذج الذي يجيب بوصفه سياقًا. النموذج الذي يدير المحادثة لا يرى إطارًا واحدًا.

قِسنا تكلفة كل خيار مقابل حركتنا الفعلية — نحو ١٫٣ مليون رسالة شهريًا — لا مقابل صفحة أسعار.

تكلفة الرسالة الواحدة مقارنةً بنموذج الإجابة الحالي
نموذج الإجابة الحالي1×
نموذج يستقبل الفيديو، اليوم5.4×
نموذج يستقبل الفيديو، من يناير10.7×

المدخلات مقيسة، مع احتساب التخزين المؤقت للتعليمات. القفزة في يناير سببها انتهاء سعر تمهيدي.

نقل كل المحادثات إلى النموذج الذي يستقبل الفيديو كان سيرفع فاتورة المحادثة من نحو ١٬١٠٠ دولار شهريًا إلى نحو ٥٬٩٠٠ — أي قرابة ٤٬٨٠٠ دولار إضافية اليوم، ونحو ١٠٬٧٠٠ بعد انتهاء السعر التمهيدي. أما ميزة الفيديو نفسها، عند عشرة آلاف مقطع مدته دقيقة شهريًا، فتكلّف نحو ٦٤ دولارًا. كنا سندفع خمسة وسبعين ضعف تكلفة الميزة لنغيّر المحرّك تحت كل محادثة لا تستخدمها أصلًا.

لذلك صار الفيديو مسارًا جانبيًا: معطّلًا افتراضيًا، يُفعَّل لكل مساعد على حدة، وتُحتسب تكلفته لكل عميل منفصلًا. ولم يتغيّر شيء في المحادثات التي لا يصلها فيديو. إنه القرار نفسه في جوهره: إبعاد العمل المكلف عن الرسائل التي لا تحتاجه، كما كتبنا في أين تذهب فاتورة الذكاء الاصطناعي فعليًا.

ثمن التصميم الأرخص

هذه المقايضة تستحق أن تُقال صراحة لأنها حقيقية. إذا كان النموذج الذي يجيب لا يرى إلا الوصف، فالوصف هو الفيديو بالنسبة إلى المحادثة. ما يُسقطه النموذج الواصف لم يوجد قط، وما يخطئ فيه لا يمكن التحقق منه لاحقًا، لأن لا شيء بعده رأى اللقطات. وسؤال لاحق مثل «ماذا يعني الضوء على اليمين؟» يُجاب من الوصف المخزّن ما لم يُرسل المقطع ليوصف من جديد — لذلك نحتفظ بالفيديو ونسمح بذلك تحديدًا.

وهذا يجعل خاصية واحدة في النموذج الواصف أهم من كل ما سواها، ولم تكن الخاصية التي توقعناها.

النموذج الذي اخترع رمز خطأ

اختبرنا النماذج المرشّحة للوصف على ستة مقاطع حقيقية لإصلاح أجهزة — غسالة، وموقد غاز، وحوض يسرّب، ولوحة إلكترونية، وشاشة فرن، ومرحاض — وطلبنا من كل نموذج تحديد الجهاز والعطل وأي نص مقروء.

النموذج الذي اخترناه قرأ شعارات الشركات المصنّعة، والتقط ساعة الفرن وهي تنتقل من ١١:٢٦ إلى ١١:٢٧. وفي أحد المقاطع قال بوضوح إن الشاشة مشوّشة إلى حد يمنع قراءتها. أما البديل الأرخص — المغري لأنه لا يتطلب أي عمل تكامل جديد — فنظر إلى الشاشة نفسها وأفاد برمز برنامج، ومؤقّت ستين دقيقة، وحرارة ستين درجة. لم يكن أيٌّ من ذلك موجودًا. ونموذج ثالث، صغير ومفتوح الأوزان، وصف المقاطع كأنها صور ثابتة: رأى أشياء، لا أحداثًا.

في تصميم يكون فيه الواصف هو الشاهد الوحيد، لا يصلح نموذج يخترع رموز الأخطاء بأي سعر. سيُقال للعميل بثقة كيف يصلح عطلًا لم يُبلغ عنه جهازه قط. وهذا أيضًا هو الشرط الذي يجعل تصميم المسار الجانبي آمنًا أصلًا: واصف أمين يغذّي نموذج محادثة قويًا أمر مقبول، والمسار نفسه مع واصف يملأ الفراغات بالتخمين غير مقبول.

شيء واحد فقط يحرّك الفاتورة

الملاحظة الثانية أنقذتنا من بناء شيء بلا فائدة. الغريزة الطبيعية مع الفيديو هي تصغيره قبل الإرسال — خفض الدقة وضغط الملف. اختبرنا ذلك مباشرة: المقطع نفسه بدقة ٣٦٠ و٧٢٠ و١٠٨٠ أنتج عدد التوكِن نفسه، وكذلك لقطات حقيقية بدقة 4K. أحجام الملفات من ١ إلى ٣٠ ميغابايت لم تُحدث فرقًا، ولا تسع صيغ حاويات مختلفة. ومسار الصوت لا يكلّف شيئًا إضافيًا؛ فهو محتسب أصلًا في سعر الثانية.

المدة هي الرافعة الوحيدة. النموذج يوحّد كل شيء داخليًا، فخطوة تصغير الفيديو كانت ستكلّف وقتًا هندسيًا وبنية تحتية وتخفض الفاتورة بمقدار صفر تمامًا — مع إضعاف الصورة مرتين، وهو آخر ما تريده حين يكون الهدف كله قراءة رقم صغير على شاشة صغيرة. ووضع التفاصيل العالية في النموذج نفسه لم يكن صفقة أفضل: أكثر من ثلاثة أضعاف التوكِن في الثانية، ولم يقرأ في الاختبار حرفًا واحدًا فاته الوضع العادي.

وتركنا رافعتين عمدًا دون استخدام. أخذ عدد أقل من الإطارات في الثانية يخفض توكِن الفيديو في مقطع مدته ثلاثون ثانية بأكثر من النصف، لكن عطلًا يظهر للحظة — ومضة واحدة من ضوء تحذير — قد يقع بين إطارين، ولم نتحقق من ذلك على لقطات حقيقية. كما أن الاستدلال الداخلي للنموذج لا يمكن إيقافه: كل إعداد جرّبناه أنتج ما بين ٣٠٠ و٥٥٠ توكِن استدلال في كل استدعاء، تُحتسب بسعر المخرجات. وتقديرنا للتكلفة يفترض حجم المخرجات ولا يقيسه، ونقول ذلك صراحة في الميزانية.

ما يمكن تعميمه

ثلاثة أمور تتجاوز الفيديو. حين تحتاج شريحة صغيرة من الحركة إلى قدرة ما، أضفها بجانب المسار الرئيسي بدل أن تنقل المسار الرئيسي كله للوصول إليها؛ وإلا وقعت الكلفة الإضافية على كل محادثة. وقبل أن تحسّن أي تكلفة، اكتشف بالتجربة أي مدخل يحرّكها فعلًا — فالرافعة البديهية كثيرًا ما يكون أثرها صفرًا. وحين يكون مكوّن ما هو الوحيد الذي يرى الدليل، فأهم خصائصه أمانته بشأن ما لم يستطع رؤيته. الدقة في الاختبارات المرجعية لا تقيس ذلك. أما وضع شاشة غير مقروءة أمامه فيقيسه.

شاهدها تعمل على حركتك أنت.

ثلاثون دقيقة مع مهندس تجربة عملاء. بلا شرائح عرض.