الأمر لا يتعلق بالمقاييس
عندما بدأت اختبار نماذج لغوية مختلفة، لم أكن أبحث عن أرقام المقاييس أو المقاييس النظرية. أردت أن أعرف كيف يبدو استخدامها فعليًا. كيف يكون تشغيل نموذج محليًا، ومدى سرعة استجابته، وما إذا كان يقدم نتائج متسقة ومفيدة دون الانجراف إلى الهلوسة.
يركّز هذا المقال على الاستخدام الواقعي. ما الذي نجح معي. ما الذي فشل. أين تقع الحدود. وكيف تصرّف كل نموذج عند إعطائه مهام مثل تلخيص النص، ومقارنة الأمثلة، أو الإجابة عن أسئلة متعددة الطبقات. هذا ليس تصنيفًا. إنها وجهة نظر شخصية وعملية مبنية على استخدام متكرر.
نماذج بقيت ضمن أدواتي
بعد الكثير من الأخذ والرد، انتهى بي الأمر إلى استخدام Ollama وOpenGPT وDeepSeek بانتظام. لقد قدمت هذه النماذج أكثر تجربة استقرارًا في اختباراتي اليومية. تميل إلى إبقاء خيط المحادثة مستمرًا بشكل أفضل من غيرها والحفاظ على الملاءمة في ردودها لمدة أطول.
هي ليست خالية من العيوب، لكنها تتعامل باستمرار مع المهام الأساسية ومتوسطة المستوى دون الحاجة إلى عمليات إعادة ضبط أو تصحيحات مستمرة. هذا وحده يجعلها قيّمة.
نظرة أقرب على BOLT
يستحق BOLT قسمه الخاص. أستخدمه غالبًا عبر LM Studio لأنه لم يندمج بسلاسة مع OpenWebUI بحسب تجربتي. لكن بمجرد أن يعمل ويصبح جاهزًا، فهو سريع. من بين الأسرع استجابة.
قدّم BOLT أداءً جيدًا في المهام التي تتضمن مخرجات منظمة. أشياء مثل تنسيق السجلات، وبنى JSON البسيطة، أو عينات YAML عملت بشكل جيد على نحو مفاجئ. الأداء موثوق عندما تشغّل مطالبات مركّزة.
ومع ذلك، فإن الإصدارات الأصغر من BOLT تعاني من المشكلات نفسها التي تعاني منها النماذج المدمجة الأخرى. فهي تهلوس وتفقد السياق عندما تصبح المطالبات أكثر تعقيدًا أو عندما تطول المحادثة.
نقطة الانهيار للنماذج الصغيرة
في كل مرة اختبرت فيها نماذج أصغر من 7 مليارات مُعامل، كانت النتيجة نفسها: بدء تشغيل سريع لكن قدرة محدودة جدًا. هذه النماذج الصغيرة تنسى السياق بسرعة، وتستجيب بنص مبهم أو عام، ويسهل إخراجها عن المسار. إنها مفيدة إذا كنت تريد فقط التجربة أو رؤية ما إذا كان الإعداد يعمل، لكنها لا ينبغي أن تكون موضع ثقة لأي شيء حرج.
إذا كانت المهمة تتطلب عمقًا أو ذاكرة، فأي شيء دون 7B ليس خيارًا حقيقيًا. وحتى عند 7B، لا تزال هناك تنازلات. لقد حصلت على اتساق أفضل عند استخدام نماذج 13B، خاصة عند طرح أسئلة متعددة الخطوات أو متعددة الطبقات.
كيف أختبر عمليًا
اختباري لا يتعلق بالمطالبات الاصطناعية. أستخدم النماذج في مهام فعلية: تلخيص المستندات، وتحليل الملاحظات، واختبار رسائل الأخطاء، وأحيانًا صياغة الردود أو المقارنات.
وأستخدم التكرار أيضًا. أعطي المهمة نفسها لعدة نماذج وأقارن المخرجات. يمنحني هذا النهج رؤية أوضح لأين يقصر نموذج ما أو يفاجئني. ومع مرور الوقت، يصبح واضحًا أيها يمكنك الاعتماد عليه وأيها يبدو جيدًا على الورق فقط.
الحجم مهم – لكن ليس دائمًا بالطريقة التي تتصورها
لقد عملت مع نماذج 7B و13B، وبينما نماذج 13B أكثر قدرة واتساقًا، فإنها تتطلب أيضًا المزيد من نظامك. تحتاج إلى ذاكرة حرة كافية لتحميلها وتشغيلها بشكل صحيح، وإلا ستتعطل أو تتباطأ.
إذا كانت عتادك محدودًا، يمكن جعل نماذج 7B تعمل. لكن عليك البقاء ضمن حدودها. لملخصات سريعة أو ردود لمرة واحدة، فهي جيدة. لكن بمجرد أن تطلب منها التفكير عبر خطوات متعددة، غالبًا ما تنهار.
خلاصتي بعد كل هذا الاختبار
اختبار النماذج المحلية لا يتعلق بالعثور على أذكى نموذج. بل يتعلق بالعثور على ما يعمل لحالة استخدامك ولنظامك. يهمني أقل مدى ذكاء صوت النموذج وأكثر ما إذا كان يستطيع إنهاء مهمة دون الحاجة إلى إعادة ضبط.
يمنحك Local AI أدوات للاختيار. يمكنك الاختبار، والحذف، والتبديل، وضبط الأشياء بطريقة لا تسمح بها خدمات السحابة. هذه هي القوة. لكنه يعني أيضًا أنك بحاجة إلى أن تكون واقعيًا.
ابدأ ببساطة. كن صبورًا. ودع حالات استخدامك الخاصة ترشدك. هكذا تعلمت أكثر شيء.
هذا لا يتعلق باستبدال ذكاء اصطناعي سحابي. بل يتعلق ببناء شيء يخصك، يعمل وفق شروطك، ويلائم احتياجاتك اليومية دون تنازل.