معجم الذكاء الاصطناعي
5,046 مصطلحًا مُفسَّرًا بالعربي في الذكاء الاصطناعي
عرض 1-40 من 351 نتيجة — صفحة 1 / 9
التقييم والشرح (40)
مقاييس التقييم
Evaluation Metrics
معايير قياس أداء النموذج.
الدقة
Accuracy
نسبة التنبؤات الصحيحة من الإجمالي.
الاستدعاء
Recall
نسبة العينات الإيجابية المكتشفة.
مصفوفة الالتباس
Confusion Matrix
جدول يوضح التنبؤات الصحيحة وغير الصحيحة.
منحنى ROC
ROC Curve
رسم بياني للإيجابيات الصحيحة والخاطئة.
المساحة تحت المنحنى
AUC-ROC
المساحة تحت منحنى ROC لقياس التمييز.
التحقق المتقاطع
Cross Validation
تقنية بتقسيم البيانات إلى أقسام متعددة.
الانحياز
Bias
نظام تحيزي يؤدي إلى نتائج غير عادلة.
التباين
Variance
مدى حساسية النموذج لتغيرات البيانات.
معدل الخطأ
Error Rate
نسبة التنبؤات الخاطئة من الإجمالي.
الدقة عند K
Precision at K
نسبة النتائج الصحيحة ضمن أول K نتيجة.
متوسط الدقة عند K
Mean Average Precision
متوسط الدقة ضمن أول K نتيجة.
درج BLEU
BLEU Score
مقياس لتقييم جودة الترجمة الآلية.
تقييم النماذج اللغوية
LLM Evaluation
تقييم أداء نماذج اللغة الكبيرة.
الدرج BLEU المتقدم
Advanced BLEU
تحسينات على مقياس BLEU لتقييم الترجمة.
درجة ROUGE
ROUGE Score
مقياس لتقييم جودة التلخيص.
تقييم المهام
Task Evaluation
قياس أداء النموذج في مهام محددة.
معايير نماذج اللغة الكبيرة
LLM Benchmark
معايير قياس أداء نماذج اللغة الكبيرة عبر اختبارات معيارية.
التقييم البشري
Human Evaluation
تقييم جودة النتائج بواسطة البشر باستخدام معايير موضوعية.
التقييم البشري في الحلقة
Human-in-the-Loop Evaluation
دمج التقييم البشري في عملية التقييم الآلي لتحسين النتائج.
التقييم المقارن
Comparative Evaluation
مقارنة أداء نموذجين أو أكثر لتحديد الأفضل.
مقياس METEOR
METEOR Score
مقياس شامل لتقييم جودة الترجمة الآلية.
مقياس CIDEr
CIDEr Score
مقياس لتقييم دقة وصف الصور بالنصوص.
نموذج BLEURT
BLEURT
نموذج تقييم مُدرَّب لتقييم الترجمة الآلية.
مقياس BERTScore
BERTScore
مقياس تقييم يعتمد على التمثيلات الدلالية لـ BERT.
التقييم المقارن المتعدد
Multi-Model Comparison
مقارنة أداء عدة نماذج مع بعضها.
تقييم قدرات التفكير
Reasoning Evaluation
قياس قدرة النموذج على الاستدلال والتفكير المنطقي.
اختبار MMLU المتعدد
MMLU
اختبار فهم اللغة متعدد المهام والمواضيع.
اختبار GSM8K الرياضي
GSM8K
اختبار لحل مسائل رياضيات متعددة الخطوات.
اختبار ARC التحدي
ARC Benchmark
اختبار مرجعي لقياس قدرات التفكير.
اختبار HellaSwag
HellaSwag
اختبار استكمال الجمل بشكل ذكي وسليم.
اختبار WinoGrande
WinoGrande
اختبار لفهم اللغة العامة والتعرف.
اختبار BigBench
BIG-Bench
مجموعة مهام متنوعة لتقييم قدرات الذكاء الاصطناعي.
تقييم MT-Bench للمحادثات
MT-Bench
تقييم النماذج في المحادثات متعددة الجولات.
ساحة الروبوتات المحادثة
Chatbot Arena
منصة مقارنة النماذج عبر التصويت البشري المباشر.
اختبار SWE-bench
SWE-bench
اختبار حل مشكلات البرمجيات الحقيقية.
اختبار MMMU المتعدد الوسائط
MMMU
اختبار فهم متعدد الوسائط للصور والنصوص.
اختبار GPQA المتخصص
GPQA
اختبار أسئلة متخصصة عالية الصعوبة.
تقييم IFEval للتعليمات
IFEval
تقييم الامتثال لتعليمات المستخدم المحددة.
تقييم AlpacaEval للردود
AlpacaEval
تقييم جودة الردود المولدة من النماذج.