أطلقت شركة ديبسيك الصينية نموذجًا جديدًا يحمل اسم V4-Flash-Vision-Exp، يضيف قدرة فهم الصور إلى إمكانيات النص لديها. وحسبما تؤكد الشركة، يحافظ النموذج على أداء النسخة النصية الأساسية في التفكير المنطقي والمعرفة العامة، بينما يقترب من مستوى Opus 4.8 على معايير الوكلاء متعددة الأنماط الداخلية.
صمّمت ديبسيك هذا النموذج للتطبيقات القائمة على الوكلاء الذكية، ليعمل مع أطر عمل مختلفة ويدمج فهم الصور مع استخدام الأدوات. يستطيع النموذج وصف الصور واستخراج النصوص من لقطات الشاشة وتحليل الرسوم البيانية، ويدعم صيغ JPEG و PNG و GIF و WebP، مع تحديد الصيغة من محتوى الملف الفعلي بدلًا من اسم الملف أو نوع MIME المعلن.
يعمل النموذج مع واجهات برمجية من OpenAI وAnthropic، وأطلقت ديبسيك كذلك الإصدار 0.1.1 من إطار عملها Harness الذي يدعم النموذج الجديد مباشرة. يمكن للمطورين إرسال الصور بثلاث طرق: التضمين المباشر عبر ترميز Base64، أو الإشارة إلى عناوين URL عامة تصل إلى 32 ميجابايت، أو استخدام واجهة الملفات الجديدة والمجانية، التي تسمح برفع ملف مرة واحدة والإشارة إليه عبر معرف في طلبات متعددة بحد أقصى 64 ميجابايت.
يتضمن النموذج حقل اختياري يقلل دقة الصور إلى 512×512 بكسل لتوفير الرموز عندما لا تكون التفاصيل البصرية الدقيقة ضرورية. تكلّف كل صورة على الأكثر 384 رمزًا بغض النظر عن الدقة الأصلية، وتتبع الأسعار معدلات V4-Flash. يمكن لطلب واحد أن يتضمن حتى 600 صورة، مع حد أقصى لطول الحافة بـ 8192 بكسل لكل جانب، وينخفض هذا إلى 4096 بكسل عندما يحتوي الطلب على 15 صورة أو أكثر.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.