وكلاء الذكاء الاصطناعي للويب في عام 2026: دليل الشراء للفرق والمطورين
كيفية اختيار، دمج وتشغيل الوكلاء الذين يتصفحون، يستخرجون ويؤتمتون الويب دون التعطل في الإنتاج

Daniel Nikulshyn
Editor
التعريف والنطاق
ما هو فعلاً وكيل الذكاء الاصطناعي على الويب
وكلاء الذكاء الاصطناعي على الويب هو نظام يتصور حالة صفحة أو تطبيق ويب، يبرهن حول هدف، وينفّذ إجراءات—النقرات، الكتابة، التصفح، الاستخراج— بشكل مستقل أو شبه مستقل. بخلاف المستخرج التقليدي القائم على قواعد ثابتة أو محددات CSS، يستخدم وكيل الويب نموذجاً لغوياً كبيراً (LLM) لتفسير الـDOM، النص المعروض أو حتى لقطات الشاشة، ويقرر الخطوة التالية. هذا يمنحه التحمُّل لتغييرات التصميم التي ستكسر المستخرج التقليدي. تقع هذه الفئة على تقاطع ثلاثة مجالات ناضجة: أتمتة المتصفحات (ظهرت Selenium في 2004، وPlaywright من Microsoft في 2020)، واستخراج البيانات على الويب، والوكيل المستقل المدعوم بالـLLM الذي اكتسب رواجاً بعد نشر نمط ReAct من قبل باحثي Google وPrinceton في 2022. وفقاً للوثائق الرسمية لـ Playwright، فإن واجهة برمجة تطبيقاته (API) لأتمتة Chromium، Firefox و WebKit هي اليوم الأساس التقني الذي يُبنى عليه العديد من الوكلاء التجاريين. من المهم التمييز بين الأنواع الفرعية. "مشغّلات المتصفح" يتحكم في متصفح كامل ويُفيد عندما يكون هناك تسجيل دخول، JavaScript كثيف أو CAPTCHAs. يركز وكلاء الاستخراج على إرجاع بيانات منظمة (JSON، جداول). يربط وكلاء "العمل سيرًا" عدة مواقع وواجهات برمجة تطبيقات (APIs) لإكمال مهمة تجارية، مثل الحجز، مقارنة الأسعار أو ملء النماذج المتكررة. في عام 2024، قدمت OpenAI Operator وأطلقت Anthropic "Computer Use"، وهما نقطتان محورية دفعتا الفئة من المختبر إلى المنتج. أظهر كلاهما أن نموذجًا متعدد الوسائط يمكنه تشغيل واجهات مصممة للبشر، على الرغم من نسب نجاح غير منتظمة في المهام متعددة الخطوات. هذا هو الحالة الفنية التي يجب أن يفهمها أي مشتري قبل توقيع عقد سنوي.
- Playwright (الوثائق الرسمية) — إطار عمل لأتمتة المتصفحات يدعم العديد من وكلاء الويب.
- استخراج البيانات على الويب (ويكيبيديا) — السياق التاريخي والتقني لاستخراج البيانات على الويب.
كيف تعمل من الداخل
عمارة الوكلاء: الـ DOM والرؤية والإجراء
هناك ثلاث منهجيات معماريّة سائدة. الأول هو المنهج المستند إلى الـ DOM/الوصول: يتلقى الوكيل شجرة الوصول أو DOM مبسّط ويقرر بشأن العناصر الموسّطة. إنه سريع ورخيص من حيث الرموز، لكنه هش عند واجهات القماش canvas أو الواجهات الديناميكية الشديدة. المنهج الثاني هو الرؤية، حيث يتلقى النموذج لقطات الشاشة ويعيد إحداثيات أو إجراءات؛ إنه أكثر قوة في التصاميم النادرة لكنه يستهلك المزيد من الرموز والوقت. الثالث هو المدمج، يجمع نص الـ DOM مع الرؤية لتوضيح الغموض. نموذج التحكم الأكثر انتشاراً ما زال ReAct (التفكير + التنفيذ)، الذي يخلط خطوات التفكير مع الأفعال والملاحظات. أطر عمل مفتوحة مثل LangChain و LlamaIndex شجّعت هذا الحلق، ومشاريع محددة للتنقل مثل Browser Use عدّلتها لسياق الويب. توثيق Anthropic حول "Computer Use" يصف حلقة مماثلة: ينظر النموذج إلى الشاشة، يقترح إجراءً، ينفّذ النظام ذلك ويعيد لقطات جديدة. عامل حاسم هو إدارة الحالة والذاكرة. المهام الويبية متعددة الخطوات تتراكم السياق بسرعة وتفوق حدود الرموز. الأنظمة المتقدمة تُطبّق ملخصات تدريجيّة، ذاكرة حوادث خارجية ونقاط التحقق لاستئناف المهام المقطوعة. دون ذلك، ينسى الوكيل هدفه في منتصف عملية شراء أو نموذج مكوّن من خمس صفحات. المحور المعماري الأخير هو التنفيذ: السحابة المُدارة مقابل الاستضافة الذاتية. مقدمو السحابة يقدمون جلسات متصفّح معزولة، تدوير IP وحل CAPTCHA كخدمة. الاستضافة الذاتية تمنح تحكمًا كاملاً في البيانات والتكلفة لكنها تتطلب صيانة بنية تحتية لتصفّحات headless، وهو أمر غير بسيط على نطاق واسع. وفقًا لتقارير مجتمع Playwright، يتطلب توسيع مئات الجلسات المتزامنة من Chromium تخطيطًا دقيقًا للذاكرة.
- Anthropic — Computer Use — توثيق حلقة التحكم الرؤية Claude.
- LangChain (documentation) — إطار مرجعي لتنسيق وكلاء ReAct.
مراجعات عملية
أدوات بارزة من الدليل
في Agent Pantheon نقوم بتصنيف أدوات هذه الفئة ونحقق صحة عروضها. فيما يلي نراجع مدخلين ذوي صلة للفرق التي تقيم وكلاء الويب مع أهداف مختلفة: أتمتة الاستخراج والتحليل الحواري. يُقدّم Starizon AI كمساعد متصفح مدعوم بالذكاء الاصطناعي لاستخراج البيانات الذكي وأتمتة الويب. في الممارسة العملية، يتناسب هذا النموذج مع فرق العمليات، والنمو أو البحث التي تحتاج إلى جمع بيانات من مواقع تتغير بانتظام دون كتابة وصيانة محددات يدوية. قيمته تكمن في المتانة: عندما يفسّر الوكيل النية ('يستخرج السعر والعنوان والمخزون')، يتحمل إعادة التصميم التي ستكسر متصفحًا صارمًا. إنه خيار يجب اعتباره عندما يكون الحجم متوسطًا والأولوية هي تقليل الصيانة. يأخذ chatrecap زاوية مختلفة: هو محلل ذكي لسجلات الدردشة يحوّل المحادثات إلى رؤى حول علاقاتك. إنه ليس مشغّلًا عامًا للمتصفح، بل وكيلًا متخصصًا في معالجة المحتوى من الويب/المستخرج وإعادة تحليل النتائج. إنه مفيد للمستخدمين الفرديين وحالات تحليل الاتصالات، ويظهر اتجاهًا رئيسيًا في 2026: وكلاء مخصصين يفعلون شيئًا واحدًا جيدًا بدلاً من محاولة تشغيل الويب بالكامل. الدرس للمشتري هو عدم خلط الفئات. المشغل العام والمحلل المتخصص يحلان مشاكل مختلفة؛ خلطهما يؤدي إلى توقعات خاطئة وتكاليف غير ضرورية. حدد أولاً ما إذا كنت بحاجة إلى تصفح ذاتي، استخراج متين أو تحليل المحتوى، ثم قيم مزودي الخدمة ضمن هذا النمط الفرعي.
- Starizon AI — مساعد متصفح مع الذكاء الاصطناعي لاستخراج البيانات وأتمتة الويب.
- chatrecap — محلل سجلات الدردشة يحوّل المحادثات إلى رؤى.
كيفية القياس قبل الشراء
الاعتمادية والتقييم والـ benchmarks
أكبر خطأ عند اعتماد الوكلاء على الويب هو افتراض أن "يعملون". في المهام متعددة الخطوات، حتى أفضل النماذج تفشل بشكل غير محدد. لذلك تُعد البنشماركات العامة مهمة. WebArena، التي نشرتها باحثون من جامعة كارنيغي ميلون في 2023، تقيم الوكلاء في بيئات ويب واقعية ومستضافة ذاتياً؛ أظهرت نتائجها الأولية معدلات نجاح أقل بكثير من الأداء البشري. WebVoyager، التي عُرضت في 2024، تقيس الوكلاء على مواقع حقيقية مع تقييم متعدد الوسائط. للمشتري، المعيار الرئيسي ليس دقة المختبر بل معدل النجاح الشامل في تدفقاتك المحددة. نوصي ببناء مجموعة من 20 إلى 50 مهمة تمثيلية وقياس ثلاثة أمور: النجاح الكامل، النجاح الجزئي (عدد الخطوات التي أتممتها) ووضع الفشل (هل ارتبط، هل تهاوي في إجراء، هل تم حظره؟). هذا التقييم التجريبي يكشف أكثر من أي عرض تقديمي من المورد. يجب أيضاً قياس الكمون والاتّباع. وكيل يستغرق ثلاث دقائق لكل مهمة قد يكون مقبولاً للعمليات الدفّعة الليليّة لكنه غير قابل للتطبيق للتجارب التفاعلية. كذلك، قيّم التباين: نفّذ نفس المهمة عشر مرات وراقب عدد المرات التي ينتج فيها نفس النتيجة. التباين العالي يعني تكاليف إشراف بشري مرتفعة. أخيراً، اطلب قابلية المراقبة. يجب أن يسجل وكيل في الإنتاج كل إجراء، كل لقطة، وكل قرار ليتمكن من تدقيق الأخطاء. أصبحت أدوات تتبع الوكلاء قياسية في 2025-2026 بالضبط لأنّ بدونها لا يمكن تصحيح سبب انكسار تدفق في الساعة الثالثة صباحاً. أولِّج الموردين الذين يقدمون سجلات الإجراءات وإعادة التشغيل البصرية.
- WebArena (موقع المشروع) — بنشمارك الوكلاء على الويب في بيئات واقعية من CMU.
- ReAct (ورقة بحثية) — نمط التفكير والإجراء الأساس للوكلاء الحديثين.
ما لا يخبرك به أحد في العرض التجريبي
القانونية، الأمان والتكاليف المخفية
تُحمل أتمتة تصفح الويب تداعيات قانونية واقعية. قضية hiQ Labs ضد LinkedIn في الولايات المتحدة، التي دارت سنوات طويلة وانتهت في 2022، وضعت أسساً دقيقة حول استخراج بيانات عامة بموجب قانون Computer Fraud and Abuse Act. في أوروبا، يقيّد RGPD جمع البيانات الشخصية بشدة حتى لو كانت عامة. قبل نشر وكيل، راجع شروط الخدمة لكل موقع هدف واستشر فريقك القانوني؛ غالباً ما لا تقع المسؤولية على مزود الأداة. الأمان هو الجانب الحرج الآخر. ينفذ وكلاء الويب إجراءات باستخدام بيانات اعتماد حقيقية، مما يوسع سطح الهجوم. حقن الـ prompts عبر محتوى صفحات — نص خبيث مضمّن في موقع يوجه الوكيل — هو متجه موثَّق من قبل OWASP في قائمة مخاطر تطبيقات LLM. لا تمنح الوكيل صلاحيات لا يحتاجها، عزل الجلسات وطبق مبدأ الحد الأدنى من الامتيازات على بيانات الاعتماد. التكاليف المخفية غالباً ما تُفاجئ. وكلاء الرؤية التي تعالج لقطات الشاشة يستهلكون عددًا أكبر بكثير من الرموز مقارنةً بأولئك الذين يعتمدون على DOM؛ مهمة تبدو بسيطة قد تكلف عشرة أضعاف حسب النهج. أضف الوكلاء السكنيين، حل CAPTCHA المدفوع ووقت الهندسة للحفاظ على تدفقات تتغير. نمذج التكاليف لكل مهمة مكتملة، لا السعر المخطط للخط. نقطة نهائية: الرقابة البشرية لا تختفي، بل تتغير. النشر الناجح الذي وثقناه يحافظ على وجود إنسان في الحلقة للإجراءات التي لا يمكن التراجع عنها — المدفوعات، الإرساليات، الحذوفات — ويترك الوكيل للعمل بشكل مستقل تماماً فقط في مهام منخفضة المخاطر وسهلة التراجع. عامل الاستقلالية كدرجة، لا كمفتاح.
- OWASP Top 10 for LLM Applications — المخاطر الأمنية الرئيسية، بما في ذلك حقن الـ prompts.
- hiQ Labs v. LinkedIn (Wikipedia) — سابقة قانونية حول استخراج بيانات عامة.
من الاختبار إلى الإنتاج
كيفية الاختيار: إطار اتخاذ القرار لعام 2026
ابدأ بتصنيف حالتك في واحد من ثلاثة مجالات: استخراج البيانات، تشغيل المهام أو تحليل المحتوى. لكل مجال مزودون مثاليون مختلفون. لاستخراج مرن، قم بالتركيز على الأدوات التي تجمع بين DOM/الرؤية ومعالجة جيدة لخطط الإخراج. لتشغيل المهام مع تسجيل الدخول وتدفقات طويلة، اختر المشغلين الذين يتيحون جلسات معزولة، ذاكرة دائمة، وعمليات موافقة بشرية. للتحاليل، ابحث عن وكلاء متخصصين في قطاعات معينة. قم بالتقييم دائمًا استنادًا إلى خمسة معايير: معدل النجاح في مهامك، التكلفة لكل مهمة مكتملة، التأخير المقبول، القدرة على المراقبة/التدقيق والامتثال القانوني. وزن هذه المعايير حسب سياقك لتجنب فخ الشراء بناءً على ميزات جذابة لن تستخدمها أبدًا. تجربة اختبار لمدة أسبوعين مع بيانات حقيقية أكثر قيمة من أي مقارنة نظرية. حدد مبكرًا ما إذا كنت ستستخدم سحابة مُدارة أم بنظام ذاتي استضافة. إذا كنت تتعامل مع بيانات حساسة ومُنظَّمة، فإن النظام الذاتي أو النشر في VPC الخاصة بك غالبًا ما يكون غير قابل للتفاوض رغم التكاليف التشغيلية الأعلى. إذا كنت تُفضَّل سرعة النشر والمرونة في التوسع، فإن السحابة المُدارة تُسرّع الوصول إلى القيمة. يبدأ العديد من الفرق في السحابة ثم ينتقلون إلى نظام ذاتي لاستضافة المكونات الحرجة مع التقدم. أخيرًا، خطط للعمليات، ليس فقط الاعتماد. المواقع تتغير، والنماذج تُحدَّث، وتصبح التدفقات متدهورة بصمت. عين مسؤولين للصيانة، حدد إنذارات لمعدل النجاح وميزِّن التكلفة المستمرة للمراقبة. وكلاء الويب في عام 2026 قادرون واقتصاديون، لكنهم يثمنون الفرق التي يُعاملون فيها كنظم إنتاجية، وليس كعجائب ذاتية.
- OpenAI (الموقع الرسمي) — مزود Operator ونماذج متعددة الوسائط للوكلاء.
- Software agent (ويكيبيديا) — أسس مفاهيمية لوكلاء البرمجيات.
الموارد
- التنقيب عن الويب (ويكيبيديا)
الأسس التاريخية والتقنية لاستخراج بيانات الويب.
- أنتهوبيتك — استخدام الحاسوب
التوثيق الرسمي لحلقة التحكم بالتحكم البصري لClaude.
- OpenAI
مُقدّم Operator والنماذج متعددة الوسائط للوكائل الويب.
- Playwright
إطار عمل أتمتة المتصفحات كأساس للعديد من الوكلاء.
- الـ OWASP Top 10 لتطبيقات LLM
مخاطر أمنية لتطبيقات قائمة على LLM.
الأسئلة الشائعة
ما الفرق بين وكيل الذكاء الاصطناعي على الويب وكاشف البيانات التقليدي؟
يستخدم الكاشف قواعد ثابتة ومحددات تفشل عند تغير التصميم. يستخدم وكيل الذكاء الاصطناعي على الويب نموذج LLM لتفسير الهدف وتكييف أفعاله، ما يمنحه مرونة تجاه إعادة التصميم على حساب زمن الاستجابة واستهلاك الرموز.
هل الأكياس التي تتنقل وتستخرج البيانات قانونية؟
يعتمد ذلك على الاختصاص القضائي، والبيانات، وشروط خدمة الموقع. أبحاث مثل hiQ vs. LinkedIn أدقّت التحديد حول كاشف البيانات العامة في الولايات المتحدة، لكن RGPD يحدّ من بيانات الأشخاص في أوروبا. استشر فريقك القانوني قبل النشر.
هل أختار نهج DOM أم الرؤية؟
يُعد DOM أسرع وأكثر اقتصادية للمواقع المُنظمة؛ أما الرؤية فَتكون أكثر صلابة في واجهات ديناميكية أو canvas لكنها تستهلك رموزًا أكثر. يجمع العديد من المزودين الناضجين بين الاثنين لتقليل الغموض.
ما مدى موثوقية هذه الأكياس في المهام متعددة الخطوات؟
مازالت تخطئ بطريقة غير محدّدة. تُظهر معايير مثل WebArena وWebVoyager معدلات أقل من أداء البشر. ابني مجموعة خاصة بك تتألف من 20-50 مهمة وقِس معدل النجاح من النهاية إلى النهاية قبل الشراء.
ما هو أكبر خطر أمني؟
حقن العبارات عبر محتوى الصفحات، كما وثقته OWASP. يمكن لنص خبيث أن يوجه الوكيل. عزل الجلسات، تطبيق أقل امتياز للبيانات الاعتمادية والحفاظ على الموافقة البشرية للعمليات غير القابلة للإلغاء.
كيف أحسب التكلفة الفعلية؟
لا تقتصر على السعر المدرج، بل قم بنمذجة التكلفة لكل مهمة مكتملة: الرموز (أكبر مع الرؤية)، البروكسيات، حل CAPTCHA والوقت الهندسي للصيانة. قد تكلف مهمة بسيطة عشرة أضعاف حسب النهج.
سحابة مُدارة أم استضافة ذاتية؟
السحابة加速实施并弹性扩展。الاستضافة الذاتية تمنح تحكمًا كاملاً على البيانات وتفضيلًا للبيانات المُحمية الحساسة، مقابل الحاجة إلى صيانة بنية تحتية للمتصفحات headless.
هل يمكن ترك وكيل يعمل بشكل تام ومستقل؟
فقط في مهام منخفضة الخطورة وسهلة التراجع. للمستحقات، الشحن أو الحذف، احتفظ بشخص بشري في الدائرة. عامل الاستقلالية كمنبه تدريجي، وليس كمفتاح تشغيل / إيقاف كامل.