OlympHill
ScreenAgent logo

ScreenAgentAgente open-source per il controllo delle interfacce utente tramite pianificazione ed esecuzione del mouse/tastiera.

4.4 (5)
Daniel NikulshynRecensito da Daniel Nikulshyn·Aggiornato luglio 2026

Panoramica

ScreenAgent è un agente open-source basato sul Modello Linguistico Visivo (VLM) progettato per controllare interfacce utente di computer tramite operazioni sul mouse e tastiera. Abilita l'interazione con monitor reali osservando screenshot ed eseguendo azioni. Il progetto comprende un processo di pianificazione-esecuzione-riflessione che guida l'agente a completare compiti a più passaggi. È stato creato per affrontare il dilemma di insegnare agli agenti a utilizzare i computer, richiedendo capacità come la pianificazione dei compiti, la comprensione delle immagini e la posizionamento visivo. Il dataset ScreenAgent, che copre varie attività di computer quotidiano, è stato annotato a mano per supportare l'apprendimento del modello. Il progetto consiste in un client per il controllo del desktop, un dataset, operai di modello per l'inferenza e codice per l'allenamento. Supporta operazioni di base sul mouse e tastiera e può essere applicato a diversi sistemi operativi desktop e applicazioni. L'approccio di ScreenAgent è universale e non dipende da specifiche API, rendendolo versatile.

Funzionalità chiave

  • Esecuzione di operazioni sul mouse e tastiera
  • Processo di pianificazione-esecuzione-riflessione per la completazione dei compiti
  • Supporto per vari sistemi operativi desktop e applicazioni
  • Annotazione manuale del dataset ScreenAgent per una copertura di compiti varie
  • Agente VLM per l'interazione con l'interfaccia utente

Prezzi

Modello
Freemium
Valutazione
4.4 / 5 (5)

Casi d’uso

Automatizzare flussi di lavoro desktop ripetitivi

Utilizzare l'agente VLM per pianificare e eseguire azioni sul mouse e tastiera attraverso applicazioni GUI, gestire compiti a più passaggi senza dover scrivere ogni interazione.

Ricerca su agenti linguistici visivi

Sfruttare il codice open-source per studiare, mettere a benchmark e estendere agenti di modello linguistico-visione che percepiscono schermi e operano computer.

Esecuzione di compiti transapplicativi

Dire l'agente di pianificare e svolgere compiti che coprono più programmi GUI, navigare finestre e controllo attraverso comprensione dello schermo.

Controllo assistivo e accessibilità

Abilitare il controllo dell'interfaccia utente di un computer tramite linguaggio naturale, aiutando gli utenti a eseguire azioni attraverso un agente che interpreta lo schermo e agisce in loro vece.

Pro & contro

Pro

  • Applicabilità universale attraverso diversi sistemi operativi desktop e applicazioni
  • Capacità di eseguire compiti complessi attraverso un processo di pianificazione-esecuzione-riflessione
  • Supporto alle operazioni di base sul mouse e tastiera per l'interazione con l'interfaccia utente
  • Annotazione dataset manuale per una copertura dei compiti completa

Contro

  • Requisito di un server VNC o simile per la connessione al desktop remoto
  • Capacità di pianificazione complessa e comprensione delle immagini necessarie
  • Dipendenza dalla qualità e copertura del dataset ScreenAgent

Recensioni

4.4

Media su 5 valutazioni.

5
2
4
3
3
0
2
0
1
0

Accedi per lasciare una recensione.

Margaret Whitfield

Margaret Whitfield

Apr 23, 2026

Skeptical, then convinced

I went in skeptical — most tools in this space overpromise. It actually delivers on the integrations, and it saves real time caught me off guard. The docs could be deeper is why this isn't a perfect score, still, I'd recommend giving it a real trial.

CL

Camille Laurent

Mar 7, 2026

Does the job

Pretty happy overall. The automation just works and the value for money is strong. A few rough edges remain can be annoying, but no dealbreakers — I'd recommend it to a friend without hesitating.

DF

Diego Fernández

Jan 23, 2026

Years in this space

I've evaluated a lot of these over the years. What stands out here is the core workflow — handled better than most — and support is responsive. Pricing gets steep at scale is my one real gripe. Worth the time if this is your use case.

WC

Wei Chen

Jan 10, 2026

Compared a few options

Evaluated this against two competitors. Where it wins: the automation and it is genuinely easy to set up. Where it lags: pricing gets steep at scale. On balance the feature set — especially the onboarding — justifies the 4 stars for our use case.

Rina Desai

Rina Desai

Jul 29, 2025

Use it every day

Honestly didn't expect to like it this much. The integrations is exactly what I needed, and the value for money is strong. but I reach for it almost every day now and it just clicks.

Domande e risposte

What are typical use cases for ScreenAgent?

It is suited to GUI automation tasks where an agent needs to perceive the screen and act via mouse/keyboard—such as automating desktop workflows, testing applications, or building research prototypes for computer-use agents.

Asked by Diego Fernández · Oct 12, 2025

How much does ScreenAgent cost?

ScreenAgent is open-source, so the software itself is freely available. You may still incur costs for the underlying VLM (if using a paid model) and the hardware required to run it.

Asked by Kwame Mensah · Oct 3, 2025

What is ScreenAgent and what can it do?

ScreenAgent is an open-source Visual Language Model (VLM) agent that controls computer GUIs. It plans and executes mouse and keyboard actions to automate on-screen tasks across desktop applications.

Asked by Sanjay Gupta · Sep 28, 2025

Fai una domanda

Alternative a Sistemi di sviluppo di agenti artificiali AI

Wildcard AI / agents.json logo

Wildcard AI / agents.json

Sistemi di sviluppo di agenti artificiali AI

Spazio aperto e piattaforma che consente agli agenti di intelligenza artificiale di scoprire e chiamare gli workflow delle API attraverso un file agents.json.

5.0 (6)
Freemium
Strands Agents logo

Strands Agents

Sistemi di sviluppo di agenti artificiali AI

SDK di codice aperto per costruire e orchestrare sistemi di agenti single o multipli con LLM e integrazione degli strumenti.

5.0 (5)
Freemium
BabyCatAGI logo

BabyCatAGI

Sistemi di sviluppo di agenti artificiali AI

Frammento leggero di un agente di IA autonomo per l'automazione di task semplificata

4.8 (6)
Free
Awesome MCP Servers logo

Awesome MCP Servers

Sistemi di sviluppo di agenti artificiali AI

Un elenco curato di server per il protocollo di contesto dei modello per estendere gli assistenti AI con strumenti e dati.

4.8 (5)
Free
Gemma 3 logo

Gemma 3

Sistemi di sviluppo di agenti artificiali AI

Un modello di intelligenza artificiale open-source ottimizzato per le prestazioni da un GPU, che supporta l'ingresso multimodale e oltre 140 lingue.

4.8 (5)
Free
Rasa logo

Rasa

Sistemi di sviluppo di agenti artificiali AI

Fornisce un framework open-source per la creazione di assistenti di chat e vocale a livello di produzione

4.8 (5)
Freemium
BabyElfAGI logo

BabyElfAGI

Sistemi di sviluppo di agenti artificiali AI

Racchiuso in uno strumento di framework per l'agente AI sperimentale, con la Skills classe modulare per piani di attività dinamici e esecuzione.

4.8 (4)
Free
Auto-GPT logo

Auto-GPT

Sistemi di sviluppo di agenti artificiali AI

Agente AI open-source in grado di completare autonomamente compiti complessi utilizzando i modelli GPT.

4.8 (4)
Free