Chatbots worden klikbots: Gemini 3.5 Flash krijgt ingebouwde computerbesturing
Google bouwt Computer Use rechtstreeks in Gemini 3.5 Flash in. Daardoor kunnen ontwikkelaars AI-agenten maken die niet alleen antwoorden geven, maar ook schermen interpreteren, klikken, typen en taken uitvoeren in browsers, mobiele apps en desktopomgevingen. De stap maakt agentische AI praktischer voor bedrijven, maar Google koppelt de functie nadrukkelijk aan extra veiligheidslagen tegen fouten en promptinjecties.
Van chatbot naar digitale assistent
De chatbot die alleen tekst terugstuurt, krijgt er steeds meer een uitvoerende rol bij. Google heeft Computer Use geïntegreerd in Gemini 3.5 Flash, waardoor het model voortaan niet alleen kan redeneren over een taak, maar ook daadwerkelijk acties kan voorstellen en uitvoeren via een gebruikersinterface. Denk aan klikken, typen, scrollen en navigeren door webpagina’s, apps of desktopsoftware.
Tot nu toe was deze vorm van computerbediening beschikbaar via een apart Gemini 2.5 Computer Use-model. Met de nieuwe integratie wordt de functie onderdeel van het bredere Flash-model. Dat is belangrijk voor ontwikkelaars: zij hoeven niet langer een aparte route op te zetten voor computergebruik, maar kunnen de capaciteit rechtstreeks aanspreken via de Gemini API of de Gemini Enterprise Agent Platform.
Zo werkt Computer Use in de praktijk
Computer Use draait rond een herhalende cyclus. De applicatie stuurt een screenshot en een opdracht naar het model. Gemini analyseert wat er op het scherm staat en geeft vervolgens een voorgestelde actie terug, bijvoorbeeld een klik op een bepaalde plek of het invoeren van tekst.
Daarna voert de clientomgeving die actie uit, maakt een nieuwe screenshot en vraagt het model om de volgende stap. Zo ontstaat een agent die stap voor stap door een taak heen werkt. Het model kijkt dus niet alleen naar tekst, maar naar de volledige visuele context van een scherm.
Google positioneert de functie vooral als bouwsteen voor zakelijke automatisering. Voorbeelden zijn het invullen van repetitieve formulieren, het testen van webapplicaties en het verzamelen van informatie op verschillende websites. Ook toepassingen zoals continu softwaretesten en kenniswerk binnen professionele applicaties liggen voor de hand.
Breder inzetbaar op browser, mobiel en desktop
Nieuw in Gemini 3.5 Flash is dat Computer Use meerdere omgevingen ondersteunt: browser, mobiel en desktop. Daarmee wordt de technologie minder beperkt tot één soort interface. Een AI-agent kan in theorie dezelfde taak uitvoeren in een webapp, een mobiele omgeving of een desktopapplicatie, zolang de juiste controlelaag aanwezig is.
Daarnaast bevat het model gestroomlijnde acties met een intent-veld, waarin wordt uitgelegd waarom een bepaalde stap wordt gezet. Dat is relevant voor debugging en toezicht, omdat ontwikkelaars zo beter kunnen volgen waarom een agent op een knop wil klikken of tekst wil invoeren.
Die extra transparantie is geen detail. Naarmate AI-agenten meer handelingen zelfstandig voorstellen, wordt het belangrijker om hun redenering controleerbaar te maken. Zeker in bedrijfsomgevingen moet duidelijk zijn waarom een systeem een actie wil uitvoeren, en of die actie past binnen de oorspronkelijke opdracht.
Veiligheid blijft de grootste uitdaging
De keerzijde is veiligheid. Een AI-agent die schermen kan lezen en handelingen kan verrichten, is kwetsbaarder voor misleiding dan een gewone chatbot. Vooral indirecte promptinjecties vormen een risico: verborgen instructies in websites, documenten of interfaces kunnen proberen het model van zijn oorspronkelijke opdracht af te brengen.
Google zegt daarom gerichte adversarial training te hebben gebruikt voor Computer Use in Gemini 3.5 Flash. Voor bedrijven komen er bovendien optionele beveiligingslagen. Organisaties kunnen expliciete bevestiging eisen voor gevoelige of onomkeerbare acties, en taken automatisch laten stoppen wanneer een mogelijke indirecte promptinjectie wordt gedetecteerd.
Toch is dit geen vrijbrief om Gemini zelfstandig kritieke beslissingen te laten nemen. Computer Use blijft een technologie die toezicht nodig heeft, zeker bij taken met gevoelige data, financiële gevolgen of moeilijk herstelbare acties. De aankondiging maakt vooral duidelijk waar de volgende fase van AI-agenten naartoe gaat: minder chatvenster, meer bediening van bestaande software.

