Agenții AI îți ating tastatura acum. Ce poate merge prost?

Agenții AI îți ating tastatura acum. Ce poate merge prost?

Săptămâna aceasta, Anthropic a lansat „computer use" pentru Claude, o funcție care permite AI-ului să deschidă aplicații, să navigheze pe web, să completeze foi de calcul și să trimită pull request-uri pe Mac-ul tău. Îi trimiți un mesaj lui Claude de pe telefon, iar el face treaba pe calculatorul tău în timp ce ești plecat. Funcția a fost lansată în preview de cercetare pentru abonații Pro și Max și se integrează cu Dispatch, un instrument mobil care îți permite să atribui sarcini de la distanță.

Aceasta face parte dintr-o cursă mai amplă. OpenClaw, framework-ul open-source pentru agenți, a devenit viral la începutul acestui an și a atras suficientă atenție încât creatorul său a fost recrutat de o altă companie. Mai multe laboratoare se întrec acum să lanseze agenți care depășesc simpla conversație și încep să acționeze. Cum a spus un CEO săptămâna trecută, acești agenți sunt „noul ChatGPT".

Iată despre ce e vorba de fapt: asistăm în timp real la o schimbare de categorie, iar majoritatea echipelor de dezvoltare nu o privesc din unghiul potrivit.

Problema reală nu este AI-ul. Ci accesul.

Când desfășurăm teste de penetrare pentru studiouri de gaming și clienți enterprise, cele mai îngrijorătoare descoperiri sunt rareori exploit-uri sofisticate. Sunt probleme de permisiuni. Conturi de serviciu cu prea mult acces. Instrumente de administrare lăsate complet deschise. Credențiale stocate unde nu ar trebui să fie.

Acum imaginează-ți că oferi unui agent AI posibilitatea de a da click, de a tasta și de a naviga pe desktop-ul tău. Anthropic spune că Claude va cere permisiunea înainte de a accesa aplicații noi și că utilizatorii îl pot opri oricând. Acesta este un punct de plecare rezonabil. Însă „punct de plecare rezonabil" și „pregătit pentru producție în echipe care gestionează date sensibile" sunt lucruri foarte diferite.

Computer use la Claude funcționează momentan doar pe macOS. Se bazează pe capturi de ecran, adică citește pixelii de pe ecranul tău pentru a ști ce să facă în continuare. Dacă un manager de parole completează automat un câmp în timp ce Claude urmărește, el vede asta. Dacă un fir de conversație Slack cu date personale ale clienților derulează pe ecran, îl vede și pe acela. Chiar Anthropic a declarat că funcția „este încă în stadiu incipient față de capacitatea lui Claude de a scrie cod sau de a interacționa cu text" și a avertizat că „Claude poate face greșeli".

Această onestitate este apreciată. Dar cred că echipele vor adopta această tehnologie mai repede decât vor construi bariere de protecție în jurul ei.

Ce înseamnă asta pentru dezvoltatori

Partea orientată spre dezvoltatori este interesantă. Anthropic spune că Claude poate face modificări într-un IDE, poate trimite pull request-uri și poate rula teste. Dacă ești un dezvoltator solo care lucrează la un proiect personal, asta chiar poate economisi timp.

Pentru echipe, însă? Noi construim aplicații web și API-uri pentru clienți enterprise cu cerințe de conformitate, adesea în industrii reglementate din Europa. Ideea unui agent AI care trimite autonom PR-uri și rulează teste ridică întrebări ce depășesc sfera „este codul corect?". Cine l-a revizuit? La ce date a accesat agentul pentru a-l scrie? Există un jurnal de audit?

Un studiu recent pe 700 de ingineri a constatat că 69% dintre dezvoltatorii care folosesc frecvent instrumente AI de programare întâmpină probleme la deployment „întotdeauna, aproape întotdeauna sau frecvent" când e implicat cod generat de AI. Codul se scrie mai repede, dar infrastructura de testare, securitate și deployment nu a ținut pasul. Adăugarea unui agent care poate apăsa și butoane în IDE-ul tău nu remediază această discrepanță. O adâncește.

Din experiența noastră cu PHP și Docker pe aplicații cloud-native, am învățat pe calea grea că viteza fără bariere de protecție înseamnă doar că strici lucrurile mai devreme. Echipele care livrează în mod fiabil nu sunt cele care scriu cod cel mai repede. Sunt cele ale căror pipeline-uri CI/CD, procese de code review și verificări de securitate sunt suficient de solide pentru a absorbi viteza.

Echipele mobile ar trebui să fie atente și ele

S-ar părea că acesta este un subiect despre desktop, dar nu este. Funcția Dispatch creează anume o punte între telefon și computer. Dai o sarcină de pe iPhone și Claude o execută pe Mac-ul tău. Acesta este un tipar de workflow cross-device pe care îl vom vedea mult mai des.

În proiectele noastre native iOS și Android, mai ales în sănătate și IoT, ne confruntăm de ani de zile cu dificultățile coordonării acțiunilor între dispozitive. Partea dificilă nu a fost niciodată stratul de comunicare. Au fost granițele de încredere. Ce dispozitiv este autoritar? Ce se întâmplă când acțiunea la distanță eșuează în tăcere? Cum transmiți erorile utilizatorilor care nu urmăresc ecranul unde s-a produs acțiunea?

Workflow-urile conduse de agenți între telefon și desktop vor lovi exact aceleași probleme, cu diferența că acum „utilizatorul" din buclă este un AI care nu îți poate spune că e confuz. Continuă pur și simplu să dea click.

Ce e de făcut chiar acum

Iată câteva lucruri pe care echipa ta le poate face săptămâna aceasta, înainte ca cineva să instaleze un agent de tip computer-use pe o mașină de lucru:

  1. Auditează ce este pe ecran. Dacă dezvoltatorii tăi au date ale clienților, credențiale sau dashboard-uri interne vizibile pe desktop, un agent care poate face capturi de ecran le poate vedea pe toate. Aceasta este aceeași suprafață de atac pe care o testăm în cadrul recenziilor de securitate, doar că este declanșată de un instrument pe care tu l-ai invitat.

  2. Stabilește o politică înainte ca instrumentul să sosească. Decide acum dacă agenții care pot controla calculatoare sunt aprobați pentru organizația ta, pentru ce cazuri de utilizare și pe ce mașini. Adaptarea politicii după adoptare este dureroasă.

  3. Nu sări peste lucrurile plictisitoare. Dacă pipeline-ul tău CI/CD, acoperirea cu teste și procesul de code review nu sunt suficient de solide pentru a prinde cod uman prost, cu siguranță nu vor prinde nici cod AI prost trimis de un agent autonom. Întărește mai întâi fluxul tău de dezvoltare.

  4. Urmărește permisiunile, nu demo-urile. Demo-urile spectaculoase arată cum Claude exportă un PDF. Riscul constă în ce altceva poate accesa în timp ce face asta. Tratează accesul agentului așa cum ai trata prima zi a unui nou contractor: privilegii minime, acces delimitat, supravegheat până la câștigarea încrederii.

Imaginea de ansamblu

Revin mereu la un tipar pe care îl vedem în activitatea noastră cu clienți enterprise: noile capabilități sunt adoptate mai repede decât maturitatea în materie de securitate și procese necesară pentru a le susține. S-a întâmplat cu migrarea în cloud, s-a întâmplat cu containerizarea și se întâmplă acum cu agenții AI.

Tehnologia este cu adevărat impresionantă. A vedea un AI navigând pe desktop-ul tău pentru a finaliza o sarcină este un veritabil moment de „ah, am ajuns deja aici". Dar impresionant și pregătit pentru producție nu sunt același lucru, și prefer ca clienții noștri să fie cu șase luni în urmă față de tendința momentului, cu datele intacte, decât să fie la vârful valului cu un raport de incident.

Anthropic, spre meritul lor, nu supravinde asta. Au numit-o preview de cercetare, au semnalat limitările și au spus că amenințările evoluează constant. Aceasta este atitudinea corectă. Îmi doresc doar ca fiecare echipă care evaluează aceste instrumente să le abordeze cu același nivel de prudență.

Dacă stabilirea locului în care agenții AI se potrivesc (sau nu) în fluxul tău de dezvoltare îți sună cunoscut, hai să vorbim.

ai-agentsexpert-analysissecuritysoftware-developmenttech-news