© F. Bottino

Technology / Agentic Systems

Il collo di bottiglia non è la capacità. È la verificabilità.

Quasi tutte le demo di agenti funzionano una volta. Gli agenti enterprise devono funzionare ripetutamente, sotto vincoli — con esecuzione osservabile, permessi circoscritti, affidabilità misurata e controlli human-in-the-loop. KVA progetta, testa e mette in produzione sistemi agentici per workflow aziendali complessi.

La capacità è in gran parte risolta. La verificabilità no.

Toolformer (Schick et al., 2023) ha mostrato che i modelli linguistici possono imparare a invocare strumenti esterni. ReAct (Yao et al., 2023) ha dato una struttura ai flussi di ragionamento-e-azione. Le survey del 2024 descrivono un campo in cui gli agenti si specializzano, collaborano e risolvono task reali.

Ciò che nessuno ha risolto su larga scala: come verifichiamo cosa un agente sa davvero fare, con quanta affidabilità e a quali condizioni? È questo il lavoro.

Architettura, non prompt.

Un sistema agentico utile non è una raccolta di prompt dietro un dispatcher.

Ha bisogno di progettazione dei ruoli, confini sugli strumenti, permessi sulla memoria, policy di retrieval, regole di escalation, framework di valutazione, log di audit e checkpoint con human-in-the-loop. Sono questioni architetturali di prima classe. Trattarle come ripensamenti è il modo in cui i prototipi diventano rischi.

Ogni sistema che consegniamo definisce, in modo esplicito:

Ruoli degli agenti

Tipizzati, circoscritti, con confini di task espliciti.

Permessi sugli strumenti

Controllo degli accessi per ciascun agente. Non capacità indiscriminata.

Accesso alla memoria

Regole di lettura/scrittura sullo strato dei Knowledge Object.

Policy di retrieval

Quale pipeline di retrieval usa ciascun agente per quale task.

Coordinamento

Orchestrazione, swarm, gerarchico — scelto in base alla classe di problema.

Escalation

Condizioni esplicite che instradano alla revisione umana.

Valutazione

Benchmark di capacità subordinati a dimensioni minime del campione.

Log di audit

Ogni azione, chiamata a strumento e passo di ragionamento, registrabile di default.

Validazione dell'output

Output verificati rispetto allo schema e alla provenienza dei KO.

Lavoriamo sopra il livello dei framework.

Non sostituiamo i framework per agenti. Li rendiamo utilizzabili in contesti enterprise complessi.

Che usiate LangGraph, CrewAI, Copilot Studio, AutoGen, Salesforce o tooling interno, KVA lavora sopra il livello del framework: architettura, verifica, scomposizione dei task, valutazione, governance e integrazione con la conoscenza aziendale — il lavoro che trasforma un framework in un sistema di produzione di cui la vostra azienda può fidarsi.

Il KVA Agent Verification Protocol.

Prima che un agente entri in un workflow di produzione, servono prove. Il nostro protocollo di verifica trasforma i sistemi agentici da demo brillanti a infrastruttura enterprise ispezionabile — un profilo operativo misurabile, non l’affermazione che un agente sia “intelligente”. Ogni agente che progettiamo o revisioniamo viene consegnato con un Agent Verification Pack.

L’Agent Verification Pack.

01

Agent Card

Capacità, affidabilità testata, tool circoscritti e indipendenza dal modello misurata — in una pagina.

02

Capability benchmark

Performance contro una batteria di task, con success rate e intervalli di confidenza.

03

Tool permission map

Ogni tool che l’agente può raggiungere, e il confine esplicito attorno a ciascuno.

04

Failure modes report

Dove e come l’agente si rompe — documentato prima della produzione, non dopo.

05

Human escalation policy

Le condizioni esatte in cui il controllo torna a una persona.

06

Audit log specification

Cosa viene registrato: chiamate ai tool, passi di ragionamento e output, con provenienza.

07

Production readiness score

Un unico segnale go / no-go difendibile per il deployment.

Cosa contiene davvero una Agent Card.

Ogni agente che progettiamo o revisioniamo viene consegnato con un’Agent Card. Le capacità sono affermazioni; l’affidabilità testata è evidenza; i tool sono circoscritti; l’indipendenza dal modello è misurata, non promessa. È l’artefatto che un buyer ispeziona prima di integrare un agente.

agent-card.yaml

Illustrativo — struttura rappresentativa, non metriche reali.

agent:
  name: pe-intelligence-agent
  version: 0.4.2
  category: investment-intelligence

capabilities:
  - id: deal-comparable-analysis
    description: Build comparables for a target company
    tested_on:
      n_samples: 142
      success_rate: 0.91
      ci_95: [0.86, 0.95]
      label: validated     # not "early data"

tools:
  - market-intelligence-search
  - financial-data-api
  - knowledge-base-read       # scoped, read-only

model_independence:
  tested_with: [gpt-5, claude-opus-4-7, gemini-3-pro]
  swap_overhead_pct: 3.2

audit:
  log: [tool_call, reasoning_step, output]
  human_in_loop_on: [output_publish, escalation]

Nel lungo periodo questi pack alimentano un catalogo curato di agenti a capacità verificata — prima i verticali Research, Marketing e Venture. Il protocollo è ciò che darebbe senso a un catalogo del genere; oggi è il modo in cui rendiamo deployable ogni singolo agente.

Dagli strumenti di ricerca ai flussi di produzione.

Un buyer ragiona per caso d’uso, non per architettura. Ognuno di questi applica la stessa disciplina di verifica in un punto diverso dello spettro di autonomia.

Strumento di ricerca

Magellan

Per team di R&D, ricerca e strategia.

Generazione autonoma di ipotesi scientifiche. Magellan legge attraverso i silos e propone connessioni meccanicistiche che nessun singolo ricercatore avrebbe trovato — per poi valutarle su novità, plausibilità e falsificabilità. Fase di esecuzione del framework di test, validazione esperta come passo successivo.

Modernizzazione del codebase

Catalyst

Per aziende con codebase legacy.

Un sistema multi-agente per comprendere, rifattorizzare e modernizzare i codebase enterprise legacy. Agenti specializzati gestiscono la mappatura delle dipendenze, l'analisi architetturale, la pianificazione del refactoring, la generazione dei test, la migrazione — coordinati tramite uno strato di conoscenza condiviso.

Modernizzazione del legacy con Catalyst →

Costruttore di software enterprise

RobinDev

Per team che costruiscono software enterprise da specifica.

Costruisce software enterprise a partire dalle specifiche. Agenti per requisiti, architettura, implementazione, test, deployment — con gate di revisione umana a ogni punto di decisione architetturale. Pronto per la transizione commerciale.

Verticali agentici

Agenti Madara

Per team di PE, VC e corporate finance.

Lo stack Madara, scomposto in verticali: Startup Evaluator (diligence automatizzata su aziende early-stage), PE Intelligence (deal intelligence per i flussi di PE), Portfolio Monitor (monitoraggio continuo dei segnali delle società in portafoglio).

Media intelligence agentica

Newjee

Per analisti di media, comunicazione e intelligence.

Analisi multi-agente che monitora gli attori dei media, estrae affermazioni, mappa le narrazioni e confronta l'inquadramento tra le testate. Agenti specializzati per ingestione, estrazione delle affermazioni, clustering, analisi dell'inquadramento. Output che rispettano ciò che l'analista sta cercando di fare.

Pattern architetturale

Analisi multi-strato

Per compliance, ricerca e review di investimento.

Quando un solo passaggio del modello non basta: uno strato recupera e struttura le evidenze, un altro classifica, un altro verifica le contraddizioni, un altro genera l'output, un altro ne controlla la qualità. Usato nell'analisi degli investimenti, nella compliance, nella revisione della ricerca, nei progetti di trasformazione AI.

Una agent factory di livello enterprise.

La parte difficile degli agenti non è farne funzionare uno in una demo. È poter dire cosa fa, con quanta affidabilità e a quali condizioni — prima che tocchi qualcosa che conta.

Eseguiamo un protocollo interno che governa qualità, prontezza e sicurezza di ogni agente che sviluppiamo. È quel protocollo che ci permette di gestire una agent factory di livello enterprise anziché un mucchio di prompt ingegnosi — e di aiutare le organizzazioni ad automatizzare processi genuinamente complessi.

Qualità

Ogni agente viene messo alla prova contro batterie di task prima di essere rilasciato. La capacità è misurata, non asserita.

Prontezza

Un'asticella definita che un agente deve superare prima di toccare un flusso di produzione — dimensioni del campione, soglie di affidabilità, regole di escalation.

Sicurezza

Permessi sugli strumenti circoscritti, regole di lettura/scrittura sullo strato dei Knowledge Object, log di audit completi di ogni azione e passo di ragionamento.

Cosa automatizza quella factory per i clienti.

Automazione di processi complessi

Processi di business multi-step che prima richiedevano un essere umano a ogni snodo — scomposti, automatizzati, con human-in-the-loop solo dove se lo guadagna.

NAV e flussi operativi

Calcolo del net asset value e flussi operativi analoghi: ingestione, riconciliazione, validazione e reportistica, con la provenienza su ogni cifra.

Ingestione multi-fonte

Agenti che attingono da database, documenti, API, feed e fogli di calcolo — normalizzando dati eterogenei in una superficie su cui il resto del sistema può ragionare.

Analisi della conoscenza complessa

Oltre l'estrazione: rilevamento delle contraddizioni, ranking della salienza e sintesi pronta per la decisione su conoscenza ampia, conflittuale e in via di invecchiamento.

Come si parte.

Tre modi di iniziare, a seconda di dove siete. Ognuno produce qualcosa che potete ispezionare.

01

Agent Stack Review

Revisioniamo i vostri prototipi di agenti, architettura, permessi dei tool, flussi di dati, log e setup di valutazione.

Output: mappa dei rischi, readiness score e roadmap di miglioramento.

02

Agent Workflow Benchmark

Testiamo un workflow agentico contro una batteria di task — misurando affidabilità, costo, latenza, failure mode ed esigenze di escalation.

Output: un’Agent Card e un report di benchmark.

03

Production Agent System

Progettiamo e implementiamo un workflow agentico production-grade con tool circoscritti, policy di retrieval, audit log, gate di revisione umana e monitoraggio.

Output: un sistema in produzione di cui la vostra azienda può fidarsi.

Metti in produzione agenti di cui la tua azienda può davvero fidarsi.

Se state valutando framework per agenti, costruendo workflow agentici interni o cercando di portare un prototipo oltre la demo, partite da un Agent Stack Review o da un Workflow Benchmark.