Outsourcing IT
Platform engineering e affidabilità per una fintech latinoamericana
In sintesi
- Settore
- Servizi finanziari e fintech
- Geografia del cliente
- Fintech latinoamericana, multipaese
- Dimensione del cliente
- Scale-up, piattaforma finanziaria digitale multimercato
- Linea di servizio
- Outsourcing IT, platform engineering, DevOps, affidabilità
- Lingua principale
- Inglese e spagnolo
- Sede di delivery
- Bogotá
- Durata dell'incarico
- 16 mesi, in corso
- Dimensione del team
- 20 ingegneri, 2 responsabili, 7 senior, 9 intermedi, 2 junior
Profilo del cliente
Il cliente è una fintech latinoamericana che gestisce una piattaforma finanziaria digitale in diversi paesi, con sede nella regione e un'organizzazione di ingegneria distribuita. La sua piattaforma gestisce pagamenti e transazioni finanziarie su larga scala, dove disponibilità e affidabilità sono esistenziali anziché semplicemente importanti.
La sfida
La disponibilità della piattaforma della fintech era al 97,2%, il che per una piattaforma di pagamenti rappresenta una quantità inaccettabile di tempo di inattività. Ogni minuto in cui la piattaforma è indisponibile sono transazioni che falliscono e fiducia che si erode, e la rapida crescita dell'azienda stava superando l'affidabilità della sua infrastruttura. L'organizzazione di ingegneria era assorbita dalla risposta agli incidenti e non aveva capacità per migliorare la piattaforma. Ogni iniziativa di affidabilità dell'anno precedente era stata abbandonata a metà quando il carico di incidenti si riprendeva il team, uno schema familiare e corrosivo. Il rilascio era lento e rischioso. Senza un'infrastruttura di delivery progressiva, ogni rilascio comportava il rischio dell'intera piattaforma, il che portava il team a rilasciare di rado, il che rendeva ogni rilascio più grande e più rischioso, un problema che si autoalimentava. La fintech aveva cercato di assumere ingegneri senior di piattaforma e affidabilità nei suoi mercati e aveva trovato il profilo scarso e costoso, mentre i suoi stessi ingegneri venivano attirati verso il lavoro sulle funzionalità dalla pressione del prodotto.
Perché Corpshore Colombia
Corpshore Colombia ha proposto un incarico a due binari, un binario di gestione che stabilizzava la piattaforma e un binario di costruzione che realizzava l'infrastruttura di affidabilità e delivery, con il binario di costruzione contrattualmente isolato dalla risposta agli incidenti in modo che non potesse essere assorbito dalla gestione delle emergenze, che aveva ucciso i precedenti tentativi interni della fintech.
Bogotá collocava il team nel centro finanziario e ingegneristico del paese, sull'orario del cliente, e l'esperienza di Corpshore con piattaforme finanziarie regolamentate e la sua postura di sicurezza contavano per un ambiente di pagamenti.
L'incarico
Venti ingegneri a Bogotá: due responsabili tecnici, sette senior, nove di livello intermedio e due junior, suddivisi tra un binario di gestione e un binario di costruzione isolato. La copertura di gestione è di 24 ore per gli incidenti critici; il binario di costruzione lavora a orario standard ed è contrattualmente protetto dalla risposta agli incidenti. Stack: Kubernetes, Terraform, AWS, Go, Python, Prometheus, Grafana, con la piattaforma esistente del cliente.
Approccio e metodologia
Stabilizzare per causa, non per ticket. La risposta agli incidenti è passata dalla gestione delle emergenze all'eliminazione delle cause, con ogni incidente critico che produce un record della causa radice e un'azione preventiva. La curva di disponibilità riflette l'eliminazione delle cause anziché un ripristino più veloce. Costruzione dell'affidabilità isolata. Il binario di costruzione ha realizzato osservabilità, delivery progressiva e infrastruttura self-service, protetto dal carico di incidenti, che è l'unico motivo per cui è sopravvissuto per produrre risultati dove i precedenti tentativi della fintech non ci erano riusciti. Delivery progressiva. Feature flag, distribuzioni canary e rollback automatico hanno disaccoppiato il rilascio dal rischio, consentendo distribuzioni frequenti e sicure. Trasferimento documentato delle conoscenze. L'infrastruttura e i runbook sono costruiti secondo uno standard che gli ingegneri del cliente stesso possono gestire, con traguardi di trasferimento definiti.
Disponibilità della piattaforma core
Risultati
La disponibilità della piattaforma core è salita dal 97,2% al 99,87% entro il mese 12, riducendo il tempo di inattività mensile da circa venti ore a meno di una, su una piattaforma di pagamenti dove quella differenza è esistenziale. Il tempo medio di risoluzione degli incidenti critici è sceso da oltre undici ore a 0,7 ore, e la frequenza degli incidenti critici è calata man mano che l'eliminazione delle cause prendeva piede. Gli ingegneri della fintech stessa sono stati riassegnati al lavoro sulle funzionalità man mano che la piattaforma si stabilizzava, e la frequenza di rilascio è salita a settimanale o migliore per team.
Valore duraturo
L'infrastruttura di osservabilità e delivery progressiva è di proprietà del cliente e gestita dagli ingegneri della fintech. Il modello a due binari isolati è diventato il modello di riferimento del cliente per il lavoro sull'infrastruttura. Corpshore Colombia ha esteso l'incarico all'ingegneria della sicurezza per la piattaforma.
Indicatori chiave
| Metrica | Punto di partenza | Mese 12 | Variazione |
|---|---|---|---|
| Disponibilità della piattaforma core | 97.2% | 99.87% | +2.67 pts |
| Tempo di inattività mensile | ≈ 20 hours | < 1 hour | -95% |
| Tempo medio di risoluzione, critici | 11 h 10 m | 42 min | -94% |
| Incidenti critici al mese | 13 | 3 | -77% |
| Frequenza di rilascio | Rara | Settimanale+ | Cambiamento strutturale |
| Tasso di fallimento delle modifiche | 22% | 7% | -68% |
| Iniziative di costruzione dell'affidabilità completate | 0 dei tentativi precedenti | Realizzate | Nuova capacità |
Quando una metrica ha rivelato solo una variazione, le cifre assolute sono mostrate con un trattino. Le cifre sono riportate dal cliente o misurate in modo congiunto.
Ogni programma di affidabilità che avevamo avviato veniva divorato dagli incidenti. Isolare contrattualmente il team di costruzione è l'unico motivo per cui questo è sopravvissuto per produrre qualcosa. Su una piattaforma di pagamenti, quell'affidabilità è l'azienda.
Temi correlati