Engenharia de IA com os reflexos de uma empresa de segurança
Desenhamos, implementamos e otimizamos sistemas de IA dentro do seu perímetro: implementações de LLM locais e de IA soberana, seleção de modelos apoiada em medições e não nas promessas dos fabricantes, pesquisa sobre o seu próprio material com as regras de acesso preservadas, e as salvaguardas que fazem o resultado resistir a uma revisão de segurança.
O mercado de consultoria em IA vende entusiasmo. Nós vendemos medições: o que um modelo faz realmente com a sua carga de trabalho, quanto custa realmente o hardware e o que o seu auditor vai realmente aceitar. Tudo o que implementamos é construído para correr onde os seus dados já estão.
Onde costumamos ser chamados
Organizações que precisam de IA sobre material sensível sem o enviar para um fornecedor de cloud
Equipas com uma compra de GPU para justificar e nenhuma base medida para a dimensionar
Pilotos de IA que pararam por causa do desempenho, do custo ou de uma revisão de segurança
O que um projeto abrange
Implementação de LLM locais e de IA soberana: serviço de modelos, dimensionamento de GPU e quantização escolhidos a partir do débito medido, e não das fichas técnicas
Comparações de modelos: os candidatos são medidos sobre a sua carga de trabalho e na sua língua antes de se comprar qualquer hardware
Desenho da pesquisa e da base de conhecimento sobre os manuais, tickets e runbooks que já tem, sob as suas regras de acesso atuais
Afinação do desempenho de inferência: cache de contexto, batching e estrutura de prompts que reduzem a latência e o custo do hardware
Salvaguardas e controlo de saída entre a sua IA e a internet, impostos pela arquitetura e não por uma política
Integração com os sistemas que já tem, e o rasto de evidência que os seus auditores vão pedir
Medido antes de comprado
As escolhas de modelo e de hardware fazem-se a partir de benchmarks corridos sobre a sua carga de trabalho, na sua língua, antes de se comprar o que quer que seja: tokens por segundo com prompts de tamanho real, tempo até ao primeiro token com os seus comprimentos de contexto, e qualidade sobre o seu material e não sobre uma tabela classificativa pública.
Quando um modelo mais pequeno ou local chega, as medições dizem-no e fica com a diferença. Quando não chega, fica a sabê-lo antes de o hardware chegar, e não depois.
Defensável pela arquitetura
Salvaguardas que vivem num documento de política falham à primeira vez que alguém tem pressa. Em vez disso, construímos a restrição na própria implementação: o que pode chegar à internet, o que tem de ficar local e o que fica registado são propriedades da arquitetura, verificáveis a partir dos registos da sua própria rede.
É a mesma disciplina sobre a qual os nossos produtos são construídos, aplicada aos sistemas que construímos para si.
Os produtos que suportam este trabalho
Quando o projeto pede uma plataforma e não um desenvolvimento à medida, estas são as nossas.
Marmot
IA soberana, com uma porta de controlo
IA nas suas instalações, com uma porta que decide, pedido a pedido, o que pode chegar a um modelo na cloud e o que nunca sai do edifício.
Saber mais sobre MarmotIbex
Segurança para as redes onde a cloud não chega
Gestão da superfície de ataque em air-gapped (rede isolada): rede, código, IA e bases de dados avaliados a partir de um appliance selado dentro do seu perímetro, com cada falha ligada ao host onde corre.
Saber mais sobre Ibex
