← Aceite MVP V1 — evidências em vídeo

Architecture Target — AI Factory

Versão congelada na fase M0 (arquitetura e escopo). Este documento é a referência canônica do que pertence à AI Factory, o que fica fora, quem chama quem, e qual modelo atende cada capability. Deriva do material já produzido (ai_factory_docs/ARCHITECTURE_OVERVIEW.md, task-pack M0).

1. Objetivo

Construir uma AI Factory: infraestrutura de engenharia assistida por agentes onde um control loop junta contexto (o que o agente precisa saber), roteamento de modelos (qual modelo executa) e execução, com agentes trabalhando em workspaces isolados e auditáveis e gates de aprovação humana no caminho crítico.

2. Componentes e responsabilidades

ComponentePlanoResponsabilidade
small-pineruntime agentico + Fleet Providerobserve / plan / act / verify; pede capabilities ao router; não conhece hardware/provider; gerencia frota própria (Slurm/vLLM, porta 8080)
small-routerExecution / Decision Planerouter canônico — qual modelo/provider executa (rótega, health, retry, fallback, policy)
context-graph-engineContext Planeo que o agente precisa saber (index/ger força atual: 745 nós, 1084 arestas)
spark infraResource PlaneGPU, nós, fila, serving (vLLM sob Slurm)
orchestrator (novo)Control Loopjunta contexto + tarefa + execução; guarda de segurança/orçamento, nunca escolhe modelo

Relações canônicas

DEV-MACHINE
   |  Git / API / SSH / human control
   v
AI FACTORY
   +-- small-pine ----------------------> small-router
   |      contexto via context-provider    |  providers: own-fleet / serverless
   |      frota própria via factory.slurm   v
   +-- context-graph-engine           small-pine (porta 8080, Slurm/vLLM)
   +-- orchestrator (control loop)
   +-- infra / deploy / evals / .ai-factory

3. Fronteira da dev-machine (decisão formal)

A dev-machine está fora do monorepo da AI Factory e fora do refactor.

É apenas:

Dentro da AI Factory: small-pine, small-router, context-graph-engine, small-infer/infra dos Sparks, deploy, evals, docs, .ai-factory/.

Fora: dev-machine, dotfiles pessoais, credenciais locais, estado de sessão dos desenvolvedores, configuração específica do editor, tooling pessoal.

4. Política de modelos

Matriz inicial de modelos / capabilities

ModeloBackendEstadoRoleCapabilities
Qwen3-Coder-30B-A3B-InstructSpark 01warm / primary / privatecodingcoding, repo-analysis, fast-edit, tests, tool_use
DeepSeek-V4-Flashserverlesson-demandreasoning/arch/reviewreasoning, architecture, review, long-context, hard-coding
Qwen3.7-Plusserverlesson-demandgeneral/fallbackgeneral, synthesis, fallback
Spark 02não congelar ainda(a medir)

Spark 02: decidir após medir VRAM, latência, throughput, concorrência e interconnect; então escolher entre réplica do Qwen, segundo modelo local ou serving distribuído.

Política de routing por tier

O agente pede capabilities, não nomes de modelos. small-router escolhe.

5. Princípios

  1. O agente pede capabilities; não escolhe diretamente um modelo.
  2. small-pine não conhece hardware/provider específico.
  3. small-router centraliza routing.
  4. Código privado permanece em backends autorizados.
  5. Nenhum agente ganha acesso amplo por padrão.
  6. Mudanças agenticas acontecem em workspaces isolados.
  7. Nada novo entra no caminho crítico sem justificar impacto no objetivo.

6. Estado atual e encaminhamento

(arquitetura/escopo, inventário read-only, monorepo, refactor small-pine, integração small-router, registry/routing declarativo, context-graph). Pendentes: M5, M7, M8, M9, M12, M13, M14, M15/M15b. Próximo: M5 (decisão A/B/C reaberta com dados; caderno ai-factory-task-pack/M5-medicoes-spark02-2026-09.md — T2.C medida, T2.A/T2.B suspensas pelo slurmctld failed no head desde 2026-08-21).

agora são repos independentes (~/dev/small-router, ~/dev/context-graph-engine). O small-pine os consome por contrato HTTP/config, não por checkout.

abaixo e o detalhamento em docs/open-work.md.

componente com milestone próprio, pois não era executado por nenhum M antes.

Roadmap consolidado (M0–M14)

MilestoneAssunto (canônico)Origem de conteúdo mergeada
M0arquitetura/escopo e fronteira dev-machineai_factory_docs/ARCHITECTURE_OVERVIEW.md (derivou daqui)
M1inventário read-onlyai_factory_docs/tasks/M1-inventario-real.md (relacionado)
M2monorepoai_factory_docs/tasks/M2-consolidar-monorepo.md (relacionado)
M3refactor estrutural do small-pineai_factory_docs/tasks/M3-refactor-small-pine.md (equivalente)
M4integração small-router (gateway)FASE3 (provider openai / small-infer)
M5model fabric (warm vs serverless)— (assunto novo do task-pack)
M6model registry / routing declarativoFASE4 (roteamento por tier/tool_calling)
M7agent workspace seguroai_factory_docs M5 (sandboxing)
M8papéis (roles)ai_factory_docs M8 (roles)
M9workflow agenticoai_factory_docs M6 (workflow)
M10primeiro refactor realai_factory_docs M7 (primeiro refactor)
M11context-graph integrationFASE1 (Context Contract / envelope / perfil)
M12evals / regressãoai_factory_docs M8 (medição/estabilização)
M13autoengenharia controlada
M14orquestrador fino (Control Loop)FASE2 (novo — buraco do roadmap)

Os docs legados ai_factory_docs/ (com os M0–M8 antigos, cuja numeração divergia do M5 em diante) foram arquivados em backup/ai_factory_docs/ para eliminar a fonte duplicada.