Modelos locais — Playbook¶
Projeto: PD Framework Squad: stamper Repo: C:\dev\pd-framework Branch merged: N/A — documentacao operacional em branch de sessao Issues: N/A
O que essa feature entrega¶
Registra a opcao local de LLMs via Ollama para o notebook do Felipe. O objetivo e permitir testes locais com harnesses como OpenCode sem reaprender quais modelos rodam, quais aquecem demais e quais nao servem para agente. O default operacional fica sendo qwen3:4b-8k.
Como usar¶
- Abrir ou manter o Ollama rodando no Windows.
- Usar
qwen3:4b-8kcomo modelo local default. - Para chat direto, rodar
ollama run qwen3:4b-8k. - Para teste OpenCode, rodar
opencode run --pure -m ollama/qwen3:4b-8k "Responda exatamente: OK local". - Depois de testes pesados, conferir
ollama pse descarregar modelos comollama stop <modelo>se necessario.
Como manter¶
Editar primeiro os arquivos em C:\dev\pd-framework\docs\modelos-locais\. Se mudar modelo, contexto, hardware ou resultado de benchmark, atualizar tambem CLAUDE.md e regenerar AGENTS.md via python adapters\codex\bootstrap.py. Aliases 8K sao recriados pelos Modelfiles ollama-qwen3-4b-8k.Modelfile e ollama-qwen3-8b-8k.Modelfile.
Decisoes importantes¶
- Ollama e o runtime local principal em Windows para notebook.
- SGLang nao e default: e melhor para serving dedicado, batching e workloads de infra.
qwen3:4b-8ke o default local porque ficou em GPU e contexto controlado.qwen3:8b-8kroda, mas e mais pesado e cai parcialmente em CPU.gemma3:4bserve para chat simples, mas nao para OpenCode agent por falta de tools.
Refs tecnicas¶
- Docs componentes:
C:\dev\pd-framework\docs\modelos-locais\ - cadencia-docs (fonte de verdade):
docs/_pd-framework/framework-interno/Modelos locais.md - Config OpenCode:
C:\dev\pd-framework\opencode.json - Canvas:
Modelos locais.canvas