#modelos-locais
11 posts
2026 - junho
1 post2026 - abril
2 posts2026 - março
1 post2026 - janeiro
1 post2025 - abril
5 posts- Dissecando um Modelfile de Ollama - Ajustando Qwen3 pra código
- Seu Próprio Co-Pilot Gratuito Universal que funciona Local: AIDER-OLLAMA-QWEN
- Hello World de LLM: criando seu próprio chat de I.A. que roda local
- Mudando roupas usando I.A. (ComfyUI)
- Usando I.A (ComfyUI) pra gerar NPCs em desenvolvimento de games
2023 - junho
1 post2026 - junho
1 postLLM Benchmark: Kimi v2.7 code, GLM 5.2, Minimax M3 local
No benchmark, GLM 5.2 marcou 87 e Kimi K2.7 Code, 86. O MiniMax M3 aberto não cabe em 128 GB, enquanto programação séria ainda pede Opus 4.8 ou GPT 5.5.
2026 - abril
2 postsComo a ElevenLabs Não Foi Morta pelo Qwen3 TTS
Quando o Qwen3 TTS saiu, meio mundo disse que era 'ElevenLabs killer'. Passei semanas tentando rodar o Qwen3 em produção no meu podcast. Ontem finalmente troquei pra ElevenLabs v3. Quase um dia depois, posso dizer: o open source ainda tá muito longe.
Testando LLMs Open Source e Comerciais - Quem Consegue Bater o Claude Opus?
Este benchmark histórico comparou 33 LLMs num app Rails: Opus, Sonnet e GLM 5 funcionaram, enquanto Qwen 3.6 35B chegou perto na RTX 5090 após uma correção. Os rankings foram depois revisados.
2026 - março
1 postReview: Minisforum MS-S1 Max | AMD AI Max+ 395 com 96GB de VRAM
Nos meus testes, a RTX 5090 foi até 7 vezes mais rápida nos modelos que cabem em 32GB. O Minisforum, porém, rodou modelos de 50 a 81GB que a placa não comporta.
2026 - janeiro
1 postAI Agents: GLM 4.7 Flash é realmente tão bom assim?
Rodei o GLM 4.7 Flash localmente numa RTX 5090 e ele foi o único modelo open source a compilar o desafio de Zig. O comportamento foi bom, mas ampliar o contexto o deixou até 20 vezes mais lento.
2025 - abril
5 postsDissecando um Modelfile de Ollama - Ajustando Qwen3 pra código
Expliquei como temperature, top_p, top_k, min_p e repeat_penalty mudam a geração de tokens e criei um Modelfile para o Qwen3. Com temperatura baixa, o 14B gerou código rápido e utilizável.
Seu Próprio Co-Pilot Gratuito Universal que funciona Local: AIDER-OLLAMA-QWEN
Configurei o Aider com APIs comerciais e Ollama, mostrando watch-files, modo arquiteto e prompts. O fluxo local funciona bem para mudanças pequenas, desde que alguém revise tudo e evite commits automáticos.
Hello World de LLM: criando seu próprio chat de I.A. que roda local
Construí o Tiny Qwen CLI para explicar, na prática, como um LLM tokeniza contexto, gera o próximo token e usa parsers e scripts externos para ler arquivos e buscar páginas, formando agentes.
Mudando roupas usando I.A. (ComfyUI)
Montei um workflow ComfyUI com IDM-VTON e IPAdapter para trocar roupas mantendo rosto e pose. Funciona melhor com peças parecidas, mas exige mais de 20 GB de VRAM e ainda tem glitches.
Usando I.A (ComfyUI) pra gerar NPCs em desenvolvimento de games
Testei o workflow pago de Mickmumpitz no meu setup Docker: uma RTX 4090 leva cerca de 30 minutos para gerar character sheets coerentes, com 500 GB de espaço e ajustes manuais.
2023 - junho
1 post[Akitando] #142 - Entendendo COMO ChatGPT Funciona - Rodando sua Própria IA
Rodei um Vicuna 30B localmente e mostro como transformers geram texto por probabilidades, com limites de contexto, custo e escala. Hoje, servem como auxílio, mas não são AGI nem substituem programadores.