{"id":617,"date":"2026-08-04T15:25:07","date_gmt":"2026-08-04T18:25:07","guid":{"rendered":"https:\/\/carloslopes.programandosolucoes.com.br\/index.php\/portfolio-airllm\/"},"modified":"2026-08-05T17:05:53","modified_gmt":"2026-08-05T20:05:53","slug":"portfolio-airllm","status":"publish","type":"page","link":"https:\/\/carloslopes.programandosolucoes.com.br\/it\/index.php\/portfolio-airllm\/","title":{"rendered":"Servidor de LLM de 235B em GPU de 6 GB"},"content":{"rendered":"<style>\n.pf-wrap{max-width:1100px;margin:0 auto;font-size:16px;line-height:1.65}\n.pf-chamada{font-size:1.15rem;opacity:.85;margin:0 0 2rem}\n.pf-grade{display:grid;grid-template-columns:repeat(auto-fill,minmax(300px,1fr));gap:1.5rem}\n.pf-card{border:1px solid rgba(128,128,128,.3);border-radius:10px;overflow:hidden;display:flex;flex-direction:column;transition:transform .15s ease,box-shadow .15s ease}\n.pf-card:hover{transform:translateY(-3px);box-shadow:0 8px 24px rgba(0,0,0,.12)}\n.pf-card img{width:100%;height:180px;object-fit:cover;display:block;background:rgba(128,128,128,.12)}\n.pf-card-corpo{padding:1rem 1.1rem 1.2rem;display:flex;flex-direction:column;gap:.6rem;flex:1}\n.pf-card h3{margin:0;font-size:1.05rem;line-height:1.35}\n.pf-card p{margin:0;font-size:.92rem;opacity:.85;flex:1}\n.pf-chips{display:flex;flex-wrap:wrap;gap:.35rem}\n.pf-chip{font-size:.75rem;padding:.18rem .55rem;border-radius:999px;border:1px solid rgba(128,128,128,.35);opacity:.9}\n.pf-meta{font-size:.8rem;opacity:.7}\n.pf-cadeado{font-size:.8rem;opacity:.75}\n.pf-hero{margin:0 0 1.5rem}\n.pf-hero h1{margin:0 0 .4rem;line-height:1.2}\n.pf-secao{margin:2rem 0}\n.pf-secao h2{font-size:1.15rem;margin:0 0 .6rem;text-transform:uppercase;letter-spacing:.06em;opacity:.75}\n.pf-galeria{display:grid;gap:1.2rem;margin:2rem 0}\n.pf-galeria figure{margin:0}\n.pf-galeria img{width:100%;border:1px solid rgba(128,128,128,.3);border-radius:8px;display:block}\n.pf-galeria figcaption{font-size:.85rem;opacity:.75;margin-top:.4rem}\n.pf-repo{border:1px solid rgba(128,128,128,.35);border-left-width:4px;border-radius:8px;padding:1rem 1.2rem;margin:2rem 0}\n.pf-repo h2{margin:0 0 .5rem;font-size:1rem;text-transform:uppercase;letter-spacing:.06em}\n.pf-repo pre{background:rgba(128,128,128,.12);padding:.7rem .9rem;border-radius:6px;overflow-x:auto;margin:.6rem 0;font-size:.85rem}\n.pf-contato{margin:2rem 0;padding-top:1.2rem;border-top:1px solid rgba(128,128,128,.3);font-size:.95rem}\n.pf-voltar{display:inline-block;margin-bottom:1rem;font-size:.9rem}\n@media (max-width:600px){.pf-card img{height:150px}}\n<\/style>\n<div class=\"pf-wrap\">\n  <a class=\"pf-voltar\" href=\"\/index.php\/portfolio-backend\/\">\u2190 voltar ao portf\u00f3lio<\/a><\/p>\n<header class=\"pf-hero\">\n<p class=\"pf-meta\">07\/2026 \u00b7 2 semanas<\/p>\n<p>Servidor local compat\u00edvel com a API da OpenAI que roda modelos de 235B em GPU modesta, carregando uma camada por vez.<\/p>\n<div class=\"pf-chips\"><span class=\"pf-chip\">Python<\/span><span class=\"pf-chip\">FastAPI<\/span><span class=\"pf-chip\">PyTorch<\/span><span class=\"pf-chip\">AirLLM<\/span><span class=\"pf-chip\">Transformers<\/span><span class=\"pf-chip\">CUDA<\/span><span class=\"pf-chip\">Qwen3<\/span><span class=\"pf-chip\">DeepSeek<\/span><\/div>\n<\/header>\n<section class=\"pf-secao\">\n<h2>O problema<\/h2>\n<p>Rodar um modelo de linguagem grande localmente esbarra na VRAM: um modelo de 235 bilh\u00f5es de par\u00e2metros n\u00e3o cabe em GPU de consumo, e a resposta padr\u00e3o \u00e9 alugar GPU na nuvem \u2014 o que significa mandar o texto para fora e pagar por token. Para quem quer infer\u00eancia local por privacidade ou custo, a alternativa costuma ser aceitar um modelo muito menor.<\/p>\n<\/section>\n<section class=\"pf-secao\">\n<h2>A arquitetura<\/h2>\n<p>O truque \u00e9 n\u00e3o carregar o modelo. As camadas s\u00e3o registradas no dispositivo meta, sem peso em mem\u00f3ria, e a infer\u00eancia sobe uma camada por vez para a GPU, computa e devolve para CPU ou disco. O pico de VRAM fica em 2 a 3 GB independentemente do tamanho total do modelo, trocando mem\u00f3ria por tempo e por leitura de disco. Em volta disso h\u00e1 um servidor FastAPI que fala o protocolo da OpenAI, o que permite apontar qualquer cliente existente para ele sem alterar c\u00f3digo. O servidor detecta o porte do modelo pelo identificador e escolhe a estrat\u00e9gia sozinho \u2014 compress\u00e3o em 4 bits e prefetching para os grandes, fp16 para os pequenos \u2014 porque a configura\u00e7\u00e3o errada n\u00e3o falha de imediato, apenas estoura a mem\u00f3ria no meio da infer\u00eancia. Todo o conjunto \u00e9 port\u00e1til: o Python embarc\u00e1vel \u00e9 preparado por script, as depend\u00eancias e o patch s\u00e3o aplicados sem interven\u00e7\u00e3o, e o menu de inicializa\u00e7\u00e3o escolhe o modelo.<\/p>\n<\/section>\n<section class=\"pf-secao\">\n<h2>O resultado<\/h2>\n<p>Servidor local que responde no protocolo da OpenAI rodando modelos que n\u00e3o caberiam na GPU, com monitor de sa\u00fade, download paralelo de shards e limpeza dos arquivos crus ap\u00f3s o split. A documenta\u00e7\u00e3o registra os n\u00fameros que decidem a viabilidade \u2014 1.556 GB crus em disco para o Qwen3-235B, cerca de 438 GB depois do split em 4 bits \u2014 e as armadilhas de ambiente que custaram tempo: a vers\u00e3o da biblioteca de transformers precisa ser pinada para o modelo MoE carregar, e atualizar o torch dentro do Python embarc\u00e1vel corrompe a instala\u00e7\u00e3o de um jeito que se manifesta como travamento, n\u00e3o como erro.<\/p>\n<\/section>\n<div class=\"pf-galeria\">\n<figure>\n      <img decoding=\"async\" src=\"https:\/\/carloslopes.programandosolucoes.com.br\/wp-content\/uploads\/portfolio\/airllm-01-offloading.png\" alt=\"Uma camada por vez: como um modelo de 235B roda em 6 GB de VRAM\" loading=\"lazy\"><figcaption>Uma camada por vez: como um modelo de 235B roda em 6 GB de VRAM<\/figcaption><\/figure>\n<figure>\n      <img decoding=\"async\" src=\"https:\/\/carloslopes.programandosolucoes.com.br\/wp-content\/uploads\/portfolio\/airllm-02-custo.png\" alt=\"O custo real em disco e VRAM de cada modelo configurado\" loading=\"lazy\"><figcaption>O custo real em disco e VRAM de cada modelo configurado<\/figcaption><\/figure>\n<\/p><\/div>\n<div class=\"pf-repo\">\n<h2>\ud83d\udd12 C\u00f3digo-fonte<\/h2>\n<pre><code>git clone https:\/\/git.programandosolucoes.com.br\/git\/repos\/airllm.git<\/code><\/pre>\n<p>C\u00f3digo-fonte privado. As credenciais de leitura s\u00e3o liberadas sob solicita\u00e7\u00e3o \u2014 me chame para conversar sobre o projeto.<\/p>\n<\/p><\/div>\n<div class=\"pf-contato\">\n    <strong>Carlos Alberto<\/strong> \u2014 carlosalberto4ti@gmail.com \u00b7 +55 11 2615-2880\n  <\/div>\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>\u2190 voltar ao portf\u00f3lio 07\/2026 \u00b7 2 semanas Servidor local compat\u00edvel com a API da OpenAI que roda modelos de 235B em GPU modesta, carregando uma camada por vez. PythonFastAPIPyTorchAirLLMTransformersCUDAQwen3DeepSeek O problema Rodar um modelo de linguagem grande localmente esbarra na VRAM: um modelo de 235 bilh\u00f5es de par\u00e2metros n\u00e3o cabe em GPU de consumo, [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"parent":0,"menu_order":0,"comment_status":"closed","ping_status":"closed","template":"","meta":{"footnotes":""},"class_list":["post-617","page","type-page","status-publish","hentry"],"translation":{"provider":"WPGlobus","version":"3.0.2","language":"it","enabled_languages":["en","br","it"],"languages":{"en":{"title":true,"content":true,"excerpt":false},"br":{"title":false,"content":false,"excerpt":false},"it":{"title":false,"content":false,"excerpt":false}}},"_links":{"self":[{"href":"https:\/\/carloslopes.programandosolucoes.com.br\/it\/index.php\/wp-json\/wp\/v2\/pages\/617","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/carloslopes.programandosolucoes.com.br\/it\/index.php\/wp-json\/wp\/v2\/pages"}],"about":[{"href":"https:\/\/carloslopes.programandosolucoes.com.br\/it\/index.php\/wp-json\/wp\/v2\/types\/page"}],"author":[{"embeddable":true,"href":"https:\/\/carloslopes.programandosolucoes.com.br\/it\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/carloslopes.programandosolucoes.com.br\/it\/index.php\/wp-json\/wp\/v2\/comments?post=617"}],"version-history":[{"count":1,"href":"https:\/\/carloslopes.programandosolucoes.com.br\/it\/index.php\/wp-json\/wp\/v2\/pages\/617\/revisions"}],"predecessor-version":[{"id":629,"href":"https:\/\/carloslopes.programandosolucoes.com.br\/it\/index.php\/wp-json\/wp\/v2\/pages\/617\/revisions\/629"}],"wp:attachment":[{"href":"https:\/\/carloslopes.programandosolucoes.com.br\/it\/index.php\/wp-json\/wp\/v2\/media?parent=617"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}