|
PT-BR |
Atuo na intersecção entre o desenvolvimento de software e a engenharia de Machine Learning, com foco profundo no ecossistema de Large Language Models (LLMs). Minha especialidade cobre o ciclo completo de IA (end-to-end): desde a exploração de arquiteturas, técnicas de otimização e fine-tuning (PEFT, QLoRA), até a construção das aplicações e interfaces que conectam esses modelos aos usuários finais.
Atualmente, lidero a engenharia e o desenvolvimento da NeveAI — uma plataforma de IA local privacy-first para execução de LLM offline de alta performance, sem dependência de APIs ou serviços externos. Em paralelo, sou contribuidor e pesquisador na organização NeveAI, desenvolvendo infraestrutura e colaborando em projetos open-source voltados para o avanço da Inteligência Artificial.
|
EN-US |
I operate at the intersection of software engineering and Machine Learning, focusing deeply on the Large Language Models (LLMs) ecosystem. My expertise covers the end-to-end AI lifecycle: from exploring architectures, optimization techniques, and fine-tuning (PEFT, QLoRA), to building the applications and interfaces that connect these models to end-users.
Currently, I lead the engineering and development of Neve AI — a privacy-first local AI platform for high-performance offline LLM execution, with no dependence on external APIs or services. In parallel, I am a researcher and contributor at the NeveAI organization, developing infrastructure and collaborating on open-source projects aimed at advancing Artificial Intelligence.
| Frontend | Backend | DevOps |
|
|
|
|
| Design | Gamedev | |
|
|
|
|
Architecture: MTP | Context: 256K | Status: Post-Trained
Resultados comparativos evidenciando a evolução do modelo Neve em relação aos baselines de mercado.
| Benchmark (Evals) | Qwen3.5 27B | Gemma4 31B | Qwen3.5 35B | NeveStrata 35B (Meu fine-tune) |
|---|---|---|---|---|
| Coding & General Agents (Repositórios e Ferramentas) | ||||
| SWE-bench Verified | 75.0 | 52.0 | 70.0 | 73.4 |
| Terminal-Bench 2.0 | 41.6 | 42.9 | 40.5 | 51.5 |
| QwenWebBench | 1068 | 1197 | 978 | 1397 |
| MCP-Atlas | 68.4 | 57.2 | 62.4 | 62.8 |
| STEM & Deep Reasoning (Lógica e Matemática) | ||||
| LiveCodeBench v6 | 80.7 | 80.0 | 74.6 | 80.4 |
| AIME 26 | 92.6 | 89.2 | 91.0 | 92.7 |
| GPQA | 85.5 | 84.3 | 84.2 | 86.0 |
| Vision & Spatial Intelligence (OCR e Documentos) | ||||
| MMMU | 82.3 | 80.4 | 81.4 | 81.7 |
| RealWorldQA | 83.7 | 72.3 | 84.1 | 85.3 |
| OmniDocBench1.5 | 88.9 | 80.1 | 89.3 | 89.9 |
LLM: llama.cpp | Backend: FastAPI | Frontend: SvelteKit 2 | RAG: ChromaDB
Visão geral dos principais módulos de inferência local, processamento multimodal, recuperação de conhecimento e integração da plataforma.
| Domínio da Arquitetura | Especificações e Tecnologias Suportadas |
|---|---|
| Inteligência & Inferência Local | |
| Motor de LLM | Inferência local baseada em llama.cpp, com carregamento dinâmico de modelos GGUF, streaming de respostas em tempo real via WebSocket e inicialização automática do servidor de inferência ao selecionar um modelo. |
| Raciocínio & Contexto | Modos de resposta configuráveis entre execução rápida e raciocínio, contador de tokens com indicação visual de uso de contexto e carregamento automático de modelos conforme a necessidade da conversa. |
| Processamento Multimodal | Suporte a modelos multimodais por projeções mmproj com detecção automática de compatibilidade. Entrada de PDFs, documentos, apresentações, planilhas, imagens, áudio, vídeo e arquivos de código. |
| RAG, Conhecimento & Ferramentas | |
| Retrieval-Augmented Generation | Motor RAG local utilizando ChromaDB, embeddings via sentence-transformers ou API e recuperação híbrida combinando busca semântica com BM25. |
| Processamento de Documentos | Extração e indexação de conteúdo para bases de conhecimento, incluindo OCR de PDFs e imagens digitalizadas via RapidOCR. |
| Web, Código & MCP | Busca na web integrada via SearXNG sem necessidade de chave de API, execução de código Python no navegador através de Pyodide e suporte ao Model Context Protocol (MCP) v1.26 para integração com ferramentas externas. |
| Geração Multimídia & Experiência | |
| Geração de Imagens | Geração local de imagens utilizando Neve-Image-Turbo em quantização Q4_0, com Encoder e stable-diffusion.cpp, otimizada para execução em 8 steps. |
| Geração de Música | Geração local de músicas através do Neve-Step 1.5 Turbo, com suporte a orientação de estilo e criação de letras em português. |
| Interface & Artefatos | Frontend desenvolvido em SvelteKit 2 e Svelte 5 com Tailwind CSS 4.2.1, incluindo histórico organizado em pastas, projetos, tema claro/escuro e painel dedicado para código, gráficos e HTML renderizado. |
| Runtime & Persistência Local | |
| Backend & API | Backend baseado em FastAPI, Uvicorn e Python 3.11/3.12, responsável por chat, modelos, áudio, imagens, RAG, WebSockets e entrega do frontend compilado através da porta padrão 8080. |
| Persistência | Banco de dados local SQLite utilizando SQLAlchemy e Alembic, com armazenamento de dados de runtime, uploads, cache, histórico e base vetorial diretamente na instalação local. |
| Instalação & Hardware | Instalador automatizado para Windows com detecção de GPUs NVIDIA, AMD ou execução em CPU, seleção automática dos binários apropriados do llama.cpp, criação do ambiente Python e build completo do frontend. |
| Empresa | |
|
|















