Posts

#python #pdf #rag

LiteParse: Extração Estruturada de Informações de PDFs com Python

Se você cria pipelines de IA que leem PDFs, já conhece o dilema: alguns parsers são rápidos, mas perdem estrutura; outros preservam qualidade, porém aumentam a latência.

O LiteParse é um parser de código aberto do ecossistema LlamaIndex focado em velocidade + estrutura útil para fluxos locais.

Diferencial do LiteParse para RAG

Em RAG, qualidade de extração não é apenas extrair texto. É preservar sinais que ajudam na recuperação e no raciocínio:

Ler mais
#aws #s3 #cloud

AWS S3 Files: Monte Seu Bucket como Sistema de Arquivos e Reduza Custos

Se você já precisou manter um EFS separado só para dar acesso no estilo de sistema de arquivos a dados que já estavam no S3, sabe o quão frustrante é essa duplicação. Você paga duas vezes, sincroniza manualmente e ainda lida com problemas de consistência eventual.

A AWS acabou de lançar uma solução para isso: S3 Files.

O Que É o S3 Files?

S3 Files é um novo serviço da AWS que torna buckets S3 acessíveis como sistemas de arquivos nativos usando NFS v4.1+. Em vez de tratar seu bucket como um armazenamento chave-valor acessado via URLs s3://, você o monta como um diretório comum e usa operações POSIX normais: ls, cp, cat, echo >, qualquer coisa.

Ler mais
#python #pep #d-strings

D-Strings no Python: O Fim da Bagunça com Strings Multilinhas

Se você já precisou escrever uma string multilinha dentro de uma função ou classe em Python, sabe que a situação fica estranha rápido.

A PEP 822 propõe as d-strings (de dedent) para o Python 3.15, uma nova sintaxe que remove indentação automaticamente de strings multilinhas. Simples assim.

O problema que elas resolvem

Imagine que você precisa montar um texto dentro de uma função:

1
2
3
4
5
6
7
def gerar_email(nome: str) -> str:
    return textwrap.dedent(f"""\
        Olá, {nome}!

        Seu cadastro foi confirmado.
        Obrigado por se inscrever.
    """)

As opções que temos hoje são ruins:

Ler mais
#python #uv #package-manager

UV: Pare de Sofrer com Dependências em Python

Se você ainda usa pip + venv + pip-tools (ou Poetry) e sente que seu fluxo em Python ficou pesado demais, está na hora de conhecer o uv.

O uv é uma ferramenta da Astral (a mesma empresa por trás do Ruff) para:

  • gerenciar dependências
  • criar e sincronizar ambientes virtuais
  • travar versões com lockfile
  • executar scripts e comandos com isolamento
  • gerenciar projetos Python com uma experiência moderna

A promessa é simples: ser drasticamente mais rápido sem sacrificar a reprodutibilidade.

Ler mais
#ai #llm #prompt-engineering

Caveman Skill: Como Reduzir Tokens (e Custos) em Agentes de IA

Se você já automatizou tarefas com LLMs em produção, sabe exatamente onde dói: respostas longas demais para tarefas simples.

Em muitas rotinas de engenharia, você não precisa de três parágrafos de cordialidade para descobrir se há um bug em uma função. Você precisa de:

  • diagnóstico rápido;
  • contexto mínimo;
  • ação recomendada.

Esse é o problema que o Caveman resolve muito bem.

O que é o Caveman?

O Caveman é uma skill/plugin para agentes de IA (como Claude Code e Copilot) que força um estilo de resposta extremamente direto, com menos floreio e menos tokens.

Ler mais
#python #alembic #sqlmodel

Alembic e SQLModel: Migrações de Banco de Dados em Python

Se você já trabalhou com bancos de dados em Python, provavelmente conhece a dor de gerenciar mudanças de schema. Adicionar uma coluna aqui, modificar um tipo ali, criar um índice acolá… e de repente você não sabe mais qual é o estado real do seu banco. Pior ainda: como garantir que todos os ambientes (desenvolvimento, staging, produção) estão sincronizados?

A combinação de SQLModel e Alembic resolve esse problema de forma elegante, trazendo type safety com Pydantic, a robustez do SQLAlchemy, e controle de versão para suas migrações de banco de dados. Neste artigo, você vai aprender como configurar e usar essas duas ferramentas poderosas em conjunto.

Ler mais
#ai #llm #gemma

Gemma 4: IA no Seu Bolso - Finalmente LLMs Rodando Nativamente em Smartphones

Imagine ter um modelo de linguagem com capacidades comparáveis ao GPT-4 rodando nativamente no seu smartphone, sem depender de internet, APIs pagas ou servidores na nuvem. Parece ficção científica? Não mais. Na semana passada, o Google fez algo que nenhuma outra empresa FANG teve coragem de fazer: lançou o Gemma 4, um modelo LLM verdadeiramente livre sob a licença Apache 2.0. E o mais impressionante? Ele é incrivelmente pequeno - pequeno o suficiente para rodar no seu celular ou Raspberry Pi, mas com inteligência comparável a modelos que normalmente exigiriam GPUs de datacenter.

Ler mais
#dagster #python #data-engineering

Dagster: Pensando em Dados como Assets

Se você trabalha com engenharia de dados, provavelmente já está cansado de pensar em pipelines como uma sequência de tarefas: Extract → Transform → Load. Mas e se eu te disser que essa não é a melhor forma de modelar seus dados? O Dagster revolucionou a forma como pensamos sobre orquestração de dados com um conceito simples, porém poderoso: Software-Defined Assets.

O Problema com ETL Tradicional

No modelo tradicional de ETL, pensamos em processos:

Ler mais
#python #mcp #ai

FastMCP: Crie Servidores MCP em Minutos, Não em Horas

Você já tentou criar um servidor MCP e se deparou com dezenas de arquivos de configuração, boilerplate complexo e horas de debugging antes de ver sua primeira ferramenta funcionando? O tempo de desenvolver e testar servidores MCP precisa ser rápido - afinal, a iteração ágil é fundamental quando estamos experimentando com agentes de IA. É aí que entra o FastMCP.

O Problema: A Complexidade de MCP Mata a Velocidade

Mesmo com IA gerando código (vibe coding), implementar MCP do zero significa entender dezenas de conceitos antes de testar sua primeira ferramenta:

Ler mais
#ia #llm #prompting

Prompt Engineering: Técnicas de Prompting Que Todo Desenvolvedor Deveria Conhecer

Se você está desenvolvendo com IA em 2026 e ainda não domina técnicas de prompting, você está deixando 70% da capacidade dos LLMs na mesa. Não estou exagerando - a diferença entre um prompt bem estruturado e um genérico pode ser a diferença entre uma resposta mediocre e uma solução de nível produção.

Depois de trabalhar com diversos projetos envolvendo LLMs, percebi que a maioria dos desenvolvedores subestima o poder de um bom prompt. Vamos mudar isso hoje.

Ler mais
#programação #educação

CS50: O Melhor Curso de Programação Que Existe

Se existe um curso que mudou completamente minha forma de pensar sobre programação, este curso é o CS50: Introduction to Computer Science de Harvard. E a melhor parte? É totalmente gratuito.

Após fazer dezenas de cursos pagos ao longo da minha carreira, posso afirmar com toda certeza: o CS50 é melhor que 99% dos cursos pagos que já vi por aí. E quando falo de cursos brasileiros, nenhum chega nem perto.

Ler mais
#ia #desenvolvimento #vibe-coding

Vibe Coding: O Perigo de Depender Cegamente de IA para Programar

É 2h da manhã. Seu telefone vibra com aquele padrão específico que você configurou para alertas de produção. Em uma década de plantão, você aprendeu que nada de bom acontece às 2 da manhã. A mensagem de alerta confirma seus medos: tráfego de rede incomum, endereços IP suspeitos. O novo código de processamento de pagamentos gerado por IA, implantado apenas horas antes, está falhando espetacularmente.

Esta é a história real (embora fictícia) documentada no artigo “No Vibe Coding While I’m On Call”, que expõe os perigos de uma tendência que está varrendo a indústria de tecnologia: vibe coding.

Ler mais
#python #segurança #supply-chain

Protegendo Seus Projetos Python Contra Ataques à Supply Chain

Se você acompanha as notícias sobre segurança em Python, provavelmente já ouviu falar dos ataques recentes que comprometeram diversas bibliotecas populares no PyPI. Pacotes legítimos foram sequestrados, versões maliciosas foram publicadas, e desenvolvedores ao redor do mundo instalaram código comprometido sem nem perceber.

O mais assustador? Isso pode acontecer com qualquer um de nós, a qualquer momento.

O Que Está Acontecendo?

Nos últimos meses, vimos um aumento alarmante em ataques do tipo “supply chain” no ecossistema Python:

Ler mais
#postgresql #banco-de-dados #data-engineering

Pare de Complicar: PostgreSQL é Tudo Que Você Precisa em 2026

Pense no seu banco de dados como se fosse sua casa. Sua casa tem sala de estar, quarto, banheiro, cozinha e garagem. Cada cômodo serve um propósito diferente. Mas todos estão sob o mesmo teto, conectados por corredores e portas. Você não constrói um restaurante separado só porque precisa cozinhar. Você não constrói uma garagem comercial do outro lado da cidade só para estacionar seu carro.

É isso que o PostgreSQL é. Uma casa com muitos cômodos. Busca textual, vetores, séries temporais, filas — tudo sob o mesmo teto.

Ler mais
#duckdb #data-engineering #analytics

Você Não Precisa de um Data Warehouse: DuckDB é o Suficiente

Deixe-me adivinhar: você tem dados em CSV ou Parquet no S3, ou talvez em uma pasta local. E alguém na sua empresa já sugeriu que vocês precisam de um “data warehouse moderno” como Snowflake ou BigQuery. Afinal, “precisamos escalar”, “precisamos de performance”, “precisamos de uma solução enterprise”.

E com isso vem: configuração de VPC, gerenciamento de credenciais, políticas de IAM, controle de custos, otimização de queries, particionamento de tabelas, e uma conta que pode facilmente chegar a milhares de dólares por mês.

Ler mais
#python #ai #apis

MCP Brasil: Conectando IA a 41 APIs Públicas Brasileiras

Imagine poder perguntar a um agente de IA “Quais foram os 10 maiores contratos do governo federal em 2024?” ou “Qual a tendência da taxa Selic nos últimos 12 meses?” e receber respostas precisas baseadas em dados oficiais do governo brasileiro. Isso agora é possível com o MCP Brasil, um projeto open-source que conecta agentes de IA como Claude, GPT e GitHub Copilot a 41 APIs públicas brasileiras.

O que é MCP Brasil?

MCP Brasil é um MCP Server (Model Context Protocol) que oferece acesso estruturado a dados governamentais brasileiros através de 326 ferramentas, cobrindo 11 áreas temáticas:

Ler mais
#python #llm #ai

Geração de Textos com Referências usando LLMs

A geração de texto com modelos de linguagem grandes (LLMs) tem revolucionado a forma como criamos conteúdo. No entanto, um dos maiores desafios é garantir que as informações geradas sejam verificáveis e confiáveis. Neste artigo, vou mostrar uma técnica universal para gerar qualquer tipo de conteúdo estruturado com referências verificáveis, combinando busca avançada (Tavily) com LLMs. Usarei biografias como exemplo prático, mas a técnica se aplica a relatórios, artigos, análises e qualquer outro conteúdo baseado em fatos.

Ler mais
#python #dagster #dados

Dask, Dagster e Coiled para Processamento de Dados em Produção na OnlineApp

Neste artigo irei mostrar uma integração simples entre o Dagster e o Dask+Coiled. Discutiremos como isso tornou um problema comum, processar um grande conjunto de arquivos mensalmente, realmente uma tarefa muito fácil.

O Usuário e o Problema

Olá👋, me chamo Lucas, sou o líder do time de ciência e engenharia de dados na OnlineApp, uma empresa B2B que atende o mercado brasileiro.

Todo mês, o governo brasileiro publica um grande conjunto de arquivos CSV com informações sobre empresas brasileiras, que usamos para entender melhor o nosso mercado. Temos muitos serviços internos que desejam ler esses dados, mas antes que isso seja possível, precisamos pré-processar um pouco eles: - Filtrar algumas linhas e colunas que não nos interessam; - Limpar alguns valores em várias colunas; - Realizar junções com outros conjuntos de dados internos que temos; - Converter para Parquet e armazenar em nosso próprio armazenamento em cloud;

Ler mais
#ia

Inteligência Artificial e o Fim do Cyberbullying: O Efeito Bolha do TikTok

A inteligência artificial (IA) permeia quase todos os aspectos da vida moderna, desde os sistemas de reconhecimento de voz e tradução de idiomas até os algoritmos de recomendação de produtos online e conteúdo de mídia social.

Com o avanço da IA, as redes sociais tornaram-se plataformas muito mais personalizadas e isoladas, onde a experiência de cada usuário é moldada pelos seus próprios interesses e comportamentos. Um exemplo claro disso é o TikTok, que utiliza IA para criar esta “bolha” individualizada para cada usuário.

Ler mais
#blog

Porque eu Recusei uma Oportunidade de Doutorado em uma Universidade Federal

Como todo o estudante de graduação no Brasil, eu sempre fui incentivado e sonhei em seguir carreira acadêmica. Afinal, essa é uma das opções mais “respeitadas” em nosso país: todo mundo quer ser chamado de “Dr.”. Em que muitas áreas inclusive às vezes se valoriza mais o título do que a experiência prática.

Porém, recentemente, eu recusei uma proposta de doutorado em uma das maiores universidades federais do país e decidi seguir um caminho diferente, e sinceramente estou feliz que tomei essa decisão.

Ler mais
#python #dbt #database

Adeus DBT: Como Orquestrar Seu Banco de Dados com Dagster Assets

Gerenciar o schema de tabelas e views em bancos de dados com rastreabilidade (controle de versões) e confiabilidade é um problema que várias ferramentas já tentaram resolver ao longo dos anos. No mundo do desenvolvimento de software, atualmente a abordagem mais comum é utilizar algum tipo de ORM (Object-Relational Mapping), que mapeia as estruturas de dados presentes no seu código (classes geralmente) para tabelas no banco de dados.

Alguns exemplos famosos são: Entity Framework no C#, SQLAlchemy no Python e o Prisma no Node.js.

Ler mais
#ia

DAN, a Nova e Mais Perigosa Falha de Segurança do ChatGPT

Uma das principais preocupações da empresa responsável pelo ChatGPT, a OpenIA, e talvez a maior preocupação dentre as empresas que estão desenvolvendo ferramentas de “chat bot” é justamente as respostas geradas por seus modelos, garantir sua confiabilidade e imparcialidade. Porem, infelizmente, devido à natureza de como o modelo foi construído, este tipo de moderação é extremamente difícil de ser implementada, segundo os próprios criadores:

“Embora tenhamos feito esforços para fazer com que o modelo recuse solicitações inapropriadas, às vezes ele responde a instruções prejudiciais ou exibe um comportamento tendencioso. Estamos usando uma API de moderação para avisar ou bloquear certos tipos de conteúdo inseguro, mas esperamos que haja alguns falsos negativos e positivos por enquanto. Estamos ansiosos para coletar feedback do usuário para ajudar nosso trabalho contínuo para melhorar este sistema.” - OpenIA

Ler mais
#python #dados

Great Expectations, Valide a Qualidade De Seus Dados Com Expectativas

Todos sabemos que garantir e validar a qualidade de dados é uma tarefa que hoje em dia ainda é extremamente trabalhosa na grande maioria dos casos, e é este problema que o Great Expectations visa resolver. Hoje vamos falar sobre essa incrível ferramenta de data quality.

Introdução

A biblioteca “Great Expectations”: feita em Python, é uma ferramenta poderosa para validação de dados. Ela permite que você defina expectativas sobre como seus dados devem se parecer e, em seguida, verifique se essas expectativas são atendidas. Isso serve para garantir a qualidade dos dados antes de prosseguir com análises ou modelagem.

Ler mais
#python #ia

Analisando Microexpressões Faciais em Python

Você já deve ter ouvido falar de microexpressões faciais, a ideia é que a partir delas conseguimos extrair informações valiosas sobre como uma pessoa está pensando, sentindo e o que planeja fazer.

Inovações recentes em algoritmos de visão computacional e aprendizado profundo levaram a uma enxurrada de modelos que podem ser usados para extrair pontos de referência faciais, unidades de ação e microexpressões faciais com velocidade e precisão.

Hoje iremos conhecer uma dessas soluções em Python.

Ler mais
#python #dagster #coiled

Isso Vai Ser O Fim do Spark! Dask & Coiled a Forma Mais Fácil de Criar Clusters em Python

Recentemente estava trabalhando na arquitetura de um novo projeto de um pipeline de dados, tudo corria bem, até que o pior pesadelo de todo o engenheiro de dados que esta trabalhando com Pandas aconteceu: meu dataset era simplesmente muito grande para ser armazenado em memória (ele continha cerca de 100 GB).

A solução para este tipo de problema já é conhecida no universo de dados (e condizente com meu contexto), clusterização! Porem uma dúvida surgiu…

Ler mais
#python #ia #dados

5 Livros Que Todo o Cientista de Dados Deve Ler

Já teve dificuldades para escolher bons livros para ler relacionados ao universo de dados? Já se decepcionou com algum livro cujo conteúdo parece ter sido tirado da Wikipédia? Bom: eu sim!

Por isso, após varias noites de leituras decepcionantes e dezenas de compras frustradas, decidi fazer esse top 5 com os melhores livros que já li e que, na minha opinião, são os melhores da área de dados.

1 - Mãos à obra: aprendizado de máquina com Scikit-Learn, Keras & TensorFlow

imagem

Ler mais
#python #api #dados

Como Validar e Tratar JSON em Python

Todos nos já tivemos que lidar com dados em formato JSON pelo menos alguma vez, seja utilizando uma API ou até mesmo lendo diretamente de algum arquivo e como consequência disso acredito que a: maioria de nós já se deparou com erros relacionados a qualidade ou formatação dos dados contidos nele.

Neste artigo irei compartilhar duas abordagens que gosto de utilizar quando estou trabalhando com este tipo de dado em Python.

Ler mais
#dados #ia #dashboard

Como Fazer Uma Análise Exploratória Em Um Dataset De Vendas De Produtos

Todos já nos sentimos um pouco perdidos quando temos que analisar dados de vendas de produtos, neste artigo irei mostrar algumas técnicas que gosto de utilizar quando me deparo com análises deste tipo.

Entenda seus dados

O mais importante para qualquer tipo de análise de dados é o entendimento do contexto: daqueles dados, oque cada coluna ou campo significa. Em um mundo perfeito e hipotético, essas informações serão fornecidas para você por algum stakeholder: (parte interessada, ou cliente).

Ler mais
#gestao

Scrum Não Faz O Menor Sentido Para Cientistas De Dados

Eu sei, o título é polêmico, porém acredito que seja necessário para fomentar a discussão, além também de resumir bem a ideia central deste artigo. Que é justamente esta, Scrum não faz o menor sentido para cientistas de dados e você não deveria obrigá-los a usá-la.

“O Scrum é uma estrutura leve que ajuda pessoas, equipes e organizações a gerar valor por meio de soluções adaptáveis ​​para problemas complexos.” - Scrum Guide

Ler mais
#sql #database #dados

Clickhouse, O Banco De Dados Mais Rápido Do Mundo Que Você Provavelmente Não Conhece

Enfrentar problemas para analisar grandes volumes de dados não deve ser uma novidade para ninguém hoje em dia. Porem muitas pessoas não sabem mas já existem soluções para esse problema, uma delas é o banco de dados ClickHouse. Neste artigo iremos dar uma olhada nas duas principais categorias de bancos de dados existentes e também nos aprofundar um pouco em como o ClickHouse funciona.

Como citado anteriormente, hoje em dia existem duas grandes classificações para bancos de dados, sendo elas as seguintes:

Ler mais
#docker #python #git

Tchau Tchau Airflow, Olá Dagster

No dia 9 de agosto de 2022 o Dagster finalmente anunciou o lançamento da sua versão 1.0 indicando que o orquestrador finalmente esta pronto para produção. Mas oque é Dagster? Segundo eles:

“Crie e realize o deploy de pipelines de dados com velocidade extraordinária. O orquestrador nativo da nuvem para todo o ciclo de vida de desenvolvimento, com linhagem e observabilidade integradas, um modelo de programação declarativo e a melhor testabilidade da categoria.”

Ler mais