Geração de prompts de texto para imagem impulsionada por LLM com Milvus
A História de Fundo
Desde que encontrei os primeiros sistemas de IA de código aberto para geração de imagens, apaixonei-me pelo seu potencial de criar imagens visualmente atraentes a partir de texto. Também vi que as pessoas que usam essa tecnologia obtêm uma vantagem significativa — elas têm mais tempo para serem criativas e gerar prompts melhores do que eu consigo.
Eu não conseguia me livrar dessa sensação. Então, comecei a pesquisar em páginas da web para encontrar imagens legais e os prompts que as criaram. Depois, usei esses prompts para criar minhas próprias imagens. Isso me ajudou a obter prompts melhores, mas levou muito tempo. E, mesmo assim, eu ainda tinha dificuldade porque não conseguia criar novos prompts rapidamente e de forma independente.
Eu não descobri tudo totalmente sozinho porque ainda precisava de ajuda. Mas adivinha? Encontrei uma forma de acelerar meu processo. Baixei milhões de prompts e os coloquei em um banco de dados vetorial Milvus. Então, criei uma forma de buscar resultados semelhantes com base em prompts simples inseridos em uma UI.
Esses prompts resultaram em imagens incríveis. Um usuário que testou os prompts até descobriu que eles produziam resultados melhores do que o que ele fazia antes com seus prompts comuns. Ele então combinou seus prompts negativos com o sistema que criei para gerar as imagens que queria. Mesmo sem os prompts negativos, ele descobriu que podia usar o sistema para criar imagens de alta qualidade.
Ambas as imagens têm a mesma seed e usam o mesmo Prompt negativo.
À esquerda está o Prompt Quill Prompt
Ainda a mesma seed, mas sem Prompt negativo
Ambas as imagens perdem qualidade, mas a Imagem da esquerda mantém a composição da imagem, bem como a pose, enquanto a imagem da direita se afasta não apenas em qualidade, mas também em pose e fundo.
Então podemos ver como o Prompt mais detalhado do prompt quill ajudou a manter a imagem próxima do que ela deveria parecer
Como o Milvus Impulsiona Minha Geração de Prompts de Texto para Imagem
Criei scripts para buscar e limpar prompts de várias fontes. Então, carrego os prompts limpos em um banco de dados vetorial. Inicialmente, experimentei o pgvector, mas descobri que era lento demais. Após uma exploração cuidadosa, escolhi o Milvus por motivos de desempenho; ele era cinco vezes mais rápido que o pgvector com quase o mesmo código.
Depois que os dados estão disponíveis no Milvus Vector Store, a diversão pode começar. Comecei apenas pedindo ao LLM para gerar alguns prompts legais. Não funcionou logo de cara. O contexto e a entrada não coincidiam. Então, fui testando até descobrir que precisava dar ao LLM algumas instruções dizendo que ele era um engenheiro de prompts e adicionei um exemplo de histórico de conversa. Isso foi suficiente para fazê-lo começar a produzir imagens maravilhosas.
Além disso, posso executar tudo isso na minha máquina local, em parte porque o Milvus consegue executar a busca vetorial muito rapidamente. A maior parte da latência vem da execução do modelo de embeddings e do LLM. A busca vetorial é tão rápida que a GPU não tem uma pausa real entre a criação do vetor de embedding e o início da produção da saída final.
E ainda não terminamos. Há muito mais a ser feito, e agora que isso está disponível, as pessoas estão adicionando prompts e novas imagens diariamente.
Aqui está um diagrama de todo o processo até agora:
Conclusão
Ao criar o Prompt Quill, acabei com uma grande quantidade de ótimos prompts em muito menos tempo do que antes. Também percebi que os prompts que meu sistema cria são mais robustos do que aqueles que as pessoas criam manualmente para modelos especiais. Esses modelos precisam de um manuseio cuidadoso e de prompts negativos especiais para criar boas imagens. Prompts negativos também tendem a melhorar a saída deste sistema, mas a quantidade de mudança nas imagens sem prompts negativos não é tão grande quanto com alguns desses prompts criados manualmente.
Roadmap
O próximo passo é adicionar a mesma função para prompts negativos. Prompts negativos têm uma influência positiva em como os prompts podem ser usados para gerar imagens. No futuro, adicionarei uma segunda etapa para fornecer prompts negativos também. Usaremos o mesmo processo atualmente usado para produzir os prompts, comparando-os com os prompts gerados no sistema.
Publiquei uma interface de usuário simples para gerar os prompts, supondo que o armazenamento vetorial esteja disponível. Vou enviar os dados do armazenamento vetorial muito em breve e adicionar os links ao meu GitHub. Gostaria de executar isso online para que as pessoas que não têm recursos de GPU também possam obter bons prompts; se você acha que poderia ajudar patrocinando uma solução de hospedagem de longo prazo, entre em contato comigo.
Alguns exemplos para os quais o sistema produziu os prompts:
Continue lendo

A Few Notes from Databricks Data + AI Summit 2026: Why the Data Layer Matters Again
James Luan shares notes from Databricks Data + AI Summit 2026 on why production AI is pushing the data layer back to the center of infrastructure.

The Real Bottlenecks in Autonomous Driving — And How AI Infrastructure Can Solve Them
Autonomous driving faces a data bottleneck. Learn how AI-native vector databases like Zilliz solve scale, cost, and insight challenges across AV pipelines.

Expanding Our Global Reach: Zilliz Cloud Launches in Azure Central India
Zilliz Cloud expands to Azure Central India. This new region helps customers meet compliance, reduce latency, and optimize cloud costs when building AI applications.


