Criando aplicativos aumentados por LLM com o Zilliz Cloud
Nos últimos meses, o lançamento do GPT-3.5 em nov de 2022 e do GPT-4 em mar de 2023 provocou uma mudança sísmica na forma como os usuários interagem com dados e aplicações. O poder transformador do ChatGPT não reside apenas em sua capacidade de gerar texto, mas em sua compreensão surpreendente e adaptabilidade ao contexto. Ele fornece uma interface de comunicação mais natural e intuitiva, forjando uma conexão íntima entre humanos e máquinas e transformando tarefas árduas em trocas de diálogo sem esforço. Esse domínio em expansão dos Grandes Modelos de Linguagem (LLMs) mudou nossas expectativas e desejos para aplicações de software, empurrando os desenvolvedores para um futuro em que as aplicações são usadas e com elas se interage.
Desafios atuais dos LLMs em aplicações
Apesar de seu potencial, os desenvolvedores devem enfrentar os desafios que os LLMs trazem ao implementar LLMs como o ChatGPT em suas aplicações.
Primeiro, os LLMs são treinados principalmente com dados disponíveis publicamente, portanto às vezes precisam de mais nuance e contexto de informações específicas de domínio, proprietárias ou privadas. Essa falta de acesso a dados privados prejudica a capacidade do modelo de fornecer soluções ou respostas adaptadas a algumas indústrias ou aplicações especializadas.
O segundo desafio é conhecido como alucinação. Esse termo se refere à tendência dos LLMs de gerar respostas com base em dados incompletos ou imprecisos. Como os LLMs baseiam suas respostas exclusivamente nos dados com os quais foram treinados, às vezes podem criar respostas enganosas, incorretas ou completamente fabricadas quando precisam de mais informações.
Além disso, os LLMs podem ter dificuldade para se manter atualizados. Os dados de treinamento muitas vezes ficam desatualizados rapidamente e, devido aos custos significativos associados ao retreinamento desses modelos — na faixa de 1,4 milhão de dólares para modelos como o GPT-3 — sua base de conhecimento não é atualizada regularmente. Essa limitação pode fazer com que eles forneçam informações desatualizadas em suas respostas.
Do ponto de vista do desempenho, usar LLMs para aplicações pode ser caro e lento. Eles operam em um sistema de cobrança baseado em tokens, no qual LLMs como o Chat GPT cobram por cada token usado em uma consulta. O custo pode aumentar rapidamente, especialmente ao lidar com grandes volumes de consultas ou perguntas repetitivas. Além disso, problemas de desempenho podem surgir durante horários de pico de uso, levando a atrasos frustrantes. Além disso, os LLMs têm um limite rígido no número de tokens em prompts de consulta, o que restringe a complexidade e o comprimento das interações. Por exemplo, o ChatGPT-3 tem um limite de 4.096 tokens, enquanto o GPT-4 tem um limite de 8.192 tokens.
Por fim, os dados de pré-treinamento usados pelos LLMs são imutáveis. Qualquer informação incorreta ou desatualizada incluída durante a fase de treinamento persistirá, pois atualmente é necessária uma forma de modificar, corrigir ou remover esses dados após o treinamento.
À medida que avançamos ainda mais no mundo das aplicações aumentadas por LLM, é crucial abordar esses desafios. Superar os desafios é onde soluções inovadoras como Zilliz Cloud e GPTCache entram em cena, as quais exploraremos nas próximas seções.
Aumentando apps de LLM com Zilliz Cloud e GPTCache
Aproveitar todo o potencial de Grandes LLMs como o ChatGPT em aplicações envolve superar desafios críticos de precisão, atualidade das informações, eficiência de custos e desempenho, conforme discutido acima. Soluções inovadoras como Zilliz Cloud e GPTCache fornecem respostas robustas para esses problemas.
Aprimorando a precisão e a atualidade
O Zilliz Cloud traz soluções transformadoras que melhoram substancialmente a precisão das respostas geradas por LLMs e mantêm sua base de conhecimento atualizada.
Ao permitir que desenvolvedores e empresas armazenem com segurança dados privados específicos de domínio, contemporâneos e confidenciais fora dos LLMs, o Zilliz Cloud garante que as respostas sejam precisas e relevantes. Quando um usuário faz uma pergunta, as aplicações de LLM usam modelos de embedding para converter a pergunta em vetores. Em seguida, o Zilliz Cloud realiza uma busca por similaridade para oferecer os principais resultados top-k relevantes para a consulta. Esses resultados e a pergunta original formam um contexto abrangente para que o LLM gere respostas mais precisas. Essa abordagem mitiga o problema de alucinação, no qual os LLMs podem produzir informações incorretas ou inventadas devido a dados insuficientes ou desatualizados.
Como o Zilliz Cloud funciona para Retrieval Augmented Generation
Além disso, a integração do Zilliz Cloud permite atualizações regulares da base de conhecimento, garantindo que os LLMs possam sempre acessar as informações mais recentes e precisas. Esse recurso aborda o problema de os LLMs serem treinados com dados desatualizados, fornecendo aos usuários respostas que refletem os insights mais recentes.
Maximizando a eficiência de custos e o desempenho
Combinar o Zilliz Cloud com o GPTCache cria um ecossistema que reduz os custos operacionais e melhora o desempenho dos aplicativos de LLM.
O GPTCache é um cache semântico de código aberto que armazena respostas de LLMs. Esse recurso de armazenamento é particularmente benéfico para lidar com consultas repetitivas ou semelhantes, reduzindo invocações desnecessárias de LLMs que resultam em custos maiores e respostas mais lentas, especialmente durante picos de uso. Quando um usuário faz uma pergunta nesse ecossistema, o Zilliz Cloud primeiro verifica o GPTCache em busca de respostas preexistentes. Se o Zilliz Cloud encontrar uma resposta, ele a retorna rapidamente ao usuário. O Zilliz Cloud envia a consulta ao LLM para obter uma resposta se não encontrar nenhum resultado. Essa resposta é então armazenada no GPTCache para uso futuro, otimizando a utilização de recursos.
Como o Zilliz Cloud e o GPTCache funcionam
Ao trabalharem em conjunto, o Zilliz Cloud e o GPTCache apresentam uma solução poderosa para superar os desafios de implementar LLMs em aplicações. Essa sinergia cria um ambiente no qual aplicações de IA podem gerar respostas mais precisas, oportunas, econômicas e performáticas, melhorando significativamente a experiência e a interação do usuário.
Comece com a stack CVP para criar seus aplicativos de LLMs
Depois de explorar as soluções robustas que o Zilliz Cloud e o GPTCache oferecem para aprimorar aplicações de LLM, o próximo passo é explorar como aplicar essas ferramentas e começar a criar suas próprias aplicações. Um avanço empolgante na tecnologia de IA, a Stack CVP (ChatGPT/LLMs + um banco de dados vetorial + prompt-as-code), apresenta uma estrutura robusta para atingir esse objetivo. Vamos explorar isso mais a fundo na seção a seguir.
Para quem é novo nesse espaço, o OSS Chat é uma excelente vitrine da poderosa stack CVP. O OSS Chat é um chatbot de IA que usa informações fundamentadas de fontes como o GitHub para responder a perguntas sobre softwares populares de código aberto. Por baixo dos panos, o OSS Chat é construído com o Akcio, uma stack CVP de código aberto para Retrieval Augmented Generation (RAG). A lógica de recuperação de informações é expressa no Ackio para transformar repositórios do GitHub e páginas de documentação em vetores de embedding e armazenar os dados vetoriais no Zilliz Cloud. Quando um usuário pergunta sobre um projeto de código aberto, o Zilliz Cloud realiza uma busca por similaridade para encontrar os principais resultados top-k mais relevantes. Esses resultados e a pergunta original do usuário são recompostos em um prompt abrangente para que o LLM retorne uma resposta de alta qualidade.
Para proporcionar uma experiência de aprendizado mais interativa, convidamos você a participar de um webinar com a OriginTrail e conosco em 7 de setembro. Esta sessão se aprofundará no processo de criação de aplicativos de LLM, permitindo que você interaja diretamente com desenvolvedores experientes e especialistas na área de desenvolvimento de aplicativos de LLM. A combinação inovadora de Zilliz Cloud, GPTCache e LLMs abre possibilidades no cenário de desenvolvimento de aplicações de IA. Não há momento melhor para explorar essas tecnologias revolucionárias e embarcar na sua jornada.
Começando com o Zilliz Cloud
- Comece gratuitamente com o novo Plano Starter! Um ótimo plano para começar sem complicações de instalação e que não exige cartão de crédito!
- Ou inicie seu teste gratuito de 30 dias do plano Standard com $100 em créditos no momento do cadastro e a oportunidade de ganhar até $200 em créditos no total.
- Aprofunde-se na documentação do Zilliz Cloud.
- Confira o guia sobre migração do Milvus para o Zilliz Cloud.
Continue lendo

Zilliz Cloud Audit Logs Goes GA: Security, Compliance, and Transparency at Scale
Zilliz Cloud Audit Logs are now GA, giving enterprises real-time visibility, compliance-ready trails, and stronger security across AWS, GCP, and Azure.

Announcing VDBBench 1.0: Open-Source VectorDB Benchmarking with Your Real-World Production Workloads
Discover VDBBench 1.0, an open-source tool for benchmarking vector databases with real-world production data, streaming ingestion, and concurrent workloads.

What Exactly Are AI Agents? Why OpenAI and LangChain Are Fighting Over Their Definition?
AI agents are software programs powered by AI that can perceive their environment, make decisions, and take actions to achieve a goal—often autonomously.


