Come selezionare il tipo e la dimensione di CU più appropriati per la tua azienda?
Un'Unità di calcolo (CU) in Zilliz Cloud si riferisce alle risorse hardware destinate alle richieste di ricerca e agli indici. Zilliz Cloud fornisce tre tipi di CU: CU ottimizzata per le prestazioni, ottimizzata per la capacità e a capacità estesa. Ogni tipo di CU comprende diverse combinazioni di risorse CPU, memoria e storage per diverse esigenze aziendali. Pertanto, la selezione delle opzioni e delle dimensioni CU appropriate è cruciale durante la configurazione di un cluster Zilliz Cloud.
CU ottimizzata per le prestazioni
Una CU ottimizzata per le prestazioni è ideale per attività di recupero per similarità che richiedono un tempo di risposta rapido in millisecondi con un throughput elevato di almeno 100 query al secondo (QPS). Ogni CU può gestire circa 1,5 milioni di vettori a 768 dimensioni.
Questo tipo di CU è essenziale per (ma non limitato a) i seguenti casi d'uso:
- Applicazioni di IA generativa
- Sistemi di raccomandazione
- Motori di ricerca
- Chatbot
- Moderazione dei contenuti
- Arricchimento della base di conoscenza degli LLM
- Sistemi antifrode
CU ottimizzata per la capacità
Se la tua applicazione gestisce decine di milioni di vettori, considera l'utilizzo di una CU ottimizzata per la capacità. Ogni CU può gestire circa 5 milioni di vettori a 768 dimensioni. Questo tipo di CU può archiviare molti più dati rispetto a una CU ottimizzata per le prestazioni, con un costo inferiore ma anche prestazioni inferiori.
Le CU ottimizzate per la capacità sono particolarmente utili per (ma non limitate a) i seguenti scenari:
- Ricerca in dati non strutturati su larga scala, come testo, immagini, video e strutture molecolari
- Rilevamento di violazioni del copyright
- Verifica delle identità.
CU a capacità estesa
La CU a capacità estesa è ideale se non sei preoccupato del tempo di risposta e hai un budget molto limitato. Ogni CU può gestire 20 milioni di vettori a 768 dimensioni a un prezzo relativamente ragionevole. Sebbene abbia una latenza di ricerca più elevata, può contenere fino a 4 volte più dati rispetto a una CU ottimizzata per la capacità.
Questo tipo di CU è perfetto per attività offline come:
- Etichettatura o clustering dei dati
- Deduplicazione
- Rilevamento di outlier del dataset o bilanciamento delle classi.
Valutazione dei tre tipi di CU
La tabella seguente fornisce una panoramica delle differenze tra i tipi di CU di Zilliz Cloud.
| Tipo di CU | Latenza | Throughput | Capacità | Costo per milione di vettori (nota: basato su vettori a 768 dimensioni) |
|---|---|---|---|---|
| Ottimizzata per le prestazioni | Bassa | Alto | Bassa | A partire da $65/mese |
| Ottimizzata per la capacità | Media | Medio | Media | A partire da $20/mese |
| CU a capacità estesa | Alta | Basso | Alta | A partire da $10/mese |
Confronto delle prestazioni
Per misurare le prestazioni delle diverse opzioni CU, abbiamo esaminato due indicatori chiave: latenza di ricerca e throughput. Abbiamo testato i tre tipi di CU di Zilliz Cloud utilizzando due dataset con vari valori topk (10, 100, 250, 1000). Il primo dataset è composto da 1.000.000 di vettori con 768 dimensioni, e il secondo ha 5.000.000 di vettori con la stessa dimensione.
| top_k | / | / | 10 | 100 | 250 | 1000 |
|---|---|---|---|---|---|---|
| Latenza | CU ottimizzata per le prestazioni | 1M 768dim | <10ms | <10ms | <10ms | 10-20ms |
| CU ottimizzata per la capacità | 5M 768dim | <50ms | <50ms | <50ms | 50-100ms | |
| CU a capacità estesa |
La tabella sopra mostra che la CU ottimizzata per le prestazioni è la scelta migliore per una bassa latenza, superando la CU ottimizzata per la capacità. Mantiene una latenza inferiore a dieci millisecondi per valori tipici di topk compresi tra 10 e 250, da cinque a dieci volte più veloce rispetto alla CU ottimizzata per la capacità. Quando si gestiscono valori di topk nell’ordine delle migliaia, la latenza per ciascun tipo di CU varia da 10 a 20 ms per la CU ottimizzata per le prestazioni e da 50 a 100 ms per la CU ottimizzata per la capacità. Tuttavia, vale la pena notare che, anche se la CU ottimizzata per le prestazioni rallenta nelle risposte quando esegue attività con valori di topk nell’ordine delle migliaia, la sua latenza di ricerca è comunque adatta a molte applicazioni in tempo reale.
| top_k | 10 | 100 | 250 | 1000 | ||
|---|---|---|---|---|---|---|
| QPS | CU ottimizzata per le prestazioni | 1M 768dim | 520 | 440 | 270 | 150 |
| CU ottimizzata per la capacità | 5M 768dim | 100 | 80 | 60 | 40 | |
| CU a capacità estesa |
Per quanto riguarda il throughput, la CU ottimizzata per le prestazioni è superiore. Supera la CU ottimizzata per la capacità da quattro a cinque volte.
Confronto della capacità
Abbiamo testato i tre tipi di CU di Zilliz Cloud utilizzando un set standard di dimensioni vettoriali: 128, 256, 512, 768 e 1024.
| Dimensioni vettoriali | Numero di vettori per CU (milioni) | Numero di vettori per CU (milioni) | Numero di vettori per CU (milioni) |
|---|---|---|---|
| / | CU ottimizzata per le prestazioni | CU ottimizzata per la capacità | CU a capacità estesa |
| 128 | 5 | 25 | Disponibile a breve |
| 256 | 2.96 | 14.87 | Disponibile a breve |
| 512 | 1.63 | 8.22 | Disponibile a breve |
| 768 | 1.5 | 5 | 20 |
| 1024 | 0.86 | 4.34 | Disponibile a breve |
In base ai risultati dei test nella tabella sopra, rileviamo che:
- Le CU a capacità estesa hanno le capacità maggiori nell’archiviazione di vettori a 768 dimensioni, rispettivamente 13 volte e 4 volte superiori rispetto alle CU ottimizzate per le prestazioni e ottimizzate per la capacità.
- Con l’aumentare delle dimensioni vettoriali, è necessario più spazio di archiviazione per contenere i dati. Ad esempio, una CU può memorizzare approssimativamente il doppio del numero di vettori a 512 dimensioni rispetto ai vettori a 1024 dimensioni.
Nota: Questo esperimento si è concentrato solo sulla chiave primaria e sui vettori senza aggiungere campi scalari. Tuttavia, se sono presenti campi scalari aggiuntivi come id, label, keywords, summary, URL, ecc., la capacità effettiva di ciascun tipo di CU potrebbe differire dalla tabella sopra. Pertanto, è essenziale basarsi su misurazioni empiriche per garantire l’accuratezza.
Vediamo alcuni esempi!
Abbiamo confrontato le tre opzioni di CU di Zilliz Cloud osservandole attraverso la lente di latenza, throughput, capacità e costo. Ma come scegliere l’opzione più adatta alla tua attività? Vediamo due esempi per aiutarti a fare la scelta giusta.
Esempio 1
Supponiamo che tu stia creando un chatbot potenziato da LLM che adotta Zilliz Cloud per archiviare più di 10 milioni di frammenti di testo di documenti privati con un vettore di embedding a 768 dimensioni. La tua applicazione richiede che Zilliz Cloud supporti 1.000 QPS e recuperi i primi 10 risultati con una latenza end-to-end inferiore a 30 millisecondi.
Una CU ottimizzata per le prestazioni è l’unico modo per ottenere una latenza inferiore a 30 ms. Poiché ogni CU ottimizzata per le prestazioni può contenere fino a 1,5 milioni di vettori a 768 dimensioni, avrai bisogno di almeno sette CU per gestire tutti i 10 milioni di vettori. Una CU può raggiungere un QPS di picco di 520 per il throughput quando il valore topk è 10. Per gestire 1.000 QPS, avrai bisogno di due repliche.
Pertanto, l’approccio migliore per questo scenario è utilizzare due repliche di una CU ottimizzata per le prestazioni, ciascuna contenente sette CU.
Esempio 2
Supponi che la tua applicazione rilevi violazioni del copyright nelle immagini e debba trovare immagini simili da un pool di 100 milioni. Ogni immagine viene incorporata in un vettore a 768 dimensioni. Non richiedi risposte in tempo reale, ma prevedi i primi 100 risultati con un throughput di 50 QPS.
Sia la CU ottimizzata per la capacità sia la CU ottimizzata per le prestazioni possono gestire 50 richieste al secondo quando recuperi i primi 100 risultati. Tuttavia, la CU ottimizzata per la capacità può archiviare tre volte più vettori rispetto alla CU ottimizzata per le prestazioni. Pertanto, la CU ottimizzata per la capacità è l’opzione più adatta alle tue esigenze.
In base ai risultati dei test, una singola CU ottimizzata per la capacità può archiviare fino a 5,6 milioni di vettori a 768 dimensioni. Per ospitare i tuoi 100 milioni di vettori, avrai bisogno di un minimo di 20 CU. Quando il valore topk è 100, una singola CU può raggiungere un QPS di picco di 80 per il throughput. Per 50 QPS, una replica è sufficiente. Pertanto, avrai bisogno di un cluster con 20 CU ottimizzate per la capacità.
Riepilogo
Zilliz Cloud offre tre tipi di CU. Se hai bisogno che la tua applicazione sia fulminea e reattiva in tempo reale, la CU ottimizzata per le prestazioni è la scelta giusta. La CU ottimizzata per la capacità è la scelta migliore per le applicazioni che richiedono l’archiviazione e il recupero di decine di milioni di vettori. Se hai un budget limitato e sei disposto a sacrificare velocità e throughput, la CU a capacità estesa è perfetta per te.
Iniziare con Zilliz Cloud
Esplora con il nostro piano gratuito (non è richiesta alcuna carta di credito), oppure prova la nostra prova enterprise di 30 giorni con fino a $200 di crediti. Iscriviti tramite qualsiasi cloud marketplace e ricevi un credito aggiuntivo di $100.
Approfondisci nella documentazione di Zilliz Cloud.
Continua a leggere

Smarter Autoscaling in Zilliz Cloud: Always Optimized for Every Workload
With the latest upgrade, Zilliz Cloud introduces smarter autoscaling—a fully automated, more streamlined, elastic resource management system.

AI Integration in Video Surveillance Tools: Transforming the Industry with Vector Databases
Discover how AI and vector databases are revolutionizing video surveillance with real-time analysis, faster threat detection, and intelligent search capabilities for enhanced security.

Why Deepseek is Waking up AI Giants Like OpenAI And Why You Should Care
Discover how DeepSeek R1's open-source AI model with superior reasoning capabilities and lower costs is disrupting the AI landscape and challenging tech giants like OpenAI.



