Slovník výrazov AI/RAG a vyhľadávanie

RAG a vyhľadávanie

približný najbližší sused

Anglický výraz approximate nearest neighbor

pokročiléheslo č. 6375 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená približný najbližší sused?

Približný najbližší sused (ANN) je vyhľadávanie, ktoré zámerne neporovná dopyt so všetkými vektormi, ale pomocou indexu rýchlo nájde susedov s vysokou pravdepodobnosťou blízkosti. Vymieňa čas a pamäť za možnosť vynechať skutočný top-k. Kvalita sa preto vyjadruje recallom voči exact search.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Miliónový index používa HNSW a parametre vyhľadávania nastaví podľa krivky recall-latencia na reálnych dopytoch. Pri aktualizáciách sa sleduje fragmentácia a distribúcia vektorov. Kritické testy pravidelne porovnajú ANN výstup s brute-force susedmi na vzorke.

Overiteľnosť

Odborné zdroje

  1. Efficient and Robust Approximate Nearest Neighbor Search Using HNSWarxiv.org
  2. FAISS: A Library for Efficient Similarity Searcharxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje približný najbližší sused?

Dátová štruktúra preskúma iba sľubnú časť priestoru, napríklad navigáciou grafom alebo kvantizovanými bunkami.

Kedy má približný najbližší sused praktický význam?

Miliónový index používa HNSW a parametre vyhľadávania nastaví podľa krivky recall-latencia na reálnych dopytoch.

S čím si pojem nezamieňať?

Exact nearest neighbor prehľadá všetky relevantné body a poskytne referenčný top-k; ANN poskytuje rýchlu aproximáciu.

Ako sa výsledok kontroluje?

Meria sa recall@k proti exact search, queries per second, percentily latencie, pamäť a čas zostavenia indexu.

Na čo si dať pozor?

Agresívne zrýchlenie zníži recall a zmena distribúcie či filtrov môže poškodiť parametre ladené na starej sade.