论文73°

Perplexity分享搜索结果排序技术

A deep dive into how Perplexity serves search results at scale: embeddings for ranking, GPU-based mo...

精选理由

Perplexity公开了其搜索结果排序技术细节,包括嵌入模型和GPU推理实现。

Perplexity使用嵌入模型和排序模型为每个查询选择最相关结果。该公司发布了关于如何构建这些模型背后最先进服务基础设施的研究。研究涵盖了GPU模型推理、请求批处理、推理服务器运行以及处理延迟/吞吐量权衡等内容。

原文 · Aravind Srinivas

A deep dive into how Perplexity serves search results at scale: embeddings for ranking, GPU-based mo...

A deep dive into how Perplexity serves search results at scale: embeddings for ranking, GPU-based model inference, request batching, running inference servers, and handling latency/throughput trade-offs. Perplexity @perplexity_ai Every answer in Perplexity starts with embedding and ranking models picking the most relevant results for the query. Today we published research on how we built SoTA serving infrastructure behind those models. Read the research: perplexity.ai/hub/blog/fast-… 🔗 View Quoted Tweet 💬 8 🔄 1 ❤️ 65 👀 10115 📊 10 ⚡