<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>LLM Inference | Efficient AI</title><link>https://research.nvidia.com/labs/eai/tag/llm-inference/</link><atom:link href="https://research.nvidia.com/labs/eai/tag/llm-inference/index.xml" rel="self" type="application/rss+xml"/><description>LLM Inference</description><generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Tue, 16 Jun 2026 00:00:00 +0000</lastBuildDate><image><url>https://research.nvidia.com/labs/eai/media/icon_hu_67e9a0fea4325d02.png</url><title>LLM Inference</title><link>https://research.nvidia.com/labs/eai/tag/llm-inference/</link></image><item><title>Pushing Intelligence to 4-bit</title><link>https://research.nvidia.com/labs/eai/blogs/pushing-intelligence-to-4-bit/</link><pubDate>Tue, 16 Jun 2026 00:00:00 +0000</pubDate><guid>https://research.nvidia.com/labs/eai/blogs/pushing-intelligence-to-4-bit/</guid><description/></item><item><title>KV Cache Compression and Its Infra Problems</title><link>https://research.nvidia.com/labs/eai/blogs/kv-cache-compression-and-its-infra-problems/</link><pubDate>Fri, 12 Jun 2026 00:00:00 +0000</pubDate><guid>https://research.nvidia.com/labs/eai/blogs/kv-cache-compression-and-its-infra-problems/</guid><description/></item></channel></rss>