Research Labs
All Research Labs
Spatial Intelligence
Applied Research
Autonomous Vehicles
Deep Imagination
Publications
AI Playground
New and Featured
AI Art Gallery
NGC Demos
Research Areas
AI & Machine Learning
3D Deep Learning
Computer Vision
Robotics
All Areas
Careers
Academic Collaborations
Government Collaborations
Graduate Fellowship
Internships
Research Openings
Research Scientists
Meet the Team
Licensing
Skip to main content
Artificial Intelligence Computing Leadership from NVIDIA
Login
Research Labs
All Research Labs
Spatial Intelligence
Applied Research
Autonomous Vehicles
Deep Imagination
Publications
AI Playground
New and Featured
AI Art Gallery
NGC Demos
Research Areas
AI & Machine Learning
3D Deep Learning
Computer Vision
Robotics
All Areas
Careers
Academic Collaborations
Government Collaborations
Graduate Fellowship
Internships
Research Openings
Research Scientists
Meet the Team
Licensing
Search
Search
Enter the terms you wish to search for.
Publications
Our publications provide insight into some of our leading-edge research.
Filters
Search
Apply
Filters
Filters
Publication Year
2026
(15)
2025
(11)
2024
(14)
2023
(4)
2022
(3)
2021
(4)
2020
(2)
Facet Publication Year
Research Areas
Natural Language Processing
(53)
Artificial Intelligence and Machine Learning
(33)
Computer Vision
(16)
Speech Processing
(16)
Generative AI
(12)
Applied Perception
(7)
Machine Translation
(7)
Robotics
(3)
Algorithms and Numerical Methods
(1)
Autonomous Vehicles
(1)
Esports
(1)
Physical AI
(1)
Events
CORL
(3)
CVPR
(3)
ECCV
(2)
ICLR
(11)
ICML
(2)
ICRA
(1)
NeurIPS
(4)
53 results found
Natural Language Processing
Clear all
Natural Language Processing
2026
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
Minki Kang, Shizhe Diao,
Ryo Hachiuma
, Sung Ju Hwang,
Pavlo Molchanov
,
Yu-Chiang Frank Wang
,
Byung-Kwan Lee
SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
Seokju Cho,
Ryo Hachiuma
,
Abhishek Badki
,
Hang Su
,
Byung-Kwan Lee
, Chan Hee Song,
Sifei Liu
, Subhashree Radhakrishnan, Seungryong Kim,
Yu-Chiang Frank Wang
,
Min-Hung Chen
Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation
Seonghoon Yu, Dongjun Nam,
Byung-Kwan Lee
, Jeany Son
Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients
Byung-Kwan Lee
, Ximing Lu, Shizhe Diao, Minki Kang,
Saurav Muralidharan
, Karan Sapra, Andrew Tao,
Pavlo Molchanov
, Yejin Choi,
Frank Wang
,
Ryo Hachiuma
GenRecal: Generation after Recalibration from Large to Small Vision-Language Models
Byung-Kwan Lee
,
Ryo Hachiuma
, Yong Man Ro,
Yu-Chiang Frank Wang
, Yueh-Hua Wu
ECCV
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
Jiwan Kim, Kibum Kim, Wonjoong Kim,
Byung-Kwan Lee
, Chanyoung Park
ECCV
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
Byung-Kwan Lee
,
Yu-Chiang Frank Wang
,
Ryo Hachiuma
CVPR
Recursive Think-Answer Process for LLMs and VLMs
Byung-Kwan Lee
, Youngchae Chee, Yong Man Ro
CVPR
Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
Ali Hatamizadeh
, Yejin Choi,
Jan Kautz
Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding
Yonggan Fu
, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas,, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz,
Pavlo Molchanov
TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models
Tong Guan,
Huck Yang
, Sabato Marco Siniscalchi, Qingsong Wen, Ming Jin, Shirui Pan
ICLR
RLP: Reinforcement as a Pretraining Objective
Ali Hatamizadeh
, Syeda Nahida Akter, Shrimai Prabhumoye,
Jan Kautz
, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi
ICLR
RefineBench: Evaluating Refinement Capability of Language Models via Checklists
Young-Jun Lee, Seungone Kim,
Byung-Kwan Lee
, Minkyeong Moon, Yechan Hwang, Jong Myoung Kim, Graham Neubig, Sean Welleck, Ho-Jin Choi
ICLR
iGRPO: Self-Feedback-Driven LLM Reasoning
Ali Hatamizadeh
, Shrimai Prabhumoye, Igor Gitman, Ximing Lu, Seungju Han, Wei Ping, Yejin Choi,
Jan Kautz
Open-World Task and Motion Planning via Vision-Language Model Inferred Constraints
Nishanth Kumar, William Shen,
Fabio Ramos
, Dieter Fox, Tomás Lozano-Pérez, Leslie Pack Kaelbling,
Caelan Garrett
CORL
2025
Unified Reinforcement and Imitation Learning for Vision-Language Models
Byung-Kwan Lee
,
Ryo Hachiuma
, Yong Man Ro,
Yu-Chiang Frank Wang
, Yueh-Hua Wu
NeurIPS
Alpamayo 1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail
Marco Pavone
, Many other contributors found on Page 33
VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models
Byung-Kwan Lee
,
Ryo Hachiuma
, Yong Man Ro,
Yu-Chiang Frank Wang
, Yueh-Hua Wu
CVPR
Fugatto 1 - Foundational Generative Audio Transformer Opus 1
Rafael Valle, Rohan Badlani, Zhifeng Kong, Sang-gil Lee, Arushi Goel, Sungwon Kim, Joao Felipe Santos, Shuqi Dai,
Siddharth Gururani
, Aya AIJa'fari, Alex Liu, Kevin Shih, Wei Ping,
Huck Yang
, Bryan Catanzaro
ICLR
Gated Delta Networks: Improving Mamba2 with Delta Rule
Songlin Yang,
Jan Kautz
,
Ali Hatamizadeh
ICLR
Hymba: A Hybrid-head Architecture for Small Language Models
Xin Dong,
Yonggan Fu*
, Shizhe Diao,
Wonmin Byeon
, Zijia Chen, Ameya Sunil Mahabaleshwarkar, Shih-Yang Liu,
Matthijs Van keirsbilck
,
Min-Hung Chen
,
Yoshi Nishi
, Yingyan Celine Lin,
Jan Kautz
,
Pavlo Molchanov
ICLR
ICLR spotlight paper
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
Chen Chen, Yuchen Hu, Siyin Wang, Helin Wang, Zhehuai Chen, Chao Zhang,
Huck Yang
, EngSiong Chng
ICLR
Minitron-SSM: Efficient Hybrid Language Model Compression through Group-Aware SSM Pruning
Ali Taghibakhshi, Sharath Turuvekere Sreenivas,
Saurav Muralidharan
, Marcin Chochowski, Yashaswi Karnati, Raviraj Joshi, Ameya Sunil Mahabaleshwarkar, Zijia Chen, Yoshi Suhara, Oluwatobi Olabiyi, Daniel Korzekwa, Mostofa Patwary, Mohammad Shoeybi,
Jan Kautz
, Bryan Catanzaro, Ashwath Aithal, Nima Tajbakhsh,
Pavlo Molchanov
NeurIPS
Towards Neural Scaling Laws for Time Series Foundation Models
Qingren Yao,
Huck Yang
, Renhe Jiang, Ming Jin, Shirui Pan
ICLR
Spatio-Temporal Context Prompting for Zero-Shot Action Detection
Wei-Jhe Huang,
Min-Hung Chen
, Shang-Hong Lai
Semantic Prompt Learning for Weakly-Supervised Semantic Segmentation
Ci-Siang Lin, Chien-Yi Wang,
Frank Wang
,
Min-Hung Chen
2024
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition
Huck Yang
, Taejin Park, Yuan Gong, Yuanchao Li, Zhehuai Chen, yen-ting Lin, Chen Chen, Yuchen Hu, Kunal Dhawan, Piotr Zelasko, Chao Zhang, Yun-Nung Chen, Yu Tsao, Jagadeesh Balam, Boris Ginsburg, Shinji Watanabe, Andreas Stolcke
Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models
Yuchen Hu, Chen Chen,
Huck Yang
, Chengwei Qin, Pin-Yu Chen, Eng Siong Chng, Chao Zhang
NeurIPS
Bayesian Example Selection Improves In-Context Learning for Speech, Text, and Visual Modalities
Siyin Wang,
Huck Yang
, Ji Wu, Chao Zhang
From Descriptive Richness to Bias: Unveiling the Dark Side of Generative Image Caption Enrichment
Yusuke Hirota,
Ryo Hachiuma
,
Huck Yang
, Yuta Nakashima
FastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model
Yichen Lu, Jiaqi Song,
Huck Yang
, Shinji Watanabe
HAMSTER: Hierarchical Action Models for Open-World Robot Manipulation
Yi Li, Yuquan Deng, Jesse Zhang, Joel Jang, Marius Memmel,
Caelan Garrett
,
Fabio Ramos
, Dieter Fox,
Anqi Li
, Abhishek Gupta, Ankit Goyal
CORL
ICLR
Pagination
Current page
1
Page
2
Next page
Next ›
Last page
Last »