ROCS Boosts Efficiency for Large-Scale Recommendation Systems.

Yuxin Chen, Liang Luo, Buyun Zhang, Jian Jiao, Boda Li, Haoyu Wang, Tongyi Tang, Ao Cai, Zijian Shen, Zhengkai Zhang, Wenyi Xie, Ryan Dick, Han Liu, Neng Shi, Bin Yu, Jianbo Xiao, Shuyao Bi, Hongtao Yu, Yuanwei Fang, Zhuoran Zhao, Sijia Chen, Yang Chen, Shuqi Yang, Qianru Li, Zikun Liu, Wei Ling, Sihan Zeng, Longhao Jin, Jiaxin Lu, Yinbin Ma, Jiawei Li, Yichen Ruan, Yong Ler Lee, Birmingham Guan, Zijian Li, Jianbo Sun, Zhengyu Zhang, Zeliang Chen, Xiaohan Wei, Yuchen Hao, GP Musumeci, Venkatesh Ranganathan, Yantao Yao, Chunqiang Tang, Wenlin Chen, Santanu Kolay, Ellie Dingqiao Wen· July 31, 2026 View original

Key takeaways

  • Scaling recommendation models often faces production cost constraints.
  • ROCS improves inference efficiency by sharing computations across candidates per request.
  • It uses Generalized Layer Masking and Deep Cross Attention for architectural support.
  • ROCS delivers significant QPS improvements and quality gains in production.

Who benefits

E-commerceSocial MediaMedia & EntertainmentAdvertisingCloud Computing

Summary

ROCS (Request-Oriented Compute Sharing) is a new paradigm for recommendation models that significantly improves inference efficiency by deferring request-candidate interactions and sharing computations across candidates. It achieves up to 3x QPS improvement without quality degradation on retrieval models and 50% QPS gain with quality improvement on ranking models, deployed across various large-scale systems.

Modern recommendation systems achieve high prediction quality by employing complex models with extensive feature-interaction and sequence modules. However, the computational cost of evaluating these models for numerous candidates per user request often limits their scalability in production environments. Researchers have introduced Request-Oriented Compute Sharing (ROCS), a novel modeling and inference paradigm designed to address this efficiency challenge. ROCS optimizes recommendation inference by delaying request-candidate interactions and isolating candidate-dependent representations, allowing substantial parts of the model to be evaluated only once per user request, rather than for every single candidate. To implement ROCS, the team developed Generalized Layer Masking (GLM) for feature-interaction architectures and Deep Cross Attention (DCA) for sequence architectures, alongside In-Kernel Broadcast Optimization (IKBO) for efficient GPU deployment. Experiments show ROCS improves quality-efficiency tradeoffs, delivering up to a 3x query-per-second (QPS) increase for retrieval models and a 50% QPS gain with improved quality for ranking models, with successful deployment in large-scale production systems.

Why it matters

For professionals managing large-scale recommendation systems, ROCS offers a significant opportunity to reduce infrastructure costs and improve system throughput without sacrificing prediction quality, directly impacting user experience and operational efficiency.

How to implement this in your domain

  1. 1Evaluate current recommendation system architectures for opportunities to apply request-oriented compute sharing.
  2. 2Investigate integrating Generalized Layer Masking (GLM) and Deep Cross Attention (DCA) into existing models.
  3. 3Explore co-designing In-Kernel Broadcast Optimization (IKBO) for GPU deployment to maximize efficiency gains.
  4. 4Conduct A/B tests on production systems to measure QPS improvements and quality maintenance.

Original post by Yuxin Chen, Liang Luo, Buyun Zhang, Jian Jiao, Boda Li, Haoyu Wang, Tongyi Tang, Ao Cai, Zijian Shen, Zhengkai Zhang, Wenyi Xie, Ryan Dick, Han Liu, Neng Shi, Bin Yu, Jianbo Xiao, Shuyao Bi, Hongtao Yu, Yuanwei Fang, Zhuoran Zhao, Sijia Chen, Yang Chen, Shuqi Yang, Qianru Li, Zikun Liu, Wei Ling, Sihan Zeng, Longhao Jin, Jiaxin Lu, Yinbin Ma, Jiawei Li, Yichen Ruan, Yong Ler Lee, Birmingham Guan, Zijian Li, Jianbo Sun, Zhengyu Zhang, Zeliang Chen, Xiaohan Wei, Yuchen Hao, GP Musumeci, Venkatesh Ranganathan, Yantao Yao, Chunqiang Tang, Wenlin Chen, Santanu Kolay, Ellie Dingqiao Wen

"arXiv:2607.27744v1 Announce Type: new Abstract: Modern recommendation models gain prediction quality by scaling feature-interaction and sequence modules, but production cost constraints cap how far systems can scale. In this work, we propose Request-Oriented Compute Sharing (ROCS…"

View on X

Originally posted by Yuxin Chen, Liang Luo, Buyun Zhang, Jian Jiao, Boda Li, Haoyu Wang, Tongyi Tang, Ao Cai, Zijian Shen, Zhengkai Zhang, Wenyi Xie, Ryan Dick, Han Liu, Neng Shi, Bin Yu, Jianbo Xiao, Shuyao Bi, Hongtao Yu, Yuanwei Fang, Zhuoran Zhao, Sijia Chen, Yang Chen, Shuqi Yang, Qianru Li, Zikun Liu, Wei Ling, Sihan Zeng, Longhao Jin, Jiaxin Lu, Yinbin Ma, Jiawei Li, Yichen Ruan, Yong Ler Lee, Birmingham Guan, Zijian Li, Jianbo Sun, Zhengyu Zhang, Zeliang Chen, Xiaohan Wei, Yuchen Hao, GP Musumeci, Venkatesh Ranganathan, Yantao Yao, Chunqiang Tang, Wenlin Chen, Santanu Kolay, Ellie Dingqiao Wen on X · view source

Want to go deeper?

Turn these trends into skills with Learnijoy's hands-on AI & tech courses.

Explore courses