RSS 收包文优化原理 RSSReceive-Side Scaling通过‌网卡硬件哈希计算 多接收队列 CPU 中断亲和绑定‌将网络收包负载从单核瓶颈分散至多核并行处理核心在于‌保持流内有序的前提下实现跨核负载均衡‌。‌‌核心原理与性能提升机制1.‌硬件哈希分流‌网卡提取数据包 L3/L4 头源/目 IP、端口、协议利用‌Toeplitz哈希算法‌计算哈希值避免软件计算开销 。2.‌RETA 重定向映射‌哈希值经‌接收端扩展表RETA/Indirection Table‌映射到具体物理接收队列确保同一五元组流始终落入同一队列保证包序不同流均匀分布 。3.‌多队列中断绑定‌每个 RX 队列独立触发中断并绑定不同 CPU 核心配合‌NAPI 轮询机制‌消除单核软中断拥堵实现多核并行收包处理 。4.‌缓存局部性优化‌同一连接包由固定 CPU 处理提升 L1/L2 缓存命中率配合‌XPS/RFS‌可进一步减少跨核数据迁移和锁竞争 。‌‌关键配置与优化点‌队列数匹配‌RX 队列数应等于或略少于物理核数避免超线程争抢通过 ethtool -L 调整ethtool -x 验证哈希分布 。‌哈希密钥与类型‌自定义 40 字节随机密钥rss_key防止特定流量模式导致哈希冲突根据业务开启 IPv4/TCP 等特定哈希字段 。‌中断亲和性Affinity‌禁用 irqbalance手动将各队列中断绑定至不同 NUMA 节点核心避免跨节点内存访问延迟 。‌协同技术‌结合‌RPS‌软件兜底分流、‌RFS‌基于流缓存定位、‌XPS‌发送端队列绑定形成全链路多核优化闭环 。‌‌‌为何同一连接必须走同一队列‌防止 TCP 包乱序导致内核重排序队列开销或应用层逻辑错误。‌大象流Elephant Flow问题‌若单条大流量哈希到单核仍会瓶颈需配合‌Flow Director‌或应用层多监听 socketSO_REUSEPORT二次分流 。‌NUMA 影响‌跨 NUMA 访问内存延迟倍增需确保网卡队列绑定与内存分配在同一节点 。‌‌