AI消息速览

用于好友推荐的大规模图神经网络——多哈希用户嵌入与时间邻居采样

事件日期 2026-08-27 · 学术前沿 · 已接受

事件日期2026-08-27
信息日期2026-08-27
入库日期2026-08-28
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:用于好友推荐的大规模图神经网络——多哈希用户嵌入与时间邻居采样

英文标题:Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling
英文关键词(由标题/摘要提炼):Graph Neural Networks; Friend Recommendation; Multi-Hash User Embeddings; Temporal Neighbor Sampling; Production GNN Ranking
原始来源:https://arxiv.org/abs/2608.27413v1

一句话结论

在生产级社交图谱(1.94亿用户、280亿条边)上,将多哈希ID嵌入作为主要节点表示,并用按时间戳排序的CSR存储加二分查找实现时间邻居采样,使推荐带来的好友添加量提升16%、去重后的添加用户数提升11.5%,同时将ID嵌入表规模压缩超过98%。

研究问题概述

好友推荐天然是图结构问题:候选连接的相关性依赖多跳社交上下文,而非仅依赖用户属性。但在拥有数亿用户、数百亿边的生产社交图谱上部署消息传递GNN,需要解决大量建模与系统挑战。本文提出的端到端GNN排序系统重点处理两个关键设计选择:多哈希ID嵌入和时间邻居采样。

方法/产品要点

  • 多哈希ID嵌入:工业GNN系统通常要么忽略可训练ID,要么接受完整嵌入表;完整嵌入表在该图上会超过200GB。本文将多哈希嵌入作为主要节点表示,把ID嵌入表大小减少超过98%,同时保持排序质量。
  • 时间邻居采样:现有实现会扫描完整邻接列表,对拥有数万好友的用户不可行。论文实现按时间戳排序的CSR存储并使用二分查找,将每节点的时间邻居采样成本从 $O(\deg(v) + k)$ 降低到 $O(\log(\deg(v)) + k)$。
  • 系统形态:面向生产社交图谱的可扩展端到端GNN排序系统,并发布用于大规模时间图分布式训练和推理的框架。

主要结果/产业意义

  • 实验图规模:1.94亿用户、280亿条边;离线消融实验逐一分离两种设计选择的贡献(具体消融数值在摘要中未给出,待核实)。
  • 在线A/B测试:相对强生产基线,推荐带来的好友添加量增加16%,去重后的添加用户数增加11.5%。
  • 工程价值:ID嵌入表减少98%以上,使可训练ID表示在超大规模图上变得可行;时间邻居采样成本从与节点度相关的线性开销降为对数开销,缓解高活跃度用户邻接列表过长的问题。

为什么重要

  • 该工作展示GNN排序系统在真实社交推荐场景中的可落地性,并给出两个影响生产可行性的关键工程选择:多哈希嵌入压缩和高效时间邻居采样。
  • 与只关注模型精度的研究不同,它强调系统开销和数据结构设计:若不解决嵌入表大小和邻接列表扫描问题,消息传递GNN难以覆盖数亿用户和百亿边。
  • 在线指标提升说明这些工程优化不只降低成本,也直接带来业务增量。

与既有脉络的关系

已有相关卡片多为物理/流体建模中的图神经网络(如区间/模糊物理增强网络、有限体积残差训练),本文与之不同,聚焦社交推荐场景下GNN的规模化部署。增量信息在于:多哈希ID嵌入将ID嵌入表压缩超过98%,时间邻居采样将单节点采样复杂度从 $O(\deg(v) + k)$ 降至 $O(\log(\deg(v)) + k)$,并在在线A/B测试中带来推荐好友添加量的提升。

局限与不确定性

  • 本卡片仅基于arXiv摘要;多哈希的具体哈希数量与维度、时间邻居采样中 $k$ 的定义、CSR排序细节、模型架构、训练/推理硬件配置等未在摘要中说明,待核实。
  • 离线消融的具体数值、基线细节、A/B测试周期与统计显著性未在摘要中给出,待核实。
  • 线上提升是否完全归因于两个设计选择、是否存在冷启动或公平性副作用等,摘要未说明,待核实。
  • 论文称发布框架,但摘要未给出仓库地址或许可证,待核实。

可用于图书/PPT/简报的角度

  • 案例切入点:在数亿用户/百亿边的生产图上,GNN推荐系统如何通过两个工程选择获得在线业务提升。
  • 复杂度对比:展示从 $O(\deg(v) + k)$ 到 $O(\log(\deg(v)) + k)$ 的采样优化,说明数据结构和存储格式对大规模图学习的重要性。
  • 嵌入表压缩:以“减少98%以上ID嵌入表”为例,说明高基数ID特征在生产系统中的工程化处理方式。
  • 业务指标:推荐好友添加量+16%、去重添加用户数+11.5%,可用于展示技术优化到业务结果的价值链路。

原始材料

  • 论文标题(英文):Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling
  • 作者:Maksim Utushkin, Andrei Ovsiannikov, Alexander D'yakonov
  • 按源材料显示发布时间:2026-08-27
  • arXiv编号:2608.27413v1
  • 分类:cs.IR, cs.LG, cs.SI
  • 摘要页:https://arxiv.org/abs/2608.27413v1
  • PDF:https://arxiv.org/pdf/2608.27413v1