论文库
我读过的论文个人库。
三维感知与 BEV
BEVFormer:基于时空 Transformer 从多相机图像学习鸟瞰图表示
BEVFormer 将标定后的多相机系统转化为持续更新的 BEV query 空间,以几何感知的空间注意力和递归时序融合替代显式深度提升。
OccFormer:面向视觉三维语义占用预测的双路径 Transformer
OccFormer 将三维注意力分解为局部水平结构与池化的全局场景路径,使密集 voxel 推理更可控,并把 mask-classification decoder 适配到稀疏、类别不平衡的占用标签。
面向网联自动车的混合特征融合协同语义占用预测
CoHFF 将 camera-based 协作从目标框和 BEV 地图扩展到密集语义占用:车内融合 occupancy 与 semantic task feature,车间交换压缩正交平面特征。
Token Merging: Your ViT But Faster (ToMe)
Training-free token merging 的经典起点:它把冗余理解为信息压缩问题,而不是简单的 token 删除问题。
ALGM:面向 Plain ViT 语义分割的自适应先局部后全局 Token Merging
一篇面向 dense prediction 的 token merging 论文;核心启发是 token similarity 具有层深依赖性:浅层适合局部合并,深层才适合全局语义合并。
PiToMe:通过保持谱结构的 Token Merging 加速 Transformer
PiToMe 在相似度匹配之前加入重要性感知筛选:冗余簇可以被压缩,而孤立、独特的 token 应被保护。
ToFu:连接 Token Pruning 与 Token Merging
ToFu 认为 pruning 与 merging 适用于不同特征阶段,并提出 MLERP 缓解普通平均合并造成的 feature-norm shift。
DSM:通过延迟式空间合并实现免训练 ViT 加速
DSM 说明 merging 应等待 attention 进入 convergent 阶段,再随着表示语义化,从局部窗口逐步扩展到全局匹配。
MPM:面向高效 Vision Transformer 的互选配对合并
MPM 只在两个 token 互为最近邻时接受合并,并记录可组合 merge map,在不修改 segmentation decoder 的前提下重建密集空间特征。
Cache-Craft:面向高效检索增强生成的 Chunk Cache 管理
Cache-Craft 将 RAG prefill 视为 cache 管理问题,并根据新上下文对注意力的影响程度修复可复用 chunk state。
迈向 Streaming Attention 的紧空间复杂度界
该论文为流式近似 softmax attention 给出近乎紧的内存界,并澄清何时理论上可以使用次线性 KV-cache 表示。
FedLEASE:面向联邦微调的自适应 LoRA 专家分配与选择
FedLEASE 联合学习异质联邦环境需要多少 LoRA expert、哪些客户端共同训练它们,以及每个客户端应使用多少 expert。
不要重复造轮子,只需重排轮辐:通过 Rank-Wise Expert Assembly 实现资源高效联邦微调
SMARTFED 不再从头训练 federated LoRA,而是细粒度复用已有 LoRA 的 rank component。
Federated Sketching LoRA:面向异质协作式大模型微调的灵活框架
FSLoRA 在服务器保留高 rank 全局 adapter,同时允许每个客户端只更新与自身资源匹配的 sketched submatrix。
面向 LLM 智能体的上下文压缩:方法、失败模式与评测综述
智能体上下文压缩应被理解为可控的 Select-Compress-Store-Recover 流程,其失败可能发生在压缩前、压缩中或压缩后。
ContextBudget:面向 LLM 智能体的高效上下文分配
ContextBudget 把上下文长度视为序列资源分配决策,把 token 用在真正提高任务成功率的步骤,而不是让每一步共享固定窗口。
FederatedSkill:面向智能体技能演化的联邦学习
FederatedSkill 传输语义 skill diff 而非原始轨迹,并通过服务器端 capability memory 为每个客户端演化不同技能库。
Autogenesis:一种自演化智能体协议
Autogenesis 将 prompt、agent、tool、environment 与 memory 变成显式版本化资源,再通过可审计的 propose-verify-commit 操作管理其演化。
UniRefiner:通过对比 Register 教会预训练 ViT 自主清除无效 Token
UniRefiner 诊断预训练 ViT 中的伪视觉 token,并把学习到的 register 监督转化为冻结模型可插拔的 token 过滤器。
Depth Anything 3:从任意视图恢复视觉空间
Depth Anything 3 将多视图几何简化为单一 Transformer 与统一 depth-ray 目标,同时表示场景结构与相机运动。
VGGT:视觉几何基础 Transformer
VGGT 在一次 feed-forward 中为多图预测 camera、depth、point map 与 track,让 Transformer 本身成为几何引擎。
Cross-view Transformers:面向实时地图视角语义分割的跨视角 Transformer
CVT 学习从相机 feature map 到规范地图视角网格的直接注意力桥梁,证明有效实时 BEV 分割不一定需要显式深度。
AutoOcc:通过视觉语言引导 Gaussian Splatting 自动生成开放语义占用标注
AutoOcc 将视觉语言注意力与可微 Gaussian 重建组合为自动开放语义三维占用标注 pipeline。
COME:为占用世界模型加入场景中心预测控制
COME 将场景演化与自车视角变化解耦,并把场景中心预测作为 ControlNet guidance 注入生成式 occupancy world model。
COTR:用于视觉三维占用预测的紧凑 Occupancy Transformer
COTR 用紧凑 triplane feature 与 semantic group 替代全分辨率三维 occupancy tensor,只在最终预测时做密集解码。
GaussianOcc:基于 Gaussian Splatting 的全自监督高效三维占用估计
GaussianOcc 以预测 Gaussian 表示场景,并通过跨视图语义与深度渲染监督,仅从图像学习 occupancy。
OccRWKV:以线性复杂度重新思考高效三维语义占用预测
OccRWKV 在语义、BEV 与 point 分支中以线性 RWKV-style mixing 替代二次全局注意力,实现高效 LiDAR occupancy。
通过 Prototype-aware 视角变换使用低分辨率 Query 进行三维占用预测
该 ProtoOcc 在低分辨率三维 query 下,先把二维特征层级映射为学习 voxel prototype,从而保留精细图像结构。
QuadricFormer:以 Superquadric 表示场景的三维语义占用预测
QuadricFormer 用少量体积 superquadric 表示场景,其形状参数天然同时建模占据内部与目标几何。
语义因果感知的视觉三维占用预测(CausalOcc)
CausalOcc 通过语义因果性耦合二维 backbone、三维 lifting 与 occupancy decoder,使下游错误更新真正导致它们的特征。
SurroundOcc:面向自动驾驶的多相机三维占用预测
SurroundOcc 通过将多尺度图像特征提升到三维并渐进精炼 occupancy,建立直接的多相机密集 voxel baseline。
UniOcc:自动驾驶占用预测与未来预测统一基准
UniOcc 跨真实与仿真数据统一当前 occupancy prediction 与未来 occupancy forecasting,并提供 voxel flow 与无需 GT 的质量指标。
VGMOcc:使用视觉几何模型的稀疏 Gaussian 占用预测
VGMOcc 沿相机 ray 从 VGM surface point 向内部采样,生成体积 Gaussian occupancy,并跨帧增量融合预测。
ProtoOcc:使用双分支编码器与 Prototype Query Decoder 的准确高效三维占用预测
ProtoOcc 融合细粒度 voxel detail 与大感受野 BEV context,再由少量 scene-aware semantic prototype 解码 occupancy。
VOGS-CP:用于协同语义占用预测的纯视觉 Gaussian Splatting
VOGS-CP 传输稀疏场景 Gaussian 而非密集 voxel 或平面 BEV feature,为协同 occupancy 保留三维结构。
Video-3D LLM:学习位置感知视频表示用于三维场景理解
Video-3D LLM 将视频 patch token 与全局三维坐标对齐,使 LLM 可在度量空间中问答、区域描述与目标定位。
TopNet:面向 Octree 点云几何压缩的高效 Transformer 占用预测网络
TopNet 用 CNN-Transformer 混合网络预测 octree node occupancy,结合局部结构、自适应窗口上下文、通道门控与相邻节点先验。
关注未被关注部分:用于训练后 DiT 加速的先结构后细节 Token Merging
SDTM 发现 DiT 冗余会随去噪时间与层深变化,于是先裁剪弱结构、再合并弱细节,并自适应设置阈值。
Attention Is All You Need
Transformer 在 encoder-decoder 架构中以并行 multi-head attention、位置编码、残差路径与前馈 block 替代 recurrence。