{"as_of":"2026-08-16T12:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e5c99bb7901af0f6d8bebc2be474aca069740dd0d860dcb53c60aec3e14aa08","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:28:32.866993Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.10715/citation-record","integrity":"/paper/2411.10715/integrity","json":"/paper/2411.10715/citation-record.json","paper":"/paper/2411.10715"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.348453Z","title":"Transfusion: Robust lidar-camera fusion for 3d object detection with transform- ers","venue":null,"work_id":"baae2ee2-ed1d-4196-9f05-aead96956817","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.869339Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:0b06ba619b0e9c7c381db53b860212ac8ac4a67cc5137467f6e186a28cb21454","observation_id":"cf34b8cf-97eb-463f-9cd9-2f91a96750f6","resolution":{"observed_at":"2026-08-12T19:28:34.356826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.902701Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.902701Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:568f4eb0d1704fb194a9594cf6962f2144e6f3d5b11a8d4ea209107116284895","observation_id":"831a497f-5d72-44a3-8a01-048fa561c219","resolution":{"observed_at":"2026-08-12T19:28:31.902701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17099","last_updated":"2023-03-30T02:18:07Z","snapshot_observed_at":"2026-08-16T00:11:07.498337Z","submitted_at":"2023-03-30T02:18:07Z","title":"BEVFusion4D: Learning LiDAR-Camera Fusion Under Bird's-Eye-View via Cross-Modality Guidance and Temporal Aggregation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17099","snapshot_observed_at":"2026-08-12T19:28:31.945210Z","title":"Bevfusion4d: Learn- ing lidar-camera fusion under bird’s-eye-view via cross- modality guidance and temporal aggregation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.945210Z"},"links":{"cited_paper":"/paper/2303.17099","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:e7ae1c500098001b916fe7b82ff4f8136b6524935537a974041d70e19f4b2e1d","observation_id":"9cdc39d3-77ac-4cd9-837f-fe535a365661","resolution":{"observed_at":"2026-08-12T19:28:31.945210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.315416Z","title":"Objectfusion: Multi-modal 3d object detection with object-centric fusion","venue":null,"work_id":"f5aed59e-944a-49b3-9bf2-39a0abe65c20","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.952456Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:40e5270392c9f3212f7dd425f566473e04b9657701df259293690170b967ff41","observation_id":"ba345c00-23e6-4c50-84dc-0c33205e9177","resolution":{"observed_at":"2026-08-12T19:28:34.324462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.960051Z","title":"Futr3d: A unified sensor fusion framework for 3d detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.960051Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:0045b5d283de65184848f84659546ed34a7e0c1e74f8ba1229096dab9c7ad9b5","observation_id":"df852ae9-8fd4-47a0-8677-3426972f01fd","resolution":{"observed_at":"2026-08-12T19:28:31.960051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.274198Z","title":"Focal- former3d: focusing on hard instance for 3d object detection","venue":null,"work_id":"a921804d-f19e-4d8e-b179-fe2c625332bd","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.966404Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:cc16cf32c96882c402133e01d6d4e29dbc193f6a773de271459fed3b440ae7ac","observation_id":"d326804a-495d-447c-91f9-b19b9c4e3102","resolution":{"observed_at":"2026-08-12T19:28:34.281120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.973386Z","title":"Deformable feature aggregation for dynamic multi-modal 3d object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.973386Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:0aa7271c67f78709d64f688da24d1e68994dddd904399979e4a3550f8dba6df5","observation_id":"1cc38717-a2b4-40fb-91d2-b16553222e95","resolution":{"observed_at":"2026-08-12T19:28:31.973386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.06493","last_updated":"2022-04-21T01:52:05Z","snapshot_observed_at":"2026-08-13T16:58:04.096441Z","submitted_at":"2022-01-17T16:08:57Z","title":"AutoAlign: Pixel-Instance Feature Aggregation for Multi-Modal 3D Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.06493","snapshot_observed_at":"2026-08-12T19:28:31.979698Z","title":"Autoalign: pixel-instance feature aggregation for multi- modal 3d object detection.arXiv preprint arXiv:2201.06493,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.979698Z"},"links":{"cited_paper":"/paper/2201.06493","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:61a1fd205ab2d052489fa507662825ece091128e213bfba5a0819b010d2ee221","observation_id":"000040bf-6d9c-4652-a0e4-886a086bbae2","resolution":{"observed_at":"2026-08-12T19:28:31.979698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.241728Z","title":"Li3detr: A li- dar based 3d detection transformer","venue":null,"work_id":"6ccf5403-087f-4a1b-a65b-9bbb48721bbe","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.986071Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:7e142bbc321841a7453cbfbb91b7598dfa85fe3000d79d241f0ffb9beb035b57","observation_id":"80d41623-02eb-4ff9-ab5e-091d93f53cba","resolution":{"observed_at":"2026-08-12T19:28:34.247997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.213917Z","title":"Adamixer: A fast-converging query-based object detector","venue":null,"work_id":"862116f2-b171-49ee-9d0c-215ce94907a8","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.992416Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:483b0b93df73d467ee64cefea7944543336b4523abd79aeeb6ad513dc8780ab7","observation_id":"1b2aa19d-a697-4fc9-bee0-4efde8581b5a","resolution":{"observed_at":"2026-08-12T19:28:34.221067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.189910Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"3b55f2da-3394-4797-8362-2ad5f8f0da7f","year":2016},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.997847Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:036e02aaab5b5d97b00f54b425cd9c3abe3061752c176f5d511834794fc82a54","observation_id":"cc1897e8-9e8f-4d78-b1fc-36d58d4269e4","resolution":{"observed_at":"2026-08-12T19:28:34.196184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05257","last_updated":"2023-10-09T02:09:11Z","snapshot_observed_at":"2026-08-13T10:16:54.596497Z","submitted_at":"2023-09-11T06:27:25Z","title":"FusionFormer: A Multi-sensory Fusion in Bird's-Eye-View and Temporal Consistent Transformer for 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05257","snapshot_observed_at":"2026-08-12T19:28:32.026565Z","title":"Fusionformer: A multi-sensory fu- sion in bird’s-eye-view and temporal consistent transformer for 3d object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.026565Z"},"links":{"cited_paper":"/paper/2309.05257","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:1416a0bea13a0df394348d3aee6c94d2753401e0f726412be764969cdcd55544","observation_id":"b5f09690-b9c6-4449-851b-f0a9da5c29b9","resolution":{"observed_at":"2026-08-12T19:28:32.026565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17895","last_updated":"2023-08-30T02:10:53Z","snapshot_observed_at":"2026-08-14T00:57:03.212149Z","submitted_at":"2023-03-31T08:56:29Z","title":"EA-LSS: Edge-aware Lift-splat-shot Framework for 3D BEV Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17895","snapshot_observed_at":"2026-08-12T19:28:32.073565Z","title":"Ea-lss: Edge-aware lift-splat-shot framework for 3d bev ob- ject detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.073565Z"},"links":{"cited_paper":"/paper/2303.17895","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:5461c8e282609f38a097163032a90e556787c2e6985eb90b6c50d4b7a7693e0e","observation_id":"c57c0f88-cab8-4ab1-bac7-078e928635af","resolution":{"observed_at":"2026-08-12T19:28:32.073565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17054","last_updated":"2022-06-16T09:44:08Z","snapshot_observed_at":"2026-08-14T23:33:45.566779Z","submitted_at":"2022-03-31T14:21:19Z","title":"BEVDet4D: Exploit Temporal Cues in Multi-camera 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17054","snapshot_observed_at":"2026-08-12T19:28:32.100561Z","title":"Bevdet4d: Exploit tempo- ral cues in multi-camera 3d object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.100561Z"},"links":{"cited_paper":"/paper/2203.17054","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:3cf7963b7c6d1de1c7e7aa013f75ef5ef416dc3c45bbde3a91afd6ef153c6929","observation_id":"8624b5a5-52ff-43fc-b83e-7b8d73ff62ab","resolution":{"observed_at":"2026-08-12T19:28:32.100561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-07-06T12:21:28.059661Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-12T19:28:32.110177Z","title":"Bevdet: High-performance multi-camera 3d object de- tection in bird-eye-view","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.110177Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:222690e1a2122753270c4e239dd5b404eb0bf1a603c34898e5ab08be1d43d4a8","observation_id":"529056fc-d4a2-4640-9363-78d345cb6783","resolution":{"observed_at":"2026-08-12T19:28:32.110177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.171554Z","title":"Far3d: Expanding the horizon for surround-view 3d object detec- tion","venue":null,"work_id":"d157a7d2-df2a-4ec9-9ccc-63a75cc461cb","year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.117315Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:337e6b9d306bf475db1793bf9e2311fe28447d495fae9752859dd5e045686c30","observation_id":"90c89b00-7150-4bd5-9216-75d36552350c","resolution":{"observed_at":"2026-08-12T19:28:34.177090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.146332Z","title":"Msmdfusion: Fusing lidar and camera at multiple scales with multi-depth seeds for 3d ob- ject detection","venue":null,"work_id":"882e365a-2b5c-437c-bed7-1e006bc3b19d","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.123896Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:3f822ca34fa25cc3e404b9711f1aaaecf7147380f38775479b1f3fefb7dcbb63","observation_id":"41f62e9f-b0e6-4a1a-8721-3ba7d64d5c6b","resolution":{"observed_at":"2026-08-12T19:28:34.152651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.122450Z","title":"Centermask: Real-time anchor-free instance segmentation","venue":null,"work_id":"744aafa7-cb75-449a-bb52-954f3e153561","year":2020},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.132234Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:9b13ff7f119240aabe2b4712f271846c20966ad8338e6844cb4d846eb904381a","observation_id":"dd3d40dd-fbd1-4db6-bd2a-a50017551b09","resolution":{"observed_at":"2026-08-12T19:28:34.129462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.102166Z","title":"Dn-detr: Accelerate detr training by intro- ducing query denoising","venue":null,"work_id":"15d36da2-10a7-439b-afbc-02cef284a617","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.139659Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:f9f680110656dbe79ed6762d0eb428cdf70a41f0833035d059f7ff9a5dd0aa6c","observation_id":"d540e775-3042-4f19-8dd5-9d4307478b73","resolution":{"observed_at":"2026-08-12T19:28:34.107666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.078569Z","title":"Gafusion: Adaptive fusing lidar and camera with multi- ple guidance for 3d object detection","venue":null,"work_id":"7c574195-1397-41b2-8cb5-f0ee2464c121","year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.147120Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:c5f8984d56ccbb0895695164b262569cb567e399be3b71a585384a185e5aaede","observation_id":"eda1fe5b-6c09-458c-8853-54738a770d88","resolution":{"observed_at":"2026-08-12T19:28:34.087414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.054523Z","title":"Unifying voxel-based representation with transformer for 3d object detection","venue":null,"work_id":"f9df099d-ae38-49eb-973f-0deedb79dbd7","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.187755Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:133dc01fd9f2b027fb5f2a774bf90f03051a9cbbeec7db3dba14e2b99a74c9df","observation_id":"633861bd-206c-4d43-9e82-cab98f7642cc","resolution":{"observed_at":"2026-08-12T19:28:34.062138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.035214Z","title":"Bevdepth: Acquisition of reliable depth for multi-view 3d object detec- tion","venue":null,"work_id":"5ecc60d8-6459-4829-af67-aed566d3e7f4","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.252018Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:d33e25d13ecbf6cd3c6d2b08476790030a9f405c4f61d756b2f4883ede614d78","observation_id":"d26534f8-9184-474a-a38b-09bb6f801027","resolution":{"observed_at":"2026-08-12T19:28:34.040921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.014762Z","title":"Fast-bev: A fast and strong bird’s- eye view perception baseline","venue":null,"work_id":"ed21813c-45ee-49d0-b53a-18344658364f","year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.258150Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:e962eae1210132e656eb81346a3aef8745ead056af51346829ae8b0fe65eb36c","observation_id":"195c2a61-2a56-487a-a9d3-efa5a5848897","resolution":{"observed_at":"2026-08-12T19:28:34.020290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.264382Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.264382Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:657b73384ab08ea185ad8358824e60bffbb74f6e20b82217929ef86cd513a70b","observation_id":"9ef83d42-a8b3-4692-ac9a-4dd59905c3be","resolution":{"observed_at":"2026-08-12T19:28:32.264382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.965913Z","title":"Bevfusion: A simple and robust lidar-camera fusion framework","venue":null,"work_id":"3bc7b1f3-6c3b-4de0-9469-267ad6506444","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.270371Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:e5a24b58ec686898ceef72df9fe22819bf692acad974913751e4a5f28147f3c6","observation_id":"e6f6b9fe-c088-4b14-879b-a74451b72c3d","resolution":{"observed_at":"2026-08-12T19:28:33.972462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.276545Z","title":"Feature pyra- mid networks for object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.276545Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:f4e2ba48d917c7889707dab26eab7bb69f1c58872c3901cefc3fe7449ecf038e","observation_id":"923fb104-c073-41ce-a7c0-94a155be2e4b","resolution":{"observed_at":"2026-08-12T19:28:32.276545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.928120Z","title":"Sparsebev: High-performance sparse 3d object de- tection from multi-camera videos","venue":null,"work_id":"a1d20bcc-ce75-4a01-b0ef-a97842a8932a","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.288586Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:86b466eade95f09800896cff20bc51684cee2e5242ca9ca1f62335116f0b045b","observation_id":"6331c775-a5b6-4b73-a6d9-ff63cd19df36","resolution":{"observed_at":"2026-08-12T19:28:33.933417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12329","last_updated":"2022-03-30T16:04:38Z","snapshot_observed_at":"2026-08-15T19:00:22.576928Z","submitted_at":"2022-01-28T18:51:09Z","title":"DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12329","snapshot_observed_at":"2026-08-12T19:28:32.349200Z","title":"Dab-detr: Dynamic anchor boxes are better queries for detr","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.349200Z"},"links":{"cited_paper":"/paper/2201.12329","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:6b34e19c8fd03dc8c468d7a6500f7d247fc65bd7955c558bb855c89f97b1c7c1","observation_id":"d4560ec2-925c-499d-9383-79c3165e1b88","resolution":{"observed_at":"2026-08-12T19:28:32.349200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.910706Z","title":"Petr: Position embedding transformation for multi-view 3d object detection","venue":null,"work_id":"422555d5-040c-4bbf-8f26-77f87feace9f","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.389505Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:74bdf485fbcfcc2e5dbb6f07bf27c9ece9c02530602d94939155d730ee3fbfa0","observation_id":"e4e42334-4b28-4ebf-a877-f52f50e8dead","resolution":{"observed_at":"2026-08-12T19:28:33.916200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.893169Z","title":"Petrv2: A unified framework for 3d perception from multi-camera images","venue":null,"work_id":"05277240-d6b8-438d-bd16-74e72b88072d","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.396866Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:28d3242ccf15a84d53c6df7da4f6ecd954de523d7200fe09865dadd443b9d5f0","observation_id":"d9c64888-8943-46c3-b6b3-26b7948b1dd2","resolution":{"observed_at":"2026-08-12T19:28:33.898541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.874203Z","title":"Bevfusion: Multi- task multi-sensor fusion with unified bird’s-eye view repre- sentation","venue":null,"work_id":"82c6a8eb-3d9c-4e12-a726-91b2e2661787","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.403024Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:fb869465c1d8b3ab6fc3c16c7a7adf08bc4596c7c7b7aa3b90f98cd0f6335325","observation_id":"9a4c979a-4e49-4e10-82c4-c4b8b8e122b3","resolution":{"observed_at":"2026-08-12T19:28:33.880251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.409589Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.409589Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:fad486b0a93d6ead9b1c3da1c675afa8e765dd8054ad15d912157b208409d892","observation_id":"3df95c01-9555-4966-a908-6f2004176533","resolution":{"observed_at":"2026-08-12T19:28:32.409589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07849","last_updated":"2022-12-15T14:18:47Z","snapshot_observed_at":"2026-08-14T22:23:01.193384Z","submitted_at":"2022-12-15T14:18:47Z","title":"DETR4D: Direct Multi-View 3D Object Detection with Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07849","snapshot_observed_at":"2026-08-12T19:28:32.417165Z","title":"Detr4d: Direct multi-view 3d object detection with sparse attention","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.417165Z"},"links":{"cited_paper":"/paper/2212.07849","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:46ba2f81c3521193cf8b15b3669f12e4972f5e1efebd01bd5785a0e07d79b70c","observation_id":"6e2743bd-466a-4abd-ade4-bc393fa33d7b","resolution":{"observed_at":"2026-08-12T19:28:32.417165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.473306Z","title":"Lift, splat, shoot: Encod- ing images from arbitrary camera rigs by implicitly unpro- jecting to 3d","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.473306Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:695145bcdb99d219cfa35fa3128e45c6eb2911a31349cd5a81038c5250ac7000","observation_id":"a6aa273d-edaa-4cac-a3e3-dc0251ef65e8","resolution":{"observed_at":"2026-08-12T19:28:32.473306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.526518Z","title":"Categorical depth distribution network for monocular 3d object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.526518Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:9a523b3d9b4ea54b0065a6e017818e5d506e56ee8ed3266dac7f1004e94d04c7","observation_id":"713536b3-5403-487e-b5ab-765cdf112c45","resolution":{"observed_at":"2026-08-12T19:28:32.526518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.533375Z","title":"Focal loss for dense ob- ject detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.533375Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:fbb660dd4d7920726c1a7beb057a93d464d5140365dbc536657067ba22b71af8","observation_id":"39402c44-1e5e-4d69-aa7a-e5655a14d85f","resolution":{"observed_at":"2026-08-12T19:28:32.533375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.540886Z","title":"Cyclical learning rates for training neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.540886Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:5dc36ddfec51526048e9bb1a80537507f34709908ab1e947234479fa7852bfda","observation_id":"3c7976a6-4263-4681-9bca-286c31ecf2d5","resolution":{"observed_at":"2026-08-12T19:28:32.540886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.774354Z","title":"Attention is all you need","venue":null,"work_id":"538bb23d-d725-4b9b-8cb3-fa51b3b5f7a4","year":2017},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.547697Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:0fcd6bc3bf559e1edcac6e681c989aefab6052ea22cd557d4ef860e8f7b65779","observation_id":"01a03ecf-58fd-43a4-91ce-6c44abcfb3fb","resolution":{"observed_at":"2026-08-12T19:28:33.782414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.553384Z","title":"Pointpainting: Sequential fusion for 3d object de- tection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.553384Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:f9db4aa27f235f9485f28b41706f03ae2655b6a93b7e9c2dbd4317fb6de794bd","observation_id":"ca45c5d4-86e2-4fc5-ba7a-b8b2a9ef9295","resolution":{"observed_at":"2026-08-12T19:28:32.553384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.730965Z","title":"Unitr: A unified and efficient multi-modal transformer for bird’s-eye-view repre- sentation","venue":null,"work_id":"ccd952a3-ce66-4358-b5d2-ac173966d3db","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.559169Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:18d83b2e2560e93445bd77335f98bc3cfc4f9c00814b9b7dcfeb39e53b4fafae","observation_id":"38f4380e-b09d-4b7c-949b-cd9e077f00db","resolution":{"observed_at":"2026-08-12T19:28:33.738673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.711101Z","title":null,"venue":null,"work_id":"d61b21dd-73fc-4280-9f75-682567f3c670","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.564250Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:e0187b1996dffc1dfe1a4c4b31b677cb801ebc6e5f65318128328efd431dacd1","observation_id":"9433cc5e-d441-4f00-a1bc-487f80013518","resolution":{"observed_at":"2026-08-12T19:28:33.716692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.687875Z","title":"Exploring object-centric temporal modeling for efficient multi-view 3d object detection","venue":null,"work_id":"817d54c2-c4c0-4019-b9d9-7e7da60af00b","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.570535Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:ba2d76e8af5dcd448a753ae9c11af954c1d62a6f8b7809cb97486290e451b40a","observation_id":"31193498-e793-4c76-b2cc-cdb91510b183","resolution":{"observed_at":"2026-08-12T19:28:33.694585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.667155Z","title":"Detr3d: 3d object detection from multi-view images via 3d-to-2d queries","venue":null,"work_id":"7328eeb2-ddd0-438b-9961-3bf2640b5f71","year":2021},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.576703Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:591636529a4c8874cee02e7949ae0da4cda42948eb4467f1c7a79ce80255c651","observation_id":"5da9b462-c8e6-47cd-a085-3d26e0abc278","resolution":{"observed_at":"2026-08-12T19:28:33.675157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05945","last_updated":"2025-07-03T05:37:48Z","snapshot_observed_at":"2026-08-12T23:05:11.649111Z","submitted_at":"2024-08-12T06:46:05Z","title":"MV2DFusion: Leveraging Modality-Specific Object Semantics for Multi-Modal 3D Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05945","snapshot_observed_at":"2026-08-12T19:28:32.581814Z","title":"Mv2dfusion: Leveraging modality-specific object semantics for multi-modal 3d detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.581814Z"},"links":{"cited_paper":"/paper/2408.05945","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:04812392d4640ccfd3000d2e12077b34dce1a43a767465b303d64ef79ca94eef","observation_id":"dbd26f5a-ede3-45d9-9a24-5a8c516ac9d6","resolution":{"observed_at":"2026-08-12T19:28:32.581814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.643526Z","title":"Sparsefusion: Fusing multi-modal sparse rep- resentations for multi-sensor 3d object detection","venue":null,"work_id":"cffc7329-93e9-427d-a294-e8fcad485171","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.636500Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:a3815ebd82a68252854901758d909adb634a5d78560e49107135a749178ff545","observation_id":"34b09d61-d230-4752-9ab5-acd1aceee89c","resolution":{"observed_at":"2026-08-12T19:28:33.651370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.618772Z","title":"Cross modal trans- former: Towards fast and robust 3d object detection","venue":null,"work_id":"cda3b7f6-145e-41ca-85be-64c97b093e4b","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.681023Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:264b5c2ca1f90deed8c0aa0389c9499a74b336cd1ef33e521b05285f1eee2e42","observation_id":"545362d3-1372-4ecd-94ec-8cea2e99e7ef","resolution":{"observed_at":"2026-08-12T19:28:33.624715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.590120Z","title":"Second: Sparsely embed- ded convolutional detection","venue":null,"work_id":"ce4d7ca6-4575-4b3a-a4f6-d51e61256806","year":2018},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.686676Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:568de36090880023436befe8a3ee50edfc5b4e05f7e71f86132eafe263740c78","observation_id":"e0ed78f5-633e-4b80-9302-1e313eb20f62","resolution":{"observed_at":"2026-08-12T19:28:33.601168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.694155Z","title":"Bevformer v2: Adapting modern image backbones to bird’s-eye-view recognition via perspective su- pervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.694155Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:f8323f1e8faea992a7886c465d24ff2b38695d930f31f3e371d32a718eb9b12d","observation_id":"acfb5e71-4fb1-4d32-800e-5829fb21f471","resolution":{"observed_at":"2026-08-12T19:28:32.694155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.547631Z","title":"Deepinteraction: 3d object detection via modality interaction","venue":null,"work_id":"44f1434e-7d0a-4db7-b68b-2e6c966d2fda","year":1992},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.700956Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:465a34b4e162ca815f131698526fb4e70f9fd1d72d6b747a7c5e18620398c9c8","observation_id":"dfef9795-ebcb-4d7d-8300-72ca824feeb4","resolution":{"observed_at":"2026-08-12T19:28:33.555150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05075","last_updated":"2025-02-21T11:35:26Z","snapshot_observed_at":"2026-08-15T21:13:53.917239Z","submitted_at":"2024-08-09T14:04:21Z","title":"DeepInteraction++: Multi-Modality Interaction for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05075","snapshot_observed_at":"2026-08-12T19:28:32.705803Z","title":"Deepinteraction++: Multi-modality interaction for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.705803Z"},"links":{"cited_paper":"/paper/2408.05075","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:a918da8214fa37d569a76d96598c0fe812e5dd5b50578ad9f2257c53f04e1399","observation_id":"88b54127-fd66-471d-9912-1d16bbf095de","resolution":{"observed_at":"2026-08-12T19:28:32.705803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.522991Z","title":"Is-fusion: Instance-scene collaborative fusion for multimodal 3d ob- ject detection","venue":null,"work_id":"47090a38-8dc1-4a38-9081-2757650c9843","year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.714103Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:4e5bbab93cf92f107fccecc752177fd1173097699b6a49be18ee39d33c85b38e","observation_id":"2b76b5ee-3b94-4e1e-a582-7b4dd311ea82","resolution":{"observed_at":"2026-08-12T19:28:33.530527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.501356Z","title":"Center- based 3d object detection and tracking","venue":null,"work_id":"f7527b4f-6013-41f8-8f6a-3911355aa908","year":2021},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.721909Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:ed348ff104a2ed95fd8d367f0238cd887dcb832d0a26e6f7b52f55423c5a29c7","observation_id":"6781b3c6-4158-41da-a7cd-142cc06a06fb","resolution":{"observed_at":"2026-08-12T19:28:33.509180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.474813Z","title":"Multi- modal virtual point 3d detection","venue":null,"work_id":"5c81bb2d-a107-4750-99dc-f19abaa3f617","year":2021},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.783175Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:350491484302f77b5a6dc23e8acb9b2a18402aebfddd55a5e0a5549015291df6","observation_id":"58607b24-2237-4a45-a873-7aacf3030b23","resolution":{"observed_at":"2026-08-12T19:28:33.482646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-12T19:28:32.828663Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.828663Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:36506e98d01a80ec16642a4de325cb2e435c88efa1a76f4406e2a961cb5a07da","observation_id":"431aa5a5-6523-46d0-869d-d4cf80606bb9","resolution":{"observed_at":"2026-08-12T19:28:32.828663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.406999Z","title":"Sparselif: High-performance sparse lidar- camera fusion for 3d object detection","venue":null,"work_id":"b237ed5f-69e7-492b-ac02-0777cb62a6ed","year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.833803Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:e086a0e1acf4bc25ce5d54e1a53781fb3da4a771380680e08c15d4ec6e6bd43a","observation_id":"1b0c9fab-649f-4a49-96ac-7b9ebb21924b","resolution":{"observed_at":"2026-08-12T19:28:33.459457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05292","last_updated":"2024-11-08T02:51:39Z","snapshot_observed_at":"2026-08-12T22:05:07.529353Z","submitted_at":"2024-11-08T02:51:39Z","title":"SimpleBEV: Improved LiDAR-Camera Fusion Architecture for 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05292","snapshot_observed_at":"2026-08-12T19:28:32.841383Z","title":"Simplebev: Improved lidar-camera fusion architecture for 3d object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.841383Z"},"links":{"cited_paper":"/paper/2411.05292","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:e19592cc31cc8bbb515429962c3f8ba0c813052ea239f7d69a71d4ed7e9944b7","observation_id":"d4b743e8-a98a-4ffe-90d4-43c4a94fd101","resolution":{"observed_at":"2026-08-12T19:28:32.841383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.291621Z","title":"V oxelnet: End-to-end learning for point cloud based 3d object detection","venue":null,"work_id":"a47b05b7-3552-4ea6-b993-b2be2293be86","year":2018},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.847930Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:10e2a450268dbdea19f29f9a7a81452b15a53e850691a610aaad91061ed57423","observation_id":"6e9daa43-c357-4cbc-a104-ca6d2336b3f7","resolution":{"observed_at":"2026-08-12T19:28:33.333466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.266114Z","title":"Centerformer: Center-based transformer for 3d object detection","venue":null,"work_id":"31a4b4c3-9a37-47df-9e8c-76c4c07dfa79","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.854555Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:af7c56a766d3e462b4174c4ba8611f16e45494f89a7c79c7694a1987d02e3d2f","observation_id":"f77c4e70-c88f-41a6-8587-eb0658698e35","resolution":{"observed_at":"2026-08-12T19:28:33.275324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09492","last_updated":"2019-08-26T06:27:01Z","snapshot_observed_at":"2026-08-14T21:44:27.735473Z","submitted_at":"2019-08-26T06:27:01Z","title":"Class-balanced Grouping and Sampling for Point Cloud 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09492","snapshot_observed_at":"2026-08-12T19:28:32.860314Z","title":"Class-balanced grouping and sampling for point cloud 3d object detection","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.860314Z"},"links":{"cited_paper":"/paper/1908.09492","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:9704b611c7c74f466726ebb4c7467ddddd3fbc73603b97e48cf1da122e570d54","observation_id":"44122285-e031-4b7f-9445-9c6d9fc1437d","resolution":{"observed_at":"2026-08-12T19:28:32.860314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-12T19:28:32.866993Z","title":"Deformable detr: Deformable transform- ers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.866993Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:1897514fc97daa473ff5002b50a3d02829a0a542a293e5bb084ccd8a53961a4e","observation_id":"c2c59f5a-8caa-48e3-8951-fb90bccff40d","resolution":{"observed_at":"2026-08-12T19:28:32.866993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T04:37:47.689949Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2411.10715."}