{"as_of":"2026-08-09T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b64745dd39c00f9fd9f4467b02affff0f7d92c7e29af419e5b7bf125ba06e439","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:05:26.129241Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.21831/citation-record","integrity":"/paper/2512.21831/integrity","json":"/paper/2512.21831/citation-record.json","paper":"/paper/2512.21831"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.857830Z","title":"Cooper: Cooperative perception for connected autonomous vehicles based on 3d point clouds","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.857830Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:092c4cde3fb672315d962ad1cbda7a24ef41ef02c79aa4d1ba29e2be9b581dee","observation_id":"e5e535ae-4cb3-4ed1-aa2f-03f41b6e261b","resolution":{"observed_at":"2026-08-03T14:05:25.857830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.864958Z","title":"F-cooper: Feature based cooperative perception for autonomous vehicle edge computing system using 3d point clouds","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.864958Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:f823ce78734bdefe355315e8f8c5a3a2d4c01f453805eac1e701d429b93cc770","observation_id":"7380cb2e-73a6-4b4c-a3da-bba14b6eb094","resolution":{"observed_at":"2026-08-03T14:05:25.864958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.875228Z","title":"V2vnet: Vehicle-to-vehicle communication for joint perception and prediction","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.875228Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:9f6eb3ec30b78a5b5498dbb01cb4f6d831e0fc263d93d22d9562b074f8b8f165","observation_id":"99b1ae93-8b88-4fb4-9943-dbc32cf3e7e6","resolution":{"observed_at":"2026-08-03T14:05:25.875228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.883920Z","title":"Where2comm: Communication-efficient collaborative perception via spatial confidence maps.Advances in neural information processing systems, 35:4874– 4886, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.883920Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:0e516be68c867a9758c55382f58c3e7c67f8fbb5628da849332b1a3ebf748c85","observation_id":"d8be1ce7-b349-4c79-aa92-5f4f1de0cf6a","resolution":{"observed_at":"2026-08-03T14:05:25.883920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.899724Z","title":"V2x-seq: A large-scale sequential dataset for vehicle-infrastructure cooperative perception and forecasting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.899724Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:37f601b86f11b3617960622e11116fc945f6a99d53e21aad872a6d03e1d070d6","observation_id":"1ddb9fb4-e968-41f2-8ceb-9c32578664cb","resolution":{"observed_at":"2026-08-03T14:05:25.899724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.909181Z","title":"V2x-sim: Multi-agent collaborative perception dataset and benchmark for autonomous driving.IEEE Robotics and Automation Letters, 7(4):10914–10921, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.909181Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:09e111c28a6acc1414280a52b680997ccfa3deb46292cdb1972e42a03053bd54","observation_id":"4b67cfd6-b4ae-4019-b80c-1fcdb12e2565","resolution":{"observed_at":"2026-08-03T14:05:25.909181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.916727Z","title":"V2v4real: A real-world large-scale dataset for vehicle-to-vehicle cooperative perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.916727Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:fc08103555f368c933a36d2d21126278955be641ed8fadad33e492c836cdfd2d","observation_id":"626751cd-e22c-46c5-9227-a8b328768504","resolution":{"observed_at":"2026-08-03T14:05:25.916727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.926199Z","title":"Advisory warnings based on cooperative perception","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.926199Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:ad3baf6ebbfd04fe96b23f8d99f7077cd1a74803a7103847e7d5785601e088be","observation_id":"052ddd2b-b378-465f-a5d5-43a90e4fd21a","resolution":{"observed_at":"2026-08-03T14:05:25.926199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.937687Z","title":"Shared perception for connected and automated vehicles","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.937687Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:4cb8e157223225bc4ab383d96547fef38796d28997e1cba895ab4629cb7c3e6b","observation_id":"b8ed3538-c6d2-4ba1-8307-b33d8ef1e68a","resolution":{"observed_at":"2026-08-03T14:05:25.937687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.945016Z","title":"Lidar-based end-to-end temporal perception for vehicle-infrastructure cooperation.IEEE INTERNET OF THINGS JOURNAL, 12(13):22862–22874, JUL 1 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.945016Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:352cf3593925717a602f9f040030fcbbaca5a07b371451d9d28a7e5eb78c7d83","observation_id":"7c19c7b4-f099-4f56-9600-7fa7e8a363c2","resolution":{"observed_at":"2026-08-03T14:05:25.945016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.949557Z","title":"Dair-v2x: A large-scale dataset for vehicle-infrastructure cooperative 3d object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.949557Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:32ecfe4c25d75c5c03b16cac46dd7c1392783d8d8adb169afb1a628160ef9f24","observation_id":"ff42b8dc-6ff6-4dbd-bb47-c8390a353dfa","resolution":{"observed_at":"2026-08-03T14:05:25.949557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.954456Z","title":"Opv2v: An open benchmark dataset and fusion pipeline for perception with vehicle-to-vehicle communication","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.954456Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:ea94c3ff0833f41d371fc03ddb730aa4a3b5d6245a5c85a3d8cc068c529e8b9d","observation_id":"ef86c1b5-f465-4856-a7ad-dd301a81ed4e","resolution":{"observed_at":"2026-08-03T14:05:25.954456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.960818Z","title":"Pointpainting: Sequential fusion for 3d object detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.960818Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:516a3c8c063868e068a58845b97243d92712473684971239b0a3f3f3abf19492","observation_id":"0c365c19-1f0e-4c49-8603-0aa768760816","resolution":{"observed_at":"2026-08-03T14:05:25.960818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.966464Z","title":"Centerfusion: Center-based radar and camera fusion for 3d object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.966464Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:1c74f8eb11c9f55e8c8a5d320cca83947223f9425b19a01fb57c031c889289e8","observation_id":"0c3eeb1b-50db-4475-b462-d737cf9e7b41","resolution":{"observed_at":"2026-08-03T14:05:25.966464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.973682Z","title":"Deformable feature aggregation for dynamic multi-modal 3d object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.973682Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:b63b304d0722e70a8a47d7e5cee8da7cca8fc9b330c8c80ef4d35ed853cd703a","observation_id":"eab653d1-c064-430d-a20c-86217275bdff","resolution":{"observed_at":"2026-08-03T14:05:25.973682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.982751Z","title":"Deepfusion: Lidar-camera deep fusion for multi-modal 3d object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.982751Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:c106058862b9bf54081cad93585fe0ced91c7ea03d5601827046882f9e317e2f","observation_id":"623bdd6b-ef12-47df-b58f-c155b698c34d","resolution":{"observed_at":"2026-08-03T14:05:25.982751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:25.999105Z","title":"Transfusion: Robust lidar-camera fusion for 3d object detection with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.999105Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:96ce79e0298f8294f2cd2939ad2555c2674d9667dac11cb3a29e5b877db40a25","observation_id":"538a457b-b306-46fb-8c0b-996d513aab54","resolution":{"observed_at":"2026-08-03T14:05:25.999105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.005882Z","title":"Futr3d: A unified sensor fusion framework for 3d detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.005882Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:a2f5c3a39c1b6e5872b67bf54e8410d5af213944c08a56a4cb04293ea777801f","observation_id":"4ba343fa-e803-4eaf-a977-f5ba2260a212","resolution":{"observed_at":"2026-08-03T14:05:26.005882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.012276Z","title":"Deepinteraction: 3d object detection via modality interaction.Advances in Neural Information Processing Systems, 35:1992–2005, 2022","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.012276Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:74b69d595ab8d5e7060caca1f8875cb8ade0d61089533e52c9473c2c52c744e7","observation_id":"d1a7a700-612a-4031-8e12-697f7330e294","resolution":{"observed_at":"2026-08-03T14:05:26.012276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.020664Z","title":"4d-net for learned multi-modal alignment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.020664Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:55150a34eeb9ea08aec1531c6917724c6bc7074088a4839070f463b3d1da459e","observation_id":"b8ece418-6fbe-48af-afd7-bbb3c237f0b7","resolution":{"observed_at":"2026-08-03T14:05:26.020664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.027034Z","title":"Recurrentbev: A long-term temporal fusion framework for multi-view 3d detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.027034Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:c61fe1cb43e9f6010606b0a4674248acc724db28c7acc3ae6d96334264711d8b","observation_id":"f0ac154f-a76b-4f07-a8ff-3da5f03a6a85","resolution":{"observed_at":"2026-08-03T14:05:26.027034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01812","last_updated":"2025-08-05T19:48:49Z","snapshot_observed_at":"2026-08-04T08:00:36.608727Z","submitted_at":"2024-12-02T18:55:34Z","title":"V2XPnP: Vehicle-to-Everything Spatio-Temporal Fusion for Multi-Agent Perception and Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01812","snapshot_observed_at":"2026-08-03T14:05:26.032618Z","title":"V2xpnp: Vehicle-to-everything spatio-temporal fusion for multi-agent perception and prediction.arXiv preprint arXiv:2412.01812, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.032618Z"},"links":{"cited_paper":"/paper/2412.01812","citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:2771df4111a6e0ebe5dc1e396573521c5003475ccf5c37241ed8b545c5dc2217","observation_id":"d7b3cdb5-44ce-4b4f-aba3-d96aa258109b","resolution":{"observed_at":"2026-08-03T14:05:26.032618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.039271Z","title":"Center-based 3d object detection and tracking","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.039271Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:9c362410954a2b563bc117aac3cbc2f3e21a98e9f9dbfe1b159385d284036666","observation_id":"75411713-63e1-4b32-89c9-33bd82dfcd8e","resolution":{"observed_at":"2026-08-03T14:05:26.039271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.047950Z","title":"Trackformer: Multi-object tracking with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.047950Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:d6cfced687abf694b981946e4ccea56b7062ee84bda7ad553a39e453764fdb49","observation_id":"0e77d5b0-e85a-4b9f-ad6e-8144623ed7a5","resolution":{"observed_at":"2026-08-03T14:05:26.047950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.055692Z","title":"Motr: End-to-end multiple-object tracking with transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.055692Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:8c667f0176c83bb4a944d4b10dbd1de772451b5ffab27c0b751f6fe654c91932","observation_id":"c682c2e0-0079-4eaf-abe5-e1e9914801d6","resolution":{"observed_at":"2026-08-03T14:05:26.055692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.060836Z","title":"Learnable online graph representations for 3d multi-object tracking.IEEE Robotics and Automation Letters, 7(2):5103–5110, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.060836Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:f638d7fffac0bd385a69fab4e26eeafddd4e6b8d3a77890c003fa2d27a020d5b","observation_id":"ede17023-c9a3-4050-9a13-a9b12f644b5f","resolution":{"observed_at":"2026-08-03T14:05:26.060836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.065994Z","title":"Motiontrack: end-to-end transformer- based multi-object tracking with lidar-camera fusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.065994Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:f5c3e09478dbedfddf86760fd9ba20aae1f51ada9a2611ea419d48d6aec07233","observation_id":"525d15a3-be53-4b66-951d-5a982424922f","resolution":{"observed_at":"2026-08-03T14:05:26.065994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.073897Z","title":"Pointpillars: Fast encoders for object detection from point clouds","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.073897Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:27429f9135312dce12bea4fd8b557b23319a671fccac90bd8ef1919151326c52","observation_id":"e4d85a61-3966-4c70-8ad3-89e1ee766200","resolution":{"observed_at":"2026-08-03T14:05:26.073897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.081342Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.081342Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:4472ef9b22c045bacbf9fda03487b196ea9dfe39299624f33eb23bcc0e80a214","observation_id":"0f9bbdd0-774f-4db2-888e-c2036834bd31","resolution":{"observed_at":"2026-08-03T14:05:26.081342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01804","last_updated":"2024-05-22T09:08:16Z","snapshot_observed_at":"2026-07-06T16:02:10.990236Z","submitted_at":"2023-08-03T15:06:23Z","title":"QUEST: Query Stream for Practical Cooperative Perception","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01804","snapshot_observed_at":"2026-08-03T14:05:26.087137Z","title":"Quest: Query stream for vehicle-infrastructure cooperative perception.arXiv preprint arXiv:2308.01804, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.087137Z"},"links":{"cited_paper":"/paper/2308.01804","citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:0669dbe47f99fcffba810c3714ad0b6b97857290cb745b10fae2cd6c21e4bc98","observation_id":"405fe2a4-faf7-4c1b-adb7-9dc1b83463b0","resolution":{"observed_at":"2026-08-03T14:05:26.087137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.092782Z","title":"Transiff: An instance-level feature fusion framework for vehicle- infrastructure cooperative 3d detection with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.092782Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:47c1bf5b4ea22b3547ffa83f970b5918f55c87f68eade3b276ae9b405cbc640e","observation_id":"f323c690-723c-4aef-8456-ed6b8d0b47be","resolution":{"observed_at":"2026-08-03T14:05:26.092782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.106027Z","title":"Dense reinforcement learning for safety validation of autonomous vehicles.Nature, 615(7953):620–627, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.106027Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:c905dff11afe241780c5661793962de87b096b3aac4d82d1f30fef655a11e641","observation_id":"c7428cac-ce28-446c-9077-86e9ad47d8ff","resolution":{"observed_at":"2026-08-03T14:05:26.106027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:05:26.129241Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:26.129241Z"},"links":{"citing_paper":"/paper/2512.21831"},"observation_digest":"sha256:ee65a6c17cb45e910e6a16165576fecd23d54697c9906f8cb75d8b49652f57f6","observation_id":"f63335c2-d72d-4a11-b7e4-83d2698b505c","resolution":{"observed_at":"2026-08-03T14:05:26.129241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.21831","last_updated":"2026-07-28T07:55:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T14:05:25.071272Z","submitted_at":"2025-12-26T02:20:22Z","title":"End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2512.21831."}