{"as_of":"2026-08-18T08:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76be4f138a365c06390ec2ae50bc2941910ee078b7ac0655c47a4faf47570de5","coverage":[{"denominator":153,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:27:59.529650Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:41:44.113311Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T00:05:50.919514Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"cited_work":{"arxiv_id":"2506.19769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19769","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of multi-sensor fusion perception for embodied ai: Background, methods, challenges and prospects","venue":null,"work_id":"fb410dfa-c5ef-44e0-a877-be7d23d7d352","year":2025},"citing_paper":{"arxiv_id":"2604.05863","last_updated":"2026-04-07T13:25:20Z","snapshot_observed_at":"2026-08-12T14:51:36.616517Z","submitted_at":"2026-04-07T13:25:20Z","title":"LoRM: Learning the Language of Rotating Machinery for Self-Supervised Condition Monitoring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:44.113311Z"},"links":{"cited_paper":"/paper/2506.19769","citing_paper":"/paper/2604.05863"},"observation_digest":"sha256:40b790971f4ea4ab6aaae4300e1756685f259261ef0035ea0a03975a3fc3b160","observation_id":"782efaa0-0489-4bc7-a979-4bf75b452a1e","resolution":{"observed_at":"2026-05-11T00:05:50.923534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19769/citation-record","integrity":"/paper/2506.19769/integrity","json":"/paper/2506.19769/citation-record.json","paper":"/paper/2506.19769"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.090762Z","title":"Dae-gan: Dynamic aspect-aware gan for text-to-image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.090762Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:87473bae0d9dab155a08691b9bb9d63b977fe1225a99a6c8133e605578f1cb88","observation_id":"4311f603-43d9-4682-9fbe-646e6f684786","resolution":{"observed_at":"2026-08-15T18:27:59.090762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.103299Z","title":"Cpws: Confident programmatic weak supervision for high-quality data labeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.103299Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:f23694a76ff4ed718a2d085fcb0e2f634b390ffc74732af9cc1b4a5aaed5fe4c","observation_id":"9c79084b-41bf-4f74-9a9f-86ef71a4950f","resolution":{"observed_at":"2026-08-15T18:27:59.103299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.108207Z","title":"Color enhanced cross correlation net for image sentiment analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.108207Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:847138c25c026eb1a1e351af4388f4e5b5eae98b90825e7921e1de41f8fd519d","observation_id":"121973e7-4413-41d8-9260-b7e565532a7a","resolution":{"observed_at":"2026-08-15T18:27:59.108207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.112733Z","title":"Embodied intelli- gence toward future smart manufacturing in the era of ai foundation model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.112733Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:35c138cd9c550f4a498cef4f76e168c5cd771b14971492f1bd32611ef26cc82b","observation_id":"449a7443-563f-4144-ae9f-1ccba8a37993","resolution":{"observed_at":"2026-08-15T18:27:59.112733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.116998Z","title":"Embodied intel- ligence via learning and evolution,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.116998Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:b1fdf81df5df1b79311dfe72e97c466a2a25d8414eb9df660d7c336296e04246","observation_id":"a5fd3e68-2b74-4d35-9897-dfd7d5a9a291","resolution":{"observed_at":"2026-08-15T18:27:59.116998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.121469Z","title":"Multi-modal 3d object detection in autonomous driving: a survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.121469Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:75e3b4700a5ff7d7a6cabcc5680dbbfbf2804509605bd39e50b9a183aa866e2e","observation_id":"bc771f72-cf3e-4180-8640-43e33d106f07","resolution":{"observed_at":"2026-08-15T18:27:59.121469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.126229Z","title":"Multi-modal 3d object detection in autonomous driving: A survey and taxonomy,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.126229Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:7b775705a945630a604fb0f9e6433b3627f20d069a4a40be635eeca9b7cca159","observation_id":"157466b9-b915-4382-8bfd-5e58897edf15","resolution":{"observed_at":"2026-08-15T18:27:59.126229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.130333Z","title":"Multi-sensor fusion and cooperative perception for autonomous driv- ing: A review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.130333Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:fb5a7f8ef918c337f6247dd578988df545224a650262f02abf5b439c767f72be","observation_id":"687399b9-64cb-4553-bdb9-50d1fc7b4a41","resolution":{"observed_at":"2026-08-15T18:27:59.130333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.134399Z","title":"Camera, lidar, and imu based multi-sensor fusion slam: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.134399Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:e35a12ada99935d3b4522e4d7f7883307cca71998950feffdff1711f3badf4b9","observation_id":"17a7bec1-1911-4e78-9427-cffd16657b84","resolution":{"observed_at":"2026-08-15T18:27:59.134399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.138768Z","title":"Multi-modality 3d object detection in autonomous driving: A review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.138768Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:618b8099ec56dbb58f6fad461cbe816cf9a1a9727043f8026b210c5bf3862245","observation_id":"0e554796-3a4f-4ab6-845f-da5a091bca3d","resolution":{"observed_at":"2026-08-15T18:27:59.138768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.142836Z","title":"Advancements in perception system with multi-sensor fusion for embodied agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.142836Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:445c9045042fae8b7c12fb7dd5e8e1f5a5e4fc41d9d5f6ecc16a5f97c81e9e3b","observation_id":"90a330c2-da2e-48c2-a431-fbfc6b82cf99","resolution":{"observed_at":"2026-08-15T18:27:59.142836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.147738Z","title":"A survey on the visual perception of humanoid robot,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.147738Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:abfc38e286c39487ee4c4f7cbb572a905cf4e9dc87aa2f364a05078d88adb421","observation_id":"ef42c4cc-525c-4f34-9a2d-7e3afba3c346","resolution":{"observed_at":"2026-08-15T18:27:59.147738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.152462Z","title":"Robustness-aware 3d object detection in autonomous driving: A review and outlook,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.152462Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:52d60ff3f562e6582b3db86a71599150de81466899c42bc9b5930cc1b4ababf2","observation_id":"29d92456-73dc-4d7d-8032-658d7c9f4ec1","resolution":{"observed_at":"2026-08-15T18:27:59.152462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.157678Z","title":"Multimodal fusion and vision-language models: A survey for robot vision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.157678Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:a972782bb8ec01e16b00824cd1989019b16e9e4db132006f708c6e55dc84380f","observation_id":"e05dd76f-e0be-460e-b231-93e78223ce67","resolution":{"observed_at":"2026-08-15T18:27:59.157678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.161616Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.161616Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:229fe5a16bc7ed0b9df14cda6956b644640eddd6c1c014e3f47481b623fc75ff","observation_id":"a3858fab-7614-41e9-8ac5-26db34f794bb","resolution":{"observed_at":"2026-08-15T18:27:59.161616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.166148Z","title":"nuscenes: A multimodal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.166148Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:24d7f2c88cff01e600f254dfab2d7278f76172675af861c9721cef2489801d9f","observation_id":"eb9dea81-f650-446c-af29-329a12ea7831","resolution":{"observed_at":"2026-08-15T18:27:59.166148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.171453Z","title":"Scalability in perception for autonomous driving: Waymo open dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.171453Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:47d480e8f1ed4a121667622ae93c758fc236813b7e4ee287b6b36f61a5dc12b7","observation_id":"b72f43a5-04ed-4994-aeec-e9b8fe0f02f8","resolution":{"observed_at":"2026-08-15T18:27:59.171453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.176131Z","title":"Cityscapes 3d: Dataset and benchmark for 9 dof vehicle detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.176131Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:616dd41cff6f1e62feed64c6e0b8d7247336c7664655e905def871a5207e0311","observation_id":"cda5e536-1b81-4ee6-b69a-77445d7fbdf9","resolution":{"observed_at":"2026-08-15T18:27:59.176131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.180371Z","title":"Argoverse: 3d tracking and forecasting with rich maps,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.180371Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:99902c20b7bd186575a23d0c1033daa4a2d1193afd5a50a0ddb4a429f335e8ef","observation_id":"52aa1c9d-1e40-4b0b-af16-c6e665361a06","resolution":{"observed_at":"2026-08-15T18:27:59.180371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.184512Z","title":"A*3d: An autonomous driving dataset in challenging environments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.184512Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:67d1dae03f6527c8829ee093f4e9318a5af503a8cb011f32cfd4c6898ffe8ce8","observation_id":"17922f8d-3364-4ce7-87a4-2445bfe9e9ec","resolution":{"observed_at":"2026-08-15T18:27:59.184512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.189041Z","title":"The apolloscape dataset for autonomous driving,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.189041Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:606119f3a0fbfb73c8c91044f9460e49fcac804f4eefbbbf6838db8a68a95a43","observation_id":"fe1d813b-4c81-49c7-8b3f-f3dd50ba9efd","resolution":{"observed_at":"2026-08-15T18:27:59.189041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03180","last_updated":"2021-09-02T08:02:52Z","snapshot_observed_at":"2026-08-18T05:24:59.919667Z","submitted_at":"2020-10-07T05:24:23Z","title":"Not All Datasets Are Born Equal: On Heterogeneous Data and Adversarial Examples","version":2},"cited_work":{"arxiv_id":"2010.03180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.03180","snapshot_observed_at":"2026-08-15T18:28:00.300766Z","title":"Not All Datasets Are Born Equal: On Heterogeneous Data and Adversarial Examples","venue":"cs.LG","work_id":"82f2034a-5e05-48fc-9568-24ad6c17ee24","year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.194021Z"},"links":{"cited_paper":"/paper/2010.03180","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:5c06be364924cd82f9f8a17b540ee0a5289c08ec052035408a00bb6bd222714c","observation_id":"fa35d388-b095-4f0e-8e6c-7f7e125df1c8","resolution":{"observed_at":"2026-08-15T18:28:00.305054Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.199303Z","title":"The h3d dataset for full-surround 3d multi-object detection and tracking in crowded urban scenes,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.199303Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:bfa6dfc2adcf63ecf597fb65d37ac19aa1cdf499fc29b8466b42e99434c9272d","observation_id":"fd02ac52-497e-4808-9f77-8b53ba8e926c","resolution":{"observed_at":"2026-08-15T18:27:59.199303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01685","last_updated":"2016-04-07T15:39:22Z","snapshot_observed_at":"2026-08-14T22:02:49.221229Z","submitted_at":"2016-04-06T16:34:33Z","title":"The Cityscapes Dataset for Semantic Urban Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01685","snapshot_observed_at":"2026-08-15T18:27:59.204139Z","title":"The cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.204139Z"},"links":{"cited_paper":"/paper/1604.01685","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:0457a6b53bd9a176aa526f57228548a993804597884819bdc3e7551e64d8d016","observation_id":"7a1fa5b0-58b9-43df-9caa-b0b9e1b09940","resolution":{"observed_at":"2026-08-15T18:27:59.204139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.209091Z","title":"Pointfusion: Deep sensor fusion for 3d bounding box estimation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.209091Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:2bc3ec3722eee3bff75e331654eb6a26ed024271c7952dbaaa09b49a203a11c8","observation_id":"8504f790-c2d4-432f-99eb-73174a680525","resolution":{"observed_at":"2026-08-15T18:27:59.209091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.215705Z","title":"Pointpainting: Sequential fusion for 3d object detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.215705Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:ae500b84b47388b7ea0bb06122d0ba671f92767077868be0c62dc3a9e801fa7d","observation_id":"89261c17-f4be-4b4e-93f0-1b7ee0706ab7","resolution":{"observed_at":"2026-08-15T18:27:59.215705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.219642Z","title":"Multimodal virtual point 3d de- tection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.219642Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:00b93cf5be44be3a47b15013bc898ab2007614be51219a0380d954739638573c","observation_id":"432fcb4e-451c-4a1a-ae68-f993f4398600","resolution":{"observed_at":"2026-08-15T18:27:59.219642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.223546Z","title":"Deepfusion: Lidar-camera deep fusion for multi-modal 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.223546Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:577934f51df9286a69e20cd6e104760ba98e343e43fcdabb3c8e991eeb570ee1","observation_id":"f25c02c5-9a1c-4fd9-9149-781d5f8de676","resolution":{"observed_at":"2026-08-15T18:27:59.223546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.227300Z","title":"Centerfusion: Center-based radar and camera fusion for 3d object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.227300Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:9a7d2825a518112876e14568b5b303db742c53f1063ff13366034a69d95b07df","observation_id":"eff4c427-b478-488f-97b7-caaed8d23aca","resolution":{"observed_at":"2026-08-15T18:27:59.227300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.231388Z","title":"Pointaugmenting: Cross- modal augmentation for 3d object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.231388Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:f1620519d705ca5263c3f77edca3fe3980f1793b22b2ac3042936d2c0fb7b05a","observation_id":"75844b1c-be3b-4136-937f-a4d77a07ea82","resolution":{"observed_at":"2026-08-15T18:27:59.231388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.235448Z","title":"Unifying voxel-based representation with transformer for 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.235448Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:b4ea88bcce864b00e21c6bc383093663d17ad786e9e2066f14d567ddcf3a9b7b","observation_id":"66e0dd46-1422-4d2f-a5cd-86abf20b14d2","resolution":{"observed_at":"2026-08-15T18:27:59.235448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.239314Z","title":"Sparse fuse dense: Towards high quality 3d detection with depth completion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.239314Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:2b9e80050fd54b26cda122a22b37fb37106b96ed671b34d1763da382e58f118b","observation_id":"10ebb46e-1108-41cb-952c-8cfb44f6a51e","resolution":{"observed_at":"2026-08-15T18:27:59.239314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.243266Z","title":"Joint 3d proposal generation and object detection from view aggregation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.243266Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:3be917c24e9e14520b604766c484e0f3650d5e39bfee84f2a8e02a94a4775ed2","observation_id":"ae2d9e14-3d47-456e-8f5b-1e253e636f31","resolution":{"observed_at":"2026-08-15T18:27:59.243266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.247154Z","title":"Roarnet: A robust 3d object detection based on region approximation refinement,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.247154Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:bfe951fb5dafd19825454f21cf98677e623d82c28c7c1b71d0a1b0ad45b4aa91","observation_id":"0474d767-0c9a-47d0-8305-2791cd16f7da","resolution":{"observed_at":"2026-08-15T18:27:59.247154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.251272Z","title":"Weakly aligned cross-modal learning for multispectral pedestrian detection,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.251272Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:61ef57535e03dc7745249db73a7bfbecc29214de3d5f46c4164a513e79ef0282","observation_id":"dcdbb8d1-2e1e-49ba-9661-3331ee97078e","resolution":{"observed_at":"2026-08-15T18:27:59.251272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09323","last_updated":"2025-01-27T03:44:24Z","snapshot_observed_at":"2026-08-16T14:09:51.569938Z","submitted_at":"2024-03-14T12:12:17Z","title":"E2E-MFD: Towards End-to-End Synchronous Multimodal Fusion Detection","version":4},"cited_work":{"arxiv_id":"2403.09323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09323","snapshot_observed_at":"2026-08-15T18:28:00.269326Z","title":"E2E-MFD: Towards End-to-End Synchronous Multimodal Fusion Detection","venue":"cs.CV","work_id":"625c2c56-2dfa-439c-87ab-0f14a8e3f748","year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.257003Z"},"links":{"cited_paper":"/paper/2403.09323","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:26c5f3a075e9518b508e2b4bb25142b7edc2f384e6a4179d00a2734576b5646f","observation_id":"3328c9fa-e8a6-4b28-84d2-7345dbe5d4bc","resolution":{"observed_at":"2026-08-15T18:28:00.274174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.261272Z","title":"Mvx-net: Multimodal voxelnet for 3d object detection,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.261272Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:e0b815e4e66f6bfe6d70a885d93a9c0ef997c4f54f3c3ad583d6f20483cae409","observation_id":"9eb9fba1-05a4-4495-8851-0aa3c777434e","resolution":{"observed_at":"2026-08-15T18:27:59.261272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.266860Z","title":"Bridging the view disparity between radar and camera features for multi-modal fusion 3d object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.266860Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:f18dc65f1f89ab5d08b2bbf0ccfcd660b5e2700b2c3d1476087c28e71d9ce8b2","observation_id":"404c8279-b13c-4911-969c-2a553a22fb9f","resolution":{"observed_at":"2026-08-15T18:27:59.266860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.271469Z","title":"Improving multispectral pedestrian detection by addressing modality imbalance problems,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.271469Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:35a9ac5b13d979159c1fa9d796034aaef4f67bad51be89ce544ae33cd30c8adc","observation_id":"c95d35d3-9505-40f6-a104-cb3a1a9106c3","resolution":{"observed_at":"2026-08-15T18:27:59.271469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.275741Z","title":"Multimodal object detection by channel switching and spatial attention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.275741Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:34f28315fd40759df49778d672f6ac559c72dc28fc8d3f888514ab636c5ec176","observation_id":"19a8dec4-7c7f-472e-ba35-c7cb56035fa0","resolution":{"observed_at":"2026-08-15T18:27:59.275741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.279559Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.279559Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:e8d20ad364c622c6e0986a84b821b43e249809498a0ac8803795530a14fb5277","observation_id":"4653c6c9-3c37-475a-99f1-73d27b21281a","resolution":{"observed_at":"2026-08-15T18:27:59.279559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.284563Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.284563Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:d028a14d1e09c03b32e88ef1da4bff37e0532247e0e163c9c17ae6be3f068751","observation_id":"f53df29e-aa38-47a8-91d6-ff63ea296082","resolution":{"observed_at":"2026-08-15T18:27:59.284563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.288958Z","title":"Frustum pointnets for 3d object detection from rgb-d data,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.288958Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:83230ef489abb709aec145985d6d4ea7415798d619c0171f36b0008837cc96fd","observation_id":"9c2df701-0fa6-489a-b435-5b979c730c56","resolution":{"observed_at":"2026-08-15T18:27:59.288958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.293075Z","title":"Pi-rcnn: An efficient multi-sensor 3d object detector with point-based attentive cont-conv fusion module,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.293075Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:e4bf82558bb73f561873f7648bb0711f4e10fc191b02b568bd1aafdfc79395d4","observation_id":"1b90b121-b862-4fd3-81db-cab5ea5832ac","resolution":{"observed_at":"2026-08-15T18:27:59.293075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.297384Z","title":"Fusionpainting: Multimodal fusion with adaptive attention for 3d object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.297384Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:3c57e1b6ddf0a75430625853e77ec73f1e1a27cb480c05b9710582d8a5729e60","observation_id":"570c83bb-9f00-4a06-abba-730ccdb6de87","resolution":{"observed_at":"2026-08-15T18:27:59.297384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.301160Z","title":"Graphalign: Enhanc- ing accurate feature alignment by graph matching for multi-modal 3d object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.301160Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:c3cce0eea96b213a6ca3e81782c5864593eaab8730e5fd1121fad0e6102da67a","observation_id":"2a8d6a96-4f63-4a14-9880-cb3f5e63e257","resolution":{"observed_at":"2026-08-15T18:27:59.301160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.304777Z","title":"Vpfnet: Improving 3d object detection with virtual point based lidar and stereo data fusion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.304777Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:0f1d7539c4835fd571873bd778529eb784af37ac61f601daa58a143567fbd912","observation_id":"750f3a87-ebe8-494c-bf3b-6aced675150f","resolution":{"observed_at":"2026-08-15T18:27:59.304777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.309499Z","title":"V oxel field fusion for 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.309499Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:285b4d133af6f6ec5fa55bc7d22f826f132e1763a1ea98fe1587fe88dcbff184","observation_id":"3a020289-19f8-4382-82d5-66b621cb12eb","resolution":{"observed_at":"2026-08-15T18:27:59.309499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.06493","last_updated":"2022-04-21T01:52:05Z","snapshot_observed_at":"2026-08-16T17:27:51.000171Z","submitted_at":"2022-01-17T16:08:57Z","title":"AutoAlign: Pixel-Instance Feature Aggregation for Multi-Modal 3D Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.06493","snapshot_observed_at":"2026-08-15T18:27:59.313624Z","title":"Autoalign: Pixel-instance feature aggregation for multi- modal 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.313624Z"},"links":{"cited_paper":"/paper/2201.06493","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:5a82d6c647ce13bc1a59a9d011d0f6d1f5292e4e10d8b4a230e83ee98cb2e446","observation_id":"0e3f95e7-0d11-422a-8b60-b86a3728178c","resolution":{"observed_at":"2026-08-15T18:27:59.313624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.317898Z","title":"Deformable feature aggregation for dynamic multi-modal 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.317898Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:81ee1cb1c92b036d62bd89b1c6e8f5c5fdd639d403840eb13956fd0fec1c8c92","observation_id":"642d6a30-1da5-49f6-9a16-5400084aea07","resolution":{"observed_at":"2026-08-15T18:27:59.317898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02702","last_updated":"2025-03-04T03:16:54Z","snapshot_observed_at":"2026-08-16T14:29:40.276462Z","submitted_at":"2024-01-05T08:10:49Z","title":"VoxelNextFusion: A Simple, Unified and Effective Voxel Fusion Framework for Multi-Modal 3D Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02702","snapshot_observed_at":"2026-08-15T18:27:59.321667Z","title":"V ox- elnextfusion: A simple, unified and effective voxel fusion framework for multi-modal 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.321667Z"},"links":{"cited_paper":"/paper/2401.02702","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:16d057a34c0f5f23b5a0196db00ed6f6ebf4ee514b64b933a957dacb4d0a542b","observation_id":"9b5db611-bbed-474b-b666-03eec225d1b9","resolution":{"observed_at":"2026-08-15T18:27:59.321667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.325619Z","title":"Transfusion: Robust lidar-camera fusion for 3d object detection with transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.325619Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:acd24750fb0fa43a045054edddf72867c2f115d8a3351571e8dd17efd2d8b48e","observation_id":"4c54e19a-89e4-43f2-aec7-dfdce680d44f","resolution":{"observed_at":"2026-08-15T18:27:59.325619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.329146Z","title":"Learning cross-modal deep representations for robust pedestrian detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.329146Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:bc7c738bd1f8d0686f556f880babb835867064a8c470f9a9d28eddf5c01e1865","observation_id":"2127434c-02b5-418c-aedb-d9fa3ee07492","resolution":{"observed_at":"2026-08-15T18:27:59.329146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.332815Z","title":"Guided attentive feature fusion for multispectral pedestrian detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.332815Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:08e83a83a19a50445720096565ae09bcbe9f627cb8153566f1c48d061247f225","observation_id":"6a4ebc54-41b5-4539-8814-f8ba6b3a6af1","resolution":{"observed_at":"2026-08-15T18:27:59.332815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.336592Z","title":"Removal and selection: Improving rgb-infrared object detection via coarse-to-fine fusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.336592Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:15861f8d4da980f31e6ebba7e40789969f4a7479764698ba3bf0ef10eb675cfd","observation_id":"f02aef6e-8b19-4174-95dc-278b9b35e152","resolution":{"observed_at":"2026-08-15T18:27:59.336592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.340404Z","title":"Deep continuous fusion for multi-sensor 3d object detection,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.340404Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:e87b0011f12d71e6c8138452b2b6ad0cb023a25fa4fc1fbc246612a1ed51018e","observation_id":"353af0f4-c004-47a2-b546-67e65a888e0b","resolution":{"observed_at":"2026-08-15T18:27:59.340404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.344214Z","title":"Cross-modality 3d object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.344214Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:5077965fae95396884f172618ad04bb7403815854cf9f7e940554bf7233d9702","observation_id":"74bad30a-b55c-40dc-8cc6-2549ae2fea77","resolution":{"observed_at":"2026-08-15T18:27:59.344214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.348213Z","title":"Multi-task multi-sensor fusion for 3d object detection,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.348213Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:19613430e0aafff65601833838f4312ffda8ec1b424062e57179f56f89c84cff","observation_id":"eb457e84-4dc4-4a8b-a97b-4e28de714f15","resolution":{"observed_at":"2026-08-15T18:27:59.348213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.352056Z","title":"Epnet: Enhancing point features with image semantics for 3d object detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.352056Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:0b77a5a72169b0f4fa60d0774d4152c41f2ebf5b2eec9a318f233f9d610f481c","observation_id":"711a68c9-fa63-45c9-aaea-4503f7524d0e","resolution":{"observed_at":"2026-08-15T18:27:59.352056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.356455Z","title":"Epnet++: Cas- cade bi-directional fusion for multi-modal 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.356455Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:53ee177c512a3d9359ad98926244cba3fedc80967356e3c4833f02b55dd5bd7b","observation_id":"d03677b7-ddab-4fbb-823b-d155da50546f","resolution":{"observed_at":"2026-08-15T18:27:59.356455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.360926Z","title":"Dense voxel fusion for 3d object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.360926Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:56c187196f2f60798a19c226a364106df35d94e61707f2a6606fcca4150c4b85","observation_id":"7fde655f-e55a-400c-967b-669f95f96004","resolution":{"observed_at":"2026-08-15T18:27:59.360926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.365350Z","title":"Logonet: Towards accurate 3d object detection with local-to-global cross-modal fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.365350Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:1fda3b5ffb41ace34acc79db07e06363f73959b10d658c925b57b68e2aebad6b","observation_id":"337dfc6d-ee99-4061-96d2-6455b4c033f6","resolution":{"observed_at":"2026-08-15T18:27:59.365350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.369218Z","title":"Cat-det: Contrastively augmented transformer for multi-modal 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.369218Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:f4cf52c5d4133cc2243d0df924da7ddf4d89dcf266099b95e14dca79eaafeb5c","observation_id":"84ec30f2-e99d-4b64-be70-df337d0a3646","resolution":{"observed_at":"2026-08-15T18:27:59.369218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.373639Z","title":"Sea- date: Remedy dual-attention transformer with semantic alignment via contrast learning for multimodal object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.373639Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:0587271571e309e17f75c4081abff2c3358cd91673935c4808ce49f5b1af4ba7","observation_id":"788f3f34-4505-490e-94b1-cc44abc4b494","resolution":{"observed_at":"2026-08-15T18:27:59.373639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09146","last_updated":"2024-04-14T05:28:46Z","snapshot_observed_at":"2026-08-16T14:01:09.100178Z","submitted_at":"2024-04-14T05:28:46Z","title":"Fusion-Mamba for Cross-modality Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09146","snapshot_observed_at":"2026-08-15T18:27:59.377787Z","title":"Fusion-mamba for cross-modality object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.377787Z"},"links":{"cited_paper":"/paper/2404.09146","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:a58bc2f92e182c7373d3be482ca56a2426dfa8935ab8f93d1683b01944b5c5c4","observation_id":"0abf2c25-84ff-402c-aa00-a06f9b753589","resolution":{"observed_at":"2026-08-15T18:27:59.377787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.02202","last_updated":"2022-09-25T07:19:32Z","snapshot_observed_at":"2026-08-17T12:35:14.591524Z","submitted_at":"2022-07-05T17:59:28Z","title":"CoBEVT: Cooperative Bird's Eye View Semantic Segmentation with Sparse Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.02202","snapshot_observed_at":"2026-08-15T18:27:59.383488Z","title":"Cobevt: Cooper- ative bird’s eye view semantic segmentation with sparse transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.383488Z"},"links":{"cited_paper":"/paper/2207.02202","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:9a0216ce66a45e3ff61b94633ef33e9d02dd5f976b1c0b4441837eb2944b85f8","observation_id":"2c33071e-d68b-47a1-8403-77db50fc3195","resolution":{"observed_at":"2026-08-15T18:27:59.383488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.388002Z","title":"Collaboration helps camera overtake lidar in 3d detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.388002Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:a20969e71fd009b8cd83db39930dae3c67b2cc8e8e9b3f1c920ef465074b55ee","observation_id":"94c0090d-c792-4fe4-9043-525a189312d6","resolution":{"observed_at":"2026-08-15T18:27:59.388002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.392089Z","title":"V2vnet: Vehicle-to-vehicle communication for joint perception and prediction,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.392089Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:b2eda9b02b2f4debe8e30e4666ef9353e73903109a8e667a638ab68955abb354","observation_id":"3372e87a-1edb-42e4-96ae-4577aac4d92c","resolution":{"observed_at":"2026-08-15T18:27:59.392089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.396722Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.396722Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:07b410311950d03d7ea06cb358ef5823d275521ab3243a55cb43e132445e58ff","observation_id":"223aaa45-9f97-4986-8037-fe7bb247f81b","resolution":{"observed_at":"2026-08-15T18:27:59.396722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.400510Z","title":"Macp: Efficient model adaptation for cooperative perception,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.400510Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:c9fea70e3ceced659b20a0fcd966f1d307148563e3a6cec8984c2eb89e803b5a","observation_id":"6adaddc3-e541-48c7-8457-963678b54442","resolution":{"observed_at":"2026-08-15T18:27:59.400510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.404732Z","title":"Hm-vit: Hetero-modal vehicle-to-vehicle cooperative perception with vision transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.404732Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:656e4b44caca9bd88ef3b7597eb249ae0921b289e5be6ddfa0cbbe579e9c3244","observation_id":"c317ab31-19c4-4003-8db8-f828eba831f7","resolution":{"observed_at":"2026-08-15T18:27:59.404732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.408891Z","title":"Multi-agent collaborative perception via motion-aware robust communication network,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.408891Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:19c19644ad72972459e5c9fb1bdd53ffc7174c2f69333ff3a6d13f492a6d0ef4","observation_id":"0ad79f15-a6fe-4ace-bc3e-de45e6f8b322","resolution":{"observed_at":"2026-08-15T18:27:59.408891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.412873Z","title":"When2com: Multi-agent perception via communication graph grouping,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.412873Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:06ac9d7eee30e4274a0a24dd9bb4ca370ae6d4084e2aced3dc3ddabda9a59984","observation_id":"d65055bf-bdcd-411d-b056-8cf8f64a6c73","resolution":{"observed_at":"2026-08-15T18:27:59.412873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.416852Z","title":"Who2com: Collaborative perception via learnable handshake com- munication,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.416852Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:ebb40b692f7e4e18e780d12834c03288b82d17d2779696a25876cd8a440ebf9b","observation_id":"a77039fb-b03b-44e1-a96f-780e935686fc","resolution":{"observed_at":"2026-08-15T18:27:59.416852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.420710Z","title":"How2comm: Communication-efficient and collaboration- pragmatic multi-agent perception,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.420710Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:7a06a6ac85ca9573cb6108676558cb34212be7d4aff3c56568f39a57dd0336b7","observation_id":"446cd771-3b63-41ea-a6b5-a756576ab26e","resolution":{"observed_at":"2026-08-15T18:27:59.420710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.424447Z","title":"Communication- efficient collaborative perception via information filling with code- book,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.424447Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:e9166a5e2aaf231c55c91f00edcfd95a25c3a64bc375634c11e9730db1fa8f43","observation_id":"92e072d2-b584-4c79-946a-0dec1ae46eb1","resolution":{"observed_at":"2026-08-15T18:27:59.424447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.428348Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.428348Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:37aa15afc11a4844bfa8040f76412e662fd2277ce1491871352caa7039e12411","observation_id":"65fb6c8e-a7ab-446c-94ca-bd1ec8808126","resolution":{"observed_at":"2026-08-15T18:27:59.428348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.431942Z","title":"Bevformer v2: Adapting modern image backbones to bird’s-eye-view recognition via perspective supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.431942Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:4a2fd5cd1d7b1631c0cae484f98140420a9a162aa5bb79c25c1ac16d0b35aeab","observation_id":"6d4a1f77-6940-4a03-ae2d-0359424c510c","resolution":{"observed_at":"2026-08-15T18:27:59.431942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.437333Z","title":"Exploring object- centric temporal modeling for efficient multi-view 3d object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.437333Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:b634db694660bc2cde7a073cb61b093451878b4cf6b6f9171bda5991c42ce9fe","observation_id":"19396dbf-ade6-4bb5-a25e-fead444ee430","resolution":{"observed_at":"2026-08-15T18:27:59.437333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.441392Z","title":"Sparse4d: Multi-view 3d object detection with sparse spatial-temporal fusion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.441392Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:7e1c05ab4fbd96c51d42353079a0b6e9fe66ab43a770e0e6775f6e6b49c48daa","observation_id":"22ceabec-9675-4295-8ca3-d39758b64847","resolution":{"observed_at":"2026-08-15T18:27:59.441392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14018","last_updated":"2023-05-24T04:00:55Z","snapshot_observed_at":"2026-08-18T05:28:30.614555Z","submitted_at":"2023-05-23T12:53:58Z","title":"Sparse4D v2: Recurrent Temporal Fusion with Sparse Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14018","snapshot_observed_at":"2026-08-15T18:27:59.445435Z","title":"Sparse4d v2: Recurrent temporal fusion with sparse model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.445435Z"},"links":{"cited_paper":"/paper/2305.14018","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:fd4938745796b9df59fe95fb73172f18504bf3a3036ff167ebd65f7639d21de2","observation_id":"dbd7e775-7366-457e-b201-68788dc587c4","resolution":{"observed_at":"2026-08-15T18:27:59.445435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.450294Z","title":"Sparse4d v3: Advancing end-to-end 3d detection and tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.450294Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:f0a28f8b616c507d6dd69eb269021fa15cba401546e5a57814fe7974c89d4048","observation_id":"66aa7e0c-8efc-4a91-805c-ebf83f3c532c","resolution":{"observed_at":"2026-08-15T18:27:59.450294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.454825Z","title":"Sparsefusion3d: Sparse sensor fusion for 3d object detection by radar and camera in environmental perception,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.454825Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:e0b66688cc357b0a7fa31b3a0cd615b44849b38a66d9a5fac713fd4398da8867","observation_id":"e8b5a7a3-345d-4958-8afc-2b692c8aa4b3","resolution":{"observed_at":"2026-08-15T18:27:59.454825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.458780Z","title":"Planning-oriented autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.458780Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:b79460e719123a68d3fa3e76c4d891d767a132970a93544c0a29ebd806e3d489","observation_id":"7dea2c14-91fb-4d6f-8f9b-d2315407f495","resolution":{"observed_at":"2026-08-15T18:27:59.458780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01006","last_updated":"2023-08-14T08:28:32Z","snapshot_observed_at":"2026-08-16T15:11:24.850733Z","submitted_at":"2023-08-02T08:29:44Z","title":"FusionAD: Multi-modality Fusion for Prediction and Planning Tasks of Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01006","snapshot_observed_at":"2026-08-15T18:27:59.462747Z","title":"Fusionad: Multi-modality fusion for prediction and planning tasks of autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.462747Z"},"links":{"cited_paper":"/paper/2308.01006","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:60cffcc737210daeb0de05b12b1ead098e07d9dc7f4fd3cb68b6c6710adfc2c0","observation_id":"e1435bc5-0bf8-4bd2-b6eb-3f9a932b3e6b","resolution":{"observed_at":"2026-08-15T18:27:59.462747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.467206Z","title":"Rcbevdet: Radar-camera fusion in bird’s eye view for 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.467206Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:97ebc4b05292e496fee691168100ae7ab22b722e80a1fe77612585362185ef7e","observation_id":"1cd89c83-7ebb-452c-9cd0-7b533f713423","resolution":{"observed_at":"2026-08-15T18:27:59.467206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:01.045153Z","title":"Vision-centric bev perception: A survey,","venue":null,"work_id":"dffeea08-97ea-4b03-9adc-b0b7cd319ef7","year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.471227Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:2b5fa584d9cbba556331bd06c9aa05c29f00a57945ce2b8834556b2a86524099","observation_id":"6d772103-cc83-4224-9213-58a059225807","resolution":{"observed_at":"2026-08-15T18:28:01.050283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.475723Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.475723Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:3c3d937d434af406f2f34da7e46944751a49ff01267e99bae93da3f5cfa90879","observation_id":"049d072f-0111-4fd5-91c2-b3f621a09527","resolution":{"observed_at":"2026-08-15T18:27:59.475723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:01.021631Z","title":"Deformable DETR: Deformable transformers for end-to-end object detection,","venue":null,"work_id":"9210d47d-a3dd-40b5-a8f6-f6b08341086c","year":2021},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.479724Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:49f0636252f519ce59e946a8a970249b303553d533f7c3bcbdc72bf308be2ed2","observation_id":"e007338f-a0dc-405b-a85e-c39b55c27243","resolution":{"observed_at":"2026-08-15T18:28:01.026014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:27:59.484800Z","title":"Detr3d: 3d object detection from multi-view images via 3d- to-2d queries,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.484800Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:0e4754753741e3e5b586a3647e6563fd01587677cf61cb146fe1e03915ecacf2","observation_id":"964efb1b-1cea-499f-bf85-ff32bf682b70","resolution":{"observed_at":"2026-08-15T18:27:59.484800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.999719Z","title":"Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly estimating depth,","venue":null,"work_id":"b2e4a99f-1c7b-4324-9b68-06c57ebb495c","year":2020},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.489858Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:26ae7b67b332fd5c6f7eae981953289bc0b697065b46a0dbc7cc0199eff4a832","observation_id":"21acf919-eb71-40f0-9973-b1286bfccf31","resolution":{"observed_at":"2026-08-15T18:28:01.004836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17054","last_updated":"2022-06-16T09:44:08Z","snapshot_observed_at":"2026-08-16T17:10:15.129652Z","submitted_at":"2022-03-31T14:21:19Z","title":"BEVDet4D: Exploit Temporal Cues in Multi-camera 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17054","snapshot_observed_at":"2026-08-15T18:27:59.494120Z","title":"Bevdet4d: Exploit temporal cues in multi- camera 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.494120Z"},"links":{"cited_paper":"/paper/2203.17054","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:f476173e298c3d622ba615f693ef75add8a9cb5c46bcf94a1b616e9af1e57921","observation_id":"163f9942-8207-48e4-981e-a39e1cccfe54","resolution":{"observed_at":"2026-08-15T18:27:59.494120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.984963Z","title":"Bevdet: High- performance multi-camera 3d object detection in bird-eye-view,","venue":null,"work_id":"7750f002-c34e-4109-a8eb-ec523962d407","year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.499100Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:aece5cc73fe255f951644a8119a880a0fe3514fa8aafca21fae187b9a32d5bc1","observation_id":"ce11b22e-a837-4247-8457-963fc35fc0de","resolution":{"observed_at":"2026-08-15T18:28:00.990805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09743","last_updated":"2022-05-19T17:55:35Z","snapshot_observed_at":"2026-08-16T16:59:06.184750Z","submitted_at":"2022-05-19T17:55:35Z","title":"BEVerse: Unified Perception and Prediction in Birds-Eye-View for Vision-Centric Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09743","snapshot_observed_at":"2026-08-15T18:27:59.503489Z","title":"Beverse: Unified perception and prediction in birds-eye-view for vision-centric autonomous driving,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.503489Z"},"links":{"cited_paper":"/paper/2205.09743","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:b3be26be5b501f702c16dd8076cd81a4c9d12e37781e5dd79f4a5653392f5fc7","observation_id":"9d1abb3b-0da4-42c3-9aef-78293f98b257","resolution":{"observed_at":"2026-08-15T18:27:59.503489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.968199Z","title":"Unifusion: Unified multi-view fusion transformer for spatial-temporal representation in bird’s-eye-view,","venue":null,"work_id":"9000cec5-fdb1-48a4-95eb-b825ac1fc114","year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.507753Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:3d60a40981e1850fcf75fdd038b871570e700dbde8001af0fe6a8822fa503b12","observation_id":"515291d6-1086-489c-ae55-2b29a4fd9e85","resolution":{"observed_at":"2026-08-15T18:28:00.973947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.954914Z","title":"Tbp-former: Learning temporal bird’s-eye-view pyramid for joint perception and prediction in vision-centric autonomous driving,","venue":null,"work_id":"4d347192-5eb1-410e-b3ea-c0fc99d3029f","year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.512422Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:2c94eb0ddb522680b4ca6a19246ea573fff3c2d291f7200e4624525f0885297b","observation_id":"4a8cabde-9d50-4241-8095-a16fb26950aa","resolution":{"observed_at":"2026-08-15T18:28:00.959619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11323","last_updated":"2023-07-21T03:08:28Z","snapshot_observed_at":"2026-08-16T15:14:28.641864Z","submitted_at":"2023-07-21T03:08:28Z","title":"HVDetFusion: A Simple and Robust Camera-Radar Fusion Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11323","snapshot_observed_at":"2026-08-15T18:27:59.516415Z","title":"Hvdetfusion: A simple and robust camera-radar fusion framework,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.516415Z"},"links":{"cited_paper":"/paper/2307.11323","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:d8418f30ee00546a5075695f96ea3354be8ea2ac2495b565d183897021593b8e","observation_id":"a8422bf3-87bf-4995-a6c8-6cedcfd64df4","resolution":{"observed_at":"2026-08-15T18:27:59.516415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.942078Z","title":"Mutr3d: A multi- camera tracking framework via 3d-to-2d queries,","venue":null,"work_id":"6c772ed0-51fc-4941-910a-c6f810ae9990","year":2022},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.521011Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:da051db20327a5b15b0f3f5e8805189f87a4bb097ca447f871b8ee1df8799490","observation_id":"1996df73-1c99-431e-82aa-5a9dc66122e2","resolution":{"observed_at":"2026-08-15T18:28:00.946890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.929926Z","title":"Standing between past and future: Spatio-temporal modeling for multi-camera 3d multi-object tracking,","venue":null,"work_id":"c72e6b25-3fb1-4f2a-a5be-ccd04c49ba31","year":2023},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.525900Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:8c0d132ed80f4fcabe312876946e73197418dae725024801a29f7443448e0196","observation_id":"e1cd53c5-75fb-4bcf-8d22-a64108702112","resolution":{"observed_at":"2026-08-15T18:28:00.934218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.917447Z","title":"Fusionformer: A concise unified feature fusion transformer for 3D pose estimation,","venue":null,"work_id":"d76afd9f-a8a3-4702-9811-f05eac175cce","year":2024},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.529650Z"},"links":{"citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:77346518ae06a12504b67de20ccaa6270ba8a72f91c0f8ceee833b01f5251a32","observation_id":"e8325c01-f197-49c0-a904-2c213558e743","resolution":{"observed_at":"2026-08-15T18:28:00.921644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":89,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":153},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 153 outbound references and 1 inbound Pith citation observation for arXiv:2506.19769."}