{"as_of":"2026-08-10T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8c71dbffdbb51d5ab6a1f51d81e87bec0f246ceecc2b438516b0c62fb031077","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T20:38:37.565303Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24224/citation-record","integrity":"/paper/2607.24224/integrity","json":"/paper/2607.24224/citation-record.json","paper":"/paper/2607.24224"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.281523Z","title":"Modeling interactions between autonomous agents in a multi-agent self-awareness architecture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.281523Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:5b3dc41c3e65a12e0fe25a5afac47f3de31a6a45e3153242c62eaf6fe27c0c29","observation_id":"e64d1923-c86c-4a5d-9140-2d82c2fc6823","resolution":{"observed_at":"2026-07-31T20:38:37.281523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.287458Z","title":"Privacy-concealing coopera- tive perception for bev scene segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.287458Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:f23282e1bce3a99f89b2942cbe21a43e77a5e8e4500c3b2ed66eafa48027102a","observation_id":"8440c05c-3c91-4856-b17a-528746be26ed","resolution":{"observed_at":"2026-07-31T20:38:37.287458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.292615Z","title":"Nitedr: Nighttime image de-raining with cross-view sensor cooperative learning for dynamic driving scenes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.292615Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:4aa1cbd4a3c4dd0300069a87149b6aa626022b14948712fa243924b7d26dd9bc","observation_id":"3ca7f860-fd39-41b9-8904-2375d021849b","resolution":{"observed_at":"2026-07-31T20:38:37.292615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.297921Z","title":"Ubtransformer: Uncertainty-based transformer model for complex scenarios detection in autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.297921Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:07c4da4adfc3a918b40557e8d30b838cc333b77d2c046f136bab5ec3c2503067","observation_id":"b2c1275c-5e36-465d-95bc-391636c3140d","resolution":{"observed_at":"2026-07-31T20:38:37.297921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.302585Z","title":"Physical adversarial attacks for camera-based smart systems: Current trends, categorization, applications, research challenges, and future outlook,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.302585Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:cc71e9237154bda059a6afbe2ed20de4fa40ef9dcae30ab0238c970627a9c41e","observation_id":"890ff969-2f36-4564-b3ab-44e8750f5d6e","resolution":{"observed_at":"2026-07-31T20:38:37.302585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.307414Z","title":"Lif-seg: Lidar and camera image fusion for 3d lidar semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.307414Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:8b57c8e498aa515998b40633587fdc2700036a67ddb51639990aed478b22d585","observation_id":"de9cfdee-5272-458f-93f6-9d699031035e","resolution":{"observed_at":"2026-07-31T20:38:37.307414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.312578Z","title":"Synet: A synergistic network for 3d object detection through geometric-semantic-based multi- interaction fusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.312578Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:3f0c3ff3a12061e65d5d225d4ecc8d48c4b3e6c7b6fe8f69e1b05f036795169c","observation_id":"229fb365-9e5d-412d-aff8-5adc890f0367","resolution":{"observed_at":"2026-07-31T20:38:37.312578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.316875Z","title":"Multi-sensor fusion and cooperative perception for autonomous driving: A review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.316875Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:8bb4fed7a3424409628dc3c6bf4264846c946c750c892e17db491becd3abd776","observation_id":"65067286-d310-498b-ba96-d6aee888b96c","resolution":{"observed_at":"2026-07-31T20:38:37.316875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.321204Z","title":"Cg-mae: Bev masked autoencoders based on cross-modal guidance for 3d object detection in autonomous driving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.321204Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:9bea47680dc7a1ce53c5f68f6ca45bdd24342220ec75b5ff9c1dd6372488eba1","observation_id":"759276d6-7977-4339-b542-b44ada66d543","resolution":{"observed_at":"2026-07-31T20:38:37.321204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.325363Z","title":"Transfusion: Robust lidar-camera fusion for 3d object detection with transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.325363Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:70b23a2d6630cdb59808b085db0c5b352ff158dd0bb83dac4d7009ab251b709c","observation_id":"2626b1f7-859f-4019-ab1b-2ecda03471a2","resolution":{"observed_at":"2026-07-31T20:38:37.325363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.329649Z","title":"Mapfusion: A novel bev feature fusion network for multi-modal map construction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.329649Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:6d1afcbefe66e46f2d4a8eaf207b48463dd75f25e561922bb96f6db92968965e","observation_id":"f0f013fd-9782-42ce-a3f7-8102ff50aef6","resolution":{"observed_at":"2026-07-31T20:38:37.329649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.335356Z","title":"Bevfusion: Multi-task multi-sensor fusion with unified bird’s-eye view representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.335356Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:0fd1bb99b6e65a8942cd9624de8208564f6b1b78a42884e450857c6ca5a1bd3f","observation_id":"d60c57d8-d1be-4e1e-98bb-91f5c9e6ca9a","resolution":{"observed_at":"2026-07-31T20:38:37.335356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.339611Z","title":"Mta: Multimodal task alignment for bev perception and captioning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.339611Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:439002fbaace35fd282838485d847f9e420658b87a1ea00d0d8ef93a2f66f7fe","observation_id":"bedfc64e-e907-4c78-89b6-47aa0557ae82","resolution":{"observed_at":"2026-07-31T20:38:37.339611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.343995Z","title":"M3net: Multimodal multi-task learning for 3d detection, segmentation, and occupancy prediction in autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.343995Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:f0864243794ad1b3bf21ea4b1ef69678c0c38d6b9c24d6bebe53e5a8e470427c","observation_id":"6a59ece2-7293-45b8-b5d0-36daf918b63d","resolution":{"observed_at":"2026-07-31T20:38:37.343995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.348141Z","title":"Fuller: Unified multi-modality multi-task 3d perception via multi-level gradient calibration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.348141Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:f15fc73a3655dafd742a3648d7f9a8b29c152bd995c8f3571afd737e2a9fbbb7","observation_id":"c8fe9a96-a2e6-4f93-a78c-7840926c2a16","resolution":{"observed_at":"2026-07-31T20:38:37.348141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05088","last_updated":"2022-04-19T05:40:19Z","snapshot_observed_at":"2026-07-06T12:58:57.155515Z","submitted_at":"2022-04-11T13:43:25Z","title":"M$^2$BEV: Multi-Camera Joint 3D Detection and Segmentation with Unified Birds-Eye View Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05088","snapshot_observed_at":"2026-07-31T20:38:37.352420Z","title":"M2bev: multi-camera joint 3d detection and seg- mentation with unified birds-eye view representation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.352420Z"},"links":{"cited_paper":"/paper/2204.05088","citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:6b4e4ea4c73f601e19b0cda9744b468473ad01a7b314af71b1942ec53a56665a","observation_id":"b092e448-5338-4472-9cde-e962bac1be24","resolution":{"observed_at":"2026-07-31T20:38:37.352420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.357929Z","title":"Unitr: A unified and efficient multi-modal transformer for bird’s-eye- view representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.357929Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:dd683bb77ddd46dcaae52b732fb20915942e8255e0fbad6d0518e7ebdbce8d45","observation_id":"469c5d0a-cc65-4d49-84d2-2ed33cccd50f","resolution":{"observed_at":"2026-07-31T20:38:37.357929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.362343Z","title":"Maskbev: Towards a unified framework for bev detection and map seg- mentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.362343Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:22844942d2dcd814185505180968bc5f56158a7e8c0cef3423ed44be809d907b","observation_id":"4579b44b-b931-4409-b68d-5a6ead173116","resolution":{"observed_at":"2026-07-31T20:38:37.362343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.366717Z","title":"nuscenes: A multimodal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.366717Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:fc85fd729f78369a8a49965dac40ed13e21ca1ddc9dd93cc3429ec3774dd0779","observation_id":"a42ce000-adde-4a51-9e7e-88c117f2fb7d","resolution":{"observed_at":"2026-07-31T20:38:37.366717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.371325Z","title":"Deep learning for 3d point clouds: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.371325Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:e7d550785bb027efb8685006a28a4205fdae079af80f6caf706c8972dea6d9b3","observation_id":"da11ec59-1e35-47db-814c-eaa454b91a4b","resolution":{"observed_at":"2026-07-31T20:38:37.371325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.375437Z","title":"Automotive radars: A review of signal processing techniques,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.375437Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:2878e955c38644509e411bdc7f969eb285fac1564d95115b8a93bb7136c17cac","observation_id":"846b80c6-9595-4eeb-8a48-687999043179","resolution":{"observed_at":"2026-07-31T20:38:37.375437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.379897Z","title":"Static multitarget- based autocalibration of rgb cameras, 3-d radar, and 3-d lidar sensors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.379897Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:242159d566e71748ebd24a3daefbce5007f93a2b522d7d1a5b90be15f206f679","observation_id":"0656571f-d805-4534-8683-37b4488687a6","resolution":{"observed_at":"2026-07-31T20:38:37.379897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.384276Z","title":"High dimensional frustum pointnet for 3d object detection from camera, lidar, and radar,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.384276Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:0b429919b56d94ca2b94b45adda24db0226c3ddd482abadcee8f03091527cf53","observation_id":"a3101ce2-24d0-47f4-ba58-ccb4ce82025e","resolution":{"observed_at":"2026-07-31T20:38:37.384276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.389054Z","title":"Ezfusion: A close look at the integration of lidar, millimeter-wave radar, and camera for accurate 3d object detection and tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.389054Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:31055ec893174a81b7272176dd763c2f25f92dd7b2a19177b2bb4035c9d6de2e","observation_id":"4bb97308-05d1-4692-af81-355b95224161","resolution":{"observed_at":"2026-07-31T20:38:37.389054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.393779Z","title":"Camera, lidar, and radar sensor fusion based on bayesian neural network (clr-bnn),","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.393779Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:bc5a837d78dd9e86890b8e2b54bbe2de2196e693e11917f13c844765b0d42088","observation_id":"90675b89-f8ed-4296-9fdb-7ec7fffd4cba","resolution":{"observed_at":"2026-07-31T20:38:37.393779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.398551Z","title":"Mt-detr: Robust end-to-end multimodal detection with confidence fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.398551Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:774674d851c6ec187af8ab1e0b32eee7e25b17e7b4a4661beb0177f5dd81fca0","observation_id":"9d803f52-58a1-4609-a425-db4c6a2a427d","resolution":{"observed_at":"2026-07-31T20:38:37.398551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.402868Z","title":"Rcm-fusion: Radar-camera multi-level fusion for 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.402868Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:0d3bdf6a8d949424a72268c8c22dbb907c516959e8d4aa2c9791a843add1e8ed","observation_id":"8533b8b2-b7c9-44ea-8287-cb44645d9a92","resolution":{"observed_at":"2026-07-31T20:38:37.402868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.407305Z","title":"Bridging the view disparity between radar and camera features for multi-modal fusion 3d object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.407305Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:dcfa2002af96d159247a8cc7df0230d5d2c73467000ec46656bbf11e2debb18b","observation_id":"d52f972b-3d8c-4481-bfb9-6f33478c2d0c","resolution":{"observed_at":"2026-07-31T20:38:37.407305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.411306Z","title":"Simple- bev: What really matters for multi-sensor bev perception?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.411306Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:d48eeb9cc81030eef7d8c627005031ac35896e2fd2acf89f8686408fc1a833d5","observation_id":"342399fa-24e9-48a5-96ca-6d42f9e0803b","resolution":{"observed_at":"2026-07-31T20:38:37.411306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.415356Z","title":"Multifusionnet: Spatio-temporal camera-radar fusion in dynamic urban environments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.415356Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:311ac3e7a354d659ef95ebb7afce53c34135481c5ac976a85688e062c393e6b8","observation_id":"46cb9254-40e6-44d1-8b11-8831a854f732","resolution":{"observed_at":"2026-07-31T20:38:37.415356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.419640Z","title":"Rcbevdet: Radar-camera fusion in bird’s eye view for 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.419640Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:85017bf19da7c2752792749232005f93103ffaa567b86ba265620d7f85280fed","observation_id":"460fe63d-f648-4151-aed9-d4cc09e0f6ad","resolution":{"observed_at":"2026-07-31T20:38:37.419640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.424011Z","title":"Eliminating cross-modal conflicts in bev space for lidar-camera 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.424011Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:51d98f2d0527c1f9f0af69ccc1acc07ecb293da5135e1057f942af0951be35e8","observation_id":"31f780ea-a013-4d8a-bda3-9ec112e9667f","resolution":{"observed_at":"2026-07-31T20:38:37.424011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.428283Z","title":"Henet: Hybrid encoding for end-to-end multi-task 3d perception from multi-view cameras,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.428283Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:2c34f50b75c2bfa383f5baa926e46e4baf2d416fa2b73fc3c7c741ec9fcfb828","observation_id":"db4f40f0-faaf-4c2d-a5b2-20bf94051042","resolution":{"observed_at":"2026-07-31T20:38:37.428283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.432247Z","title":"Adversarial multi-task learning for liver tumor segmentation, dynamic enhancement regression, and classification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.432247Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:ae8ff697689d886ce07998cfbb9cd2fddf4550ebfbae2e52d58b008bc435d1b0","observation_id":"0862b9e5-7961-4018-840d-d1eb7f45e6db","resolution":{"observed_at":"2026-07-31T20:38:37.432247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.436420Z","title":"Quadbev: An efficient quadruple-task perception framework via birds’- eye-view representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.436420Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:088a0b4bc402cfdb06b4f34799b7ff1b8af5c4adb3b9219dcb8d81c73a3f932c","observation_id":"e849de77-3455-455e-b517-faa577495701","resolution":{"observed_at":"2026-07-31T20:38:37.436420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.441010Z","title":"Msc-bench: Benchmarking and analyzing multi-sensor corrup- tion for driving perception,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.441010Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:183bdd4fe33cac93259e45b5f28e3c9e4076c1681b9101098d6921b512cb8f5c","observation_id":"7cbf1193-167e-4d05-b287-ef5e2acbaa36","resolution":{"observed_at":"2026-07-31T20:38:37.441010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.445261Z","title":"Sgformer: Semantic-geometry fusion transformer for multi-modal 3d panoptic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.445261Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:7671f3afa7c1b182e7840984a980706b15c9990230f2e72a590a36c250469a87","observation_id":"65542c8e-b448-4b02-af85-c988d8694193","resolution":{"observed_at":"2026-07-31T20:38:37.445261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.449615Z","title":"Graphbev: Towards robust bev feature alignment for multi-modal 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.449615Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:96f9d90aa13b935a5ae7a0fcc68c9f114b3caf2a7af9f600a709fdece7f191a2","observation_id":"09fde5e4-fc1f-436f-9ed5-eb3582c883af","resolution":{"observed_at":"2026-07-31T20:38:37.449615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.454132Z","title":"Cmgfa: A bev segmentation model based on cross-modal group-mix attention feature aggregator,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.454132Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:e3e4eaaa7d5a68a56e97b5707e9f5dff52218060bf3766491716fcba641c2991","observation_id":"87488360-d215-4f39-a3a6-b7dc2a2392b3","resolution":{"observed_at":"2026-07-31T20:38:37.454132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.458545Z","title":"Filter-based deep-compression with global average pooling for convolutional net- works,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.458545Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:e5f9418c9660b547efcc849249db0cb285b7949828a3b896df52026c07ae14e5","observation_id":"43cbca86-7873-42a3-aa25-eb6325a5d6f1","resolution":{"observed_at":"2026-07-31T20:38:37.458545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.462783Z","title":"Convolution in convolution for network in network,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.462783Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:d7e35542db8301aba274bbf3e3be21ff6bcdf8d2d15bbad8e674624b6a5ce897","observation_id":"c455d966-28be-42f5-b98d-f6c3fa5ee43b","resolution":{"observed_at":"2026-07-31T20:38:37.462783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-07-31T20:38:37.467203Z","title":"Deep learning using rectified linear units (relu),","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.467203Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:ab8e7e7ff4556d1ef734b887e4e311d2afcfd014497be18df0362285565c7f27","observation_id":"9612e762-e08c-4c7d-ba0f-5069fb06c5a0","resolution":{"observed_at":"2026-07-31T20:38:37.467203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.472536Z","title":"Adaptive mixtures of local experts,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.472536Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:26cd16d306f0c97f45eb99aa2745277be7b84bfaa503612820fe82383df884a0","observation_id":"073e0bf3-7600-49df-ba54-47b9c0ee4882","resolution":{"observed_at":"2026-07-31T20:38:37.472536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.477016Z","title":"Long-tailed recog- nition by routing diverse distribution-aware experts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.477016Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:cfb4ffb55ad6ffb952ee59ae2151070e1bbb41bd29f0c62e4d13086957b26157","observation_id":"f1df9848-08b4-421c-be04-3edf93d31347","resolution":{"observed_at":"2026-07-31T20:38:37.477016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.481350Z","title":"Adamv-moe: Adaptive multi-task vision mixture-of-experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.481350Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:15781e835a1ef70609c6a0fa4a9b9aef295c050d63db358f19713e5874659ab8","observation_id":"b27d6334-6f30-4e0b-af3f-806c6c46372d","resolution":{"observed_at":"2026-07-31T20:38:37.481350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.485848Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.485848Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:c88f62ee1148014babed7cb7cf417af103c51df311844fef98a86ba35dc425e2","observation_id":"3838c5da-951b-427f-81d7-8386f291a2ca","resolution":{"observed_at":"2026-07-31T20:38:37.485848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.490051Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.490051Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:35fa1ab12f80575f6d9042065fd99cce143d5f85208bbe2f406f9d7455960a62","observation_id":"50f3f963-108b-4839-bf13-b2219372563e","resolution":{"observed_at":"2026-07-31T20:38:37.490051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.494673Z","title":"X-align: Cross-modal cross-view alignment for bird’s-eye-view segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.494673Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:f5376f4912f3b76f38df1fdbfcc1ef9a82e90afeedc6b4c72c21f096d95ab1ae","observation_id":"d62c801e-65c9-4258-96f9-ba622f3955b9","resolution":{"observed_at":"2026-07-31T20:38:37.494673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.499116Z","title":"Bevformer: learning bird’s-eye-view representation from lidar-camera via spatiotemporal transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.499116Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:685b2135ba5d51f5b0fbaf553770da9515016083d9a1eeae19e11d3e875cbf86","observation_id":"01295c1f-93ec-4ecb-9cb3-79f37c128e1a","resolution":{"observed_at":"2026-07-31T20:38:37.499116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.503273Z","title":"Pointpillars: Fast encoders for object detection from point clouds,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.503273Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:800a2b9aa03e46cb3c368cab1b3f4422f87bc6d611f973983a174f6cec9d38c1","observation_id":"0d7d8dc8-4153-4348-bd39-cd65250b1900","resolution":{"observed_at":"2026-07-31T20:38:37.503273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.507329Z","title":"Center-based 3d object detection and tracking,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.507329Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:72edb6afc7eb15327796500ac0c4ef87c7217216a9114b3d1f93de840406ca74","observation_id":"3d3a5b56-2685-468f-8fbc-6864432b576c","resolution":{"observed_at":"2026-07-31T20:38:37.507329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.511957Z","title":"Focalformer3d: focusing on hard instance for 3d object JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2015 12 detection,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.511957Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:b12d8e469d409dd516efa182d1a7da218e17d7970193ccfd7c99a9194f6b8d02","observation_id":"0675447a-5a47-4064-a529-0986c4443754","resolution":{"observed_at":"2026-07-31T20:38:37.511957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.516216Z","title":"Safdnet: A simple and effective network for fully sparse 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.516216Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:c8a7e579371d9446a3e68179ea97251b23374bdf3ae158ea6bb7b8d17140b6a5","observation_id":"e2283725-a02b-44a5-afb7-94f6a5becb31","resolution":{"observed_at":"2026-07-31T20:38:37.516216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.520508Z","title":"Pointpainting: Se- quential fusion for 3d object detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.520508Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:9141f01736038063b174133a14eed96b4a9f54f387e221ea3f29efa8303d889c","observation_id":"81497507-0f8d-42e5-8533-5089d8b19347","resolution":{"observed_at":"2026-07-31T20:38:37.520508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.524956Z","title":"Futr3d: A unified sensor fusion framework for 3d detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.524956Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:8355b29691c46bd3142292494c732aae214dfcf6854683884ae2c0d4f9bdf0dc","observation_id":"86c311eb-dec4-40e6-90f7-1eda61f53ff0","resolution":{"observed_at":"2026-07-31T20:38:37.524956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.529684Z","title":"Multimodal virtual point 3d detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.529684Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:05bc555a7dde4c2efd118a15a098b719a05302f58bf0e49b3059b6e61ead2328","observation_id":"f7eb9173-a257-4fc9-b83e-78464ffa692a","resolution":{"observed_at":"2026-07-31T20:38:37.529684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.534445Z","title":"Mbfusion: A new multi-modal bev feature fusion method for hd map construction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.534445Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:c2eeb4f98a41b87359a15748032c13a26e355842134501c7d2002f750c0a45d9","observation_id":"755e74f2-fef4-45cd-a98b-2810c678b7e5","resolution":{"observed_at":"2026-07-31T20:38:37.534445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.539018Z","title":"Maptr: Structured modeling and learning for online vectorized hd map construction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.539018Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:525dadd4b8e7bd2a2be2906dffbd6209595124aa3e4a02ee89257c90b60a6d61","observation_id":"42b8c2e3-d8b7-46f9-bc55-550ac56570dd","resolution":{"observed_at":"2026-07-31T20:38:37.539018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.543137Z","title":"Smab: Simple multimodal attention for effective bev fusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.543137Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:e0bbcfe0f72ca5ba60bfa799ff585c14378da43884a8801303b05f1e970f46c1","observation_id":"b7c271ee-abcf-4f79-93f5-02d0e392547b","resolution":{"observed_at":"2026-07-31T20:38:37.543137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.547685Z","title":"Henet++: Hybrid encoding and multi-task learning for 3d perception and end-to-end autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.547685Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:d819111e634c6921035cead0e24bab1a37c6f6ac9f1d066331468749152495fa","observation_id":"c4e29177-7dad-405d-88bf-9799b006a4de","resolution":{"observed_at":"2026-07-31T20:38:37.547685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.552206Z","title":"Unisparsebev: A multi-task learning framework with unified sparse query for autonomous driving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.552206Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:eb0d55a7088980a21aec0bd906a2eabeb815712c9b51c37f4909825745d6b966","observation_id":"c2224070-e2e8-458e-8bc4-bb74a8152c2d","resolution":{"observed_at":"2026-07-31T20:38:37.552206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.556848Z","title":"Daocc: 3d object detection assisted multi- sensor fusion for 3d occupancy prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.556848Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:2c600bb88965f3a1e157290b8f763b036a8aefe3a9e054cd7f9a9b5a307215e4","observation_id":"56df480d-4e37-45a6-a178-df4b0ae6125b","resolution":{"observed_at":"2026-07-31T20:38:37.556848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.561341Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.561341Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:016a122661bdfb3f4fb697a8a7ca0c2b9ce6e4513455294b0d728704c6e74691","observation_id":"d1c430d8-29d9-4b82-a2df-fc36d08a9f65","resolution":{"observed_at":"2026-07-31T20:38:37.561341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.565303Z","title":"Super-convergence: Very fast training of neural networks using large learning rates,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.565303Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:776ba92cdb581a96968f55b75fa323d1f0cab1c29a78557370534467916e0c4e","observation_id":"c2eb1ac7-f140-42f4-8418-aecf9fa6e9af","resolution":{"observed_at":"2026-07-31T20:38:37.565303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T02:21:14.467181Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2607.24224."}