{"as_of":"2026-08-15T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74a83b7df8f9c08028e3f7f423c6d5b7970f787a8a3ea455e789e285b4ad8419","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:42:11.656824Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:15:52.438880Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T14:04:43.002943Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04302","snapshot_observed_at":"2026-08-06T19:15:52.438880Z","title":"H-mba: Hierarchical mamba adaptation for multi-modal video understanding in autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.438880Z"},"links":{"cited_paper":"/paper/2501.04302","citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:59d0a6fab99e888ce5912016edde1c073044006634a251bbe1a04e52f1c92ecd","observation_id":"b8382273-60d4-45b3-9dad-33c9b164ae7b","resolution":{"observed_at":"2026-08-06T19:15:52.438880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2501.04302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04302","snapshot_observed_at":"2026-08-06T14:04:43.002943Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","venue":"cs.CV","work_id":"f0a8673d-3523-486c-a536-f3da5d71f753","year":2025},"citing_paper":{"arxiv_id":"2507.19778","last_updated":"2025-07-26T04:04:22Z","snapshot_observed_at":"2026-08-10T04:04:57.974693Z","submitted_at":"2025-07-26T04:04:22Z","title":"HydraMamba: Multi-Head State Space Model for Global Point Cloud Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:04:39.345413Z"},"links":{"cited_paper":"/paper/2501.04302","citing_paper":"/paper/2507.19778"},"observation_digest":"sha256:7f3fb7070ed3dce078eafccbf181a3ec53659e0fa5d1682560d1b0c26c9cbe84","observation_id":"722d3a6a-4ec0-4623-bd95-647b0f4e95e8","resolution":{"observed_at":"2026-08-06T14:04:43.006987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.04302/citation-record","integrity":"/paper/2501.04302/integrity","json":"/paper/2501.04302/citation-record.json","paper":"/paper/2501.04302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.460238Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.460238Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:4378d3246a950d9ee39d90f04d7b2bb3e49b12926edde7095c45a8b005b4d3b0","observation_id":"8046b588-95a4-400d-b001-d1762590246a","resolution":{"observed_at":"2026-08-10T21:42:11.460238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.465174Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.465174Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:1328d03f56c12bec05877b873b48f45905bac587a8486ecc88a0fd52848d3f23","observation_id":"b3b4358a-86ef-445a-98fd-39d5c4c758ba","resolution":{"observed_at":"2026-08-10T21:42:11.465174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.469461Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.469461Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:b2460043a6abebfb2f4731fd8aaa7dccc6ceb6f603d9f233ea2da64ad202450f","observation_id":"95767932-bea8-429e-86d3-f9888f8ee315","resolution":{"observed_at":"2026-08-10T21:42:11.469461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11561","last_updated":"2024-04-25T21:47:38Z","snapshot_observed_at":"2026-08-15T13:54:13.892136Z","submitted_at":"2021-12-21T22:51:37Z","title":"Explainable Artificial Intelligence for Autonomous Driving: A Comprehensive Overview and Field Guide for Future Research Directions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11561","snapshot_observed_at":"2026-08-10T21:42:11.473937Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.473937Z"},"links":{"cited_paper":"/paper/2112.11561","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:8713456f8f86df165a1782c702be8c5b263a47bd46f20df95eacbc28e2b22d9a","observation_id":"ef638c7d-25f1-4b47-aec1-bc1a0097e599","resolution":{"observed_at":"2026-08-10T21:42:11.473937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.478087Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.478087Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:e8d347a7a31c396d64c44435e5e2e02f9988be825ec16e75586e9fc09b6d7d6b","observation_id":"7d99660e-5049-4a30-a9eb-3b66f2fa7e80","resolution":{"observed_at":"2026-08-10T21:42:11.478087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.482399Z","title":"D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.482399Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:a98fba426abb30cae4165ab41376e2f25703e3aba3c7161fdf85f2921613f722","observation_id":"66d522ab-adaf-469c-afcd-38e35f6b8972","resolution":{"observed_at":"2026-08-10T21:42:11.482399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-10T21:42:11.486556Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.486556Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:682189bf62eb0d807236f96944531de6205ed80846c511e3636241e37a44beb5","observation_id":"dfc835dc-80f2-4b97-ba82-ad0b3cfc3aba","resolution":{"observed_at":"2026-08-10T21:42:11.486556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.490935Z","title":"W.; Sutton, C.; Gehrmann, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.490935Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:de7a6dd620a649a6bb21e13ef43849d412309c670eb65f9298cd25a04d03a869","observation_id":"7bed143e-f814-4c2d-8132-dc3bf8264f4b","resolution":{"observed_at":"2026-08-10T21:42:11.490935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.495532Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.495532Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:5f13e2cebb8f96b72cb73acbc2c233f794c2421b37cdd81665a50696addfdab2","observation_id":"ed1033eb-e0fd-4b77-9208-e48c9b86ba9f","resolution":{"observed_at":"2026-08-10T21:42:11.495532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.089854Z","title":"Y.; Saab, K","venue":null,"work_id":"6d2792bc-185e-4189-aa34-45ee65b3a2e8","year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.499357Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:1c5c1842720b95f50c7116927f58d8cd31d1340a16ab3979eb56855e061e96ba","observation_id":"5c686333-6659-42c3-b7b9-81c84690b386","resolution":{"observed_at":"2026-08-10T21:42:12.094607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10838","last_updated":"2020-08-26T06:27:52Z","snapshot_observed_at":"2026-08-15T06:33:17.658562Z","submitted_at":"2019-09-24T12:29:27Z","title":"Talk2Car: Taking Control of Your Self-Driving Car","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10838","snapshot_observed_at":"2026-08-10T21:42:11.503384Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.503384Z"},"links":{"cited_paper":"/paper/1909.10838","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:f14d02638277c4d2cf396d3fe3a4134989839ab3031c4d5cee4977d90b86fcd9","observation_id":"90c1ec26-17f7-4c84-8951-a94318dc27a7","resolution":{"observed_at":"2026-08-10T21:42:11.503384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T21:42:11.507878Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.507878Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:424c0a53fb74dda8d8a0fce0859a72f8822f968f91210b1b0c6e89d58949199f","observation_id":"084d3e22-717f-4407-8960-0ee2ba54b1e3","resolution":{"observed_at":"2026-08-10T21:42:11.507878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05186","last_updated":"2025-03-24T07:07:59Z","snapshot_observed_at":"2026-08-13T10:16:59.161217Z","submitted_at":"2023-09-11T01:24:13Z","title":"HiLM-D: Enhancing MLLMs with Multi-Scale High-Resolution Details for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05186","snapshot_observed_at":"2026-08-10T21:42:11.512337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.512337Z"},"links":{"cited_paper":"/paper/2309.05186","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:44174ad8d6d7dbd595491f2bf78880d63873a80b6dd5903a671836422f80a9d5","observation_id":"3f878344-7e74-4daa-9e73-aac77aca1ab8","resolution":{"observed_at":"2026-08-10T21:42:11.512337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-10T21:42:11.516368Z","title":"S.; Lynch, C.; Chowdhery, A.; Ichter, B.; Wahid, A.; Tompson, J.; Vuong, Q.; Yu, T.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.516368Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:ecbd82515d31c9e67820d95fadc07c3d07b4b91659d9a5103dc0b5b5a8f28b70","observation_id":"0d953405-1c78-4b2f-918a-2780474814fb","resolution":{"observed_at":"2026-08-10T21:42:11.516368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.077098Z","title":null,"venue":null,"work_id":"0fac7d32-8697-4a10-a07e-0f660de1378b","year":2024},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.520285Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:2d8cd54d47613a6a5042cf878b239c5aa92eb3c0c682d6cff786ee3b936b5aea","observation_id":"8959ef4a-e33c-44ec-a95d-8b81953ff95d","resolution":{"observed_at":"2026-08-10T21:42:12.080964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-10T21:42:11.523998Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.523998Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:759bc22da5e932552d4b83c7bb5b2843ec9170555dd628c654d4d2bef6d2b116","observation_id":"aaa704a1-6c60-49e0-ab39-22e4b0ad9a57","resolution":{"observed_at":"2026-08-10T21:42:11.523998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-10T21:42:11.528036Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.528036Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:4015901bfd5527b2f4e5809f1db4ed076419350b44ad94b5a158b7e33ee74e06","observation_id":"83687c86-9c76-437e-91dc-964326a91082","resolution":{"observed_at":"2026-08-10T21:42:11.528036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.531752Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.531752Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:acc5ee8bb6aaf4668b1416059a3ace5d89bc6c994320d83b88d4ece776848ba1","observation_id":"9dc00647-3152-42cd-9aee-a15920c0520a","resolution":{"observed_at":"2026-08-10T21:42:11.531752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.058786Z","title":null,"venue":null,"work_id":"943ff58c-0b36-4868-8d36-a2318deac51e","year":2021},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.535410Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:5019c89e1e237d9b1a79b8679a525d149a3b311f46a7577e9eba7660775804ad","observation_id":"fd3246e4-00de-40fc-939d-c21b51fbe474","resolution":{"observed_at":"2026-08-10T21:42:12.062745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.047748Z","title":null,"venue":null,"work_id":"544486fe-0514-46d2-aaad-6a908b61bd56","year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.542744Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:d2e385b58604bbdebf5e12e0a60fd7f2866bdb47f516e03bb8ba68f744cba794","observation_id":"c5f36a5c-64ea-499c-92d7-df05e5b13e8a","resolution":{"observed_at":"2026-08-10T21:42:12.051584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.036894Z","title":null,"venue":null,"work_id":"18ea00b4-efcd-45e2-94e3-1af87bdc38d8","year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.546889Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:98a599cf77563fa7f0d4de96e850576d61be34dae6c6fb462d236de64b9e22e6","observation_id":"d2525039-b829-41da-a3bc-598a36d3cae1","resolution":{"observed_at":"2026-08-10T21:42:12.040604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.025211Z","title":null,"venue":null,"work_id":"3df3ff9f-f469-4e4c-addf-cb479f5948bc","year":2019},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.550676Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:e9953c6b3fbcbff6c7977b12d2df3b2531397303b5ec046cc7fb240848017f43","observation_id":"69d81452-ad0a-4d71-a0ca-1965b37367e4","resolution":{"observed_at":"2026-08-10T21:42:12.029131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:12.013620Z","title":null,"venue":null,"work_id":"e9e472b1-3379-4daf-b1c8-d7aebefe8529","year":2018},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.554114Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:93a68f05e329a9b7ffaf0681f6a1f26b1cb25461735a622ed7e2f6a4795cc1b2","observation_id":"7bb22fd8-6d8e-4b8f-8d47-ce4c8da37733","resolution":{"observed_at":"2026-08-10T21:42:12.017568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.557908Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.557908Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:a93dbbd5c6820edc3b432884e613c172800fb7701f85997e77817c41fc698e41","observation_id":"340453e3-799d-4d96-8c87-493e39c0bdba","resolution":{"observed_at":"2026-08-10T21:42:11.557908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.561370Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.561370Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:9c0e2f27ea83495984a821b89e9a3f481d15b21f49c88cf65597ad5d2c293752","observation_id":"3e6d88cd-4d5e-4928-a71b-904fc1b657c1","resolution":{"observed_at":"2026-08-10T21:42:11.561370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-10T21:42:11.565112Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.565112Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:2adbbfa575f7ec7ee96bdd780bde11af2b4b0473110293ef2aaf3409b05acef5","observation_id":"725677b8-7fb1-41e6-9608-fd9506f47da7","resolution":{"observed_at":"2026-08-10T21:42:11.565112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06977","last_updated":"2024-03-12T15:22:52Z","snapshot_observed_at":"2026-08-14T14:30:30.706407Z","submitted_at":"2024-03-11T17:59:34Z","title":"VideoMamba: State Space Model for Efficient Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06977","snapshot_observed_at":"2026-08-10T21:42:11.569111Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.569111Z"},"links":{"cited_paper":"/paper/2403.06977","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:a8a6706b099012218d5b31bd12e22a124a2c9edbbc044fbbfdc50b8deb900cb1","observation_id":"9521212c-fc34-4fb2-979e-440ae27c7e8f","resolution":{"observed_at":"2026-08-10T21:42:11.569111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.987874Z","title":null,"venue":null,"work_id":"c2422516-cf77-4964-8460-1e49f65ca0ed","year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.573448Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:c29e94aaa22aa901700b14c8ad06e9f39359382a7067b4761c1bf716ed0fc9ae","observation_id":"f1e7448a-7d66-43e3-855c-e8189589e9cf","resolution":{"observed_at":"2026-08-10T21:42:11.991580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.976804Z","title":null,"venue":null,"work_id":"6c389285-5ab7-4b98-a7df-487979f29343","year":2024},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.577005Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:3d70cb11b37517093374af40604fcb47ee41084eba4f39b9763aa6a59c41d12d","observation_id":"7cc90dd5-8edc-4f31-90dd-988f6f041543","resolution":{"observed_at":"2026-08-10T21:42:11.980765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.965614Z","title":null,"venue":null,"work_id":"003fa45d-fc41-4340-9db0-ef8ecb7c47ef","year":2024},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.580604Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:a898c486a2d3bdc53a3bc421bf07018f87f88f2fb27473e060b57f74fff320a1","observation_id":"2a879e81-cf24-4596-9081-bc95434047df","resolution":{"observed_at":"2026-08-10T21:42:11.969346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10166","last_updated":"2024-12-29T14:57:13Z","snapshot_observed_at":"2026-08-14T23:44:37.704525Z","submitted_at":"2024-01-18T17:55:39Z","title":"VMamba: Visual State Space Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10166","snapshot_observed_at":"2026-08-10T21:42:11.584201Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.584201Z"},"links":{"cited_paper":"/paper/2401.10166","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:e98628234e74225e3e9f26cd1952ea3bbd51b4969eacd750b6489945b7d63f63","observation_id":"2f024a1f-ab4e-477b-aaa1-c65d25dc3daa","resolution":{"observed_at":"2026-08-10T21:42:11.584201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-10T21:42:11.588001Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.588001Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:3bcd7483d637068e5c9dc33b2956d75f98827fc677abb61e3f16a20c054d98d1","observation_id":"ee71c84b-e292-40af-9fee-b7d92da217a4","resolution":{"observed_at":"2026-08-10T21:42:11.588001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-15T17:59:50.568702Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-10T21:42:11.591661Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.591661Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:8d66d30c77e40b7440a345ab2065b4822565c8e89c7222dd18c09fd78e75ebac","observation_id":"0d7c2300-c773-404f-b17e-e1d945aebbbc","resolution":{"observed_at":"2026-08-10T21:42:11.591661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-10T21:42:11.595446Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.595446Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:fe9aa1a0e13c1d5611986bda2c8809d5922715d7adea165e06909549f6e5feb3","observation_id":"d5866bd2-488f-4feb-832c-142f0371917b","resolution":{"observed_at":"2026-08-10T21:42:11.595446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.954425Z","title":"H.; and Li, J","venue":null,"work_id":"94737b2d-3518-4c66-ae57-4ad5ed4cc5c1","year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.599089Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:7a16ca3f5a8aeff12e6a59857beecaec89ea9794eb79f2ac3bae29fed56fe5cb","observation_id":"27c01d7f-670e-4ed2-b1f7-075d34ad5e86","resolution":{"observed_at":"2026-08-10T21:42:11.958142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.602523Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.602523Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:5feac2ca69928c456f4c27f3ce8f769957742034d1e2f21bc06702d7855f6cd1","observation_id":"5114772d-5517-4fb9-bec8-4b5532e182ec","resolution":{"observed_at":"2026-08-10T21:42:11.602523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.606098Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.606098Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:9c3789355a2c27d47bc0062cb1c4543ba8f9766a72f4e281a2dab15a0d8776fb","observation_id":"173e0ef3-cebd-4761-ac67-9a339e3aec78","resolution":{"observed_at":"2026-08-10T21:42:11.606098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-08-13T08:14:01.416880Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-10T21:42:11.609640Z","title":"T.; Warrington, A.; and Linderman, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.609640Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:a846aafba608015e72892e3becd4900c70bb9507342644cc3a0d4a2e18e4bbf0","observation_id":"9cbeab83-a19f-48f8-93bd-74e060e4e42a","resolution":{"observed_at":"2026-08-10T21:42:11.609640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.613233Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.613233Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:2092b5346032177d8c6a6821886acfefbdfe041a0e8d2cc28d1a74ddf795e6a7","observation_id":"418758bf-14fc-4237-9ed1-885cc98d9e19","resolution":{"observed_at":"2026-08-10T21:42:11.613233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.616640Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.616640Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:c38464ec8d6f1b62f23043e76b94f10d74f5e711444cfc78ddb44bd0051818dd","observation_id":"3c1ada61-4a5f-4c4c-b858-d1b20858c8cd","resolution":{"observed_at":"2026-08-10T21:42:11.616640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.918532Z","title":null,"venue":null,"work_id":"049c34cc-3cee-459b-9ccf-4e6a9536ff91","year":2015},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.620089Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:ab801c04cd1b6f2646d76aa4a449515ad1300b314b70500977f6d8787036051c","observation_id":"271905c8-53cd-4b3a-9c9a-aae58fabdec7","resolution":{"observed_at":"2026-08-10T21:42:11.922317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.905825Z","title":null,"venue":null,"work_id":"671ac7b2-84ca-463e-8078-250ee9d7b2ae","year":2021},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.623680Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:bd08c25718d6bc8a66cae83f9cb1ce40a89f98daf87e10db2e3c3179d8074dd4","observation_id":"896fef2d-51e8-433b-9526-38cc26aab6ca","resolution":{"observed_at":"2026-08-10T21:42:11.911004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-10T21:42:11.627168Z","title":"Y.; Guu, K.; Yu, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.627168Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:26e87cd8063ae18e078758f74a7220a86d982af8ecab2826126e23f1bacd4a6d","observation_id":"c27f23ea-30a4-4e3e-9b3f-9fb9a3c0dcb9","resolution":{"observed_at":"2026-08-10T21:42:11.627168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:11.631190Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.631190Z"},"links":{"citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:9d74ca80a6ba68ba913cd38babf3fea167442becb48b9f2ce4e3d2b50d2f2ffa","observation_id":"9c1bb94b-1bc0-4ecf-ace2-a94727102c73","resolution":{"observed_at":"2026-08-10T21:42:11.631190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01412","last_updated":"2024-11-09T02:41:02Z","snapshot_observed_at":"2026-08-14T15:08:11.904523Z","submitted_at":"2023-10-02T17:59:52Z","title":"DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01412","snapshot_observed_at":"2026-08-10T21:42:11.634931Z","title":"K.; Li, Z.; and Zhao, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.634931Z"},"links":{"cited_paper":"/paper/2310.01412","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:07c346c26ca3b5934cf02079386acb237f69570569fb909b77a94a8f05824803","observation_id":"29b316e9-f8f4-4b80-9a02-68498751dc99","resolution":{"observed_at":"2026-08-10T21:42:11.634931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14168","last_updated":"2024-08-01T15:56:43Z","snapshot_observed_at":"2026-08-15T10:47:49.340965Z","submitted_at":"2024-01-25T13:27:03Z","title":"Vivim: a Video Vision Mamba for Medical Video Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14168","snapshot_observed_at":"2026-08-10T21:42:11.638902Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.638902Z"},"links":{"cited_paper":"/paper/2401.14168","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:c4a454c7dcd9c8e116ec34854862b0eb2071874c163d9b6f5f0b20618531e3b6","observation_id":"80310e18-8d5b-41e1-b8ac-3c864e810eb0","resolution":{"observed_at":"2026-08-10T21:42:11.638902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18279","last_updated":"2024-08-12T07:14:00Z","snapshot_observed_at":"2026-08-13T11:30:05.110754Z","submitted_at":"2023-05-29T17:50:33Z","title":"Contextual Object Detection with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18279","snapshot_observed_at":"2026-08-10T21:42:11.642612Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.642612Z"},"links":{"cited_paper":"/paper/2305.18279","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:7b5c2809ace61b3bf25746d2e2622c0d445485d32687daf7963692ed122b596e","observation_id":"0b44c3fa-50b7-4c67-a77c-d3896dea0d1e","resolution":{"observed_at":"2026-08-10T21:42:11.642612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-10T21:42:11.646037Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.646037Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:c1e0c10fadf1ea949465697d125c4d8ee5a3b9eb6172a1ab0734d4c570d77dc9","observation_id":"b94ade01-27e7-465e-befb-33b5cdf703d9","resolution":{"observed_at":"2026-08-10T21:42:11.646037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14414","last_updated":"2024-06-20T19:36:38Z","snapshot_observed_at":"2026-08-13T05:43:40.358688Z","submitted_at":"2023-10-22T21:06:10Z","title":"Vision Language Models in Autonomous Driving: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14414","snapshot_observed_at":"2026-08-10T21:42:11.649617Z","title":"L.; Yurtsever, E.; and Knoll, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.649617Z"},"links":{"cited_paper":"/paper/2310.14414","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:9188f9bde7efaddd08bf39ae7a539359199cf3c9beb2120d2acd380ad55f10ec","observation_id":"cdaf9182-61ca-445a-a1af-01226065f034","resolution":{"observed_at":"2026-08-10T21:42:11.649617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T21:42:11.653125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.653125Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:34a5ac7ee208c74ec62bdaf659188889dc2617d456394e5ad4b6a3e1a624fe33","observation_id":"abd4d3e0-db2f-41d7-80bb-5ba7ff715c9c","resolution":{"observed_at":"2026-08-10T21:42:11.653125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-08-14T11:12:31.002605Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-08-10T21:42:11.656824Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:11.656824Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2501.04302"},"observation_digest":"sha256:b7bbd6fd662fd0581767b0279a263c5edb771737fcf9775eef0f247844fd2752","observation_id":"adc5a92e-e4cb-4f71-8e10-baa5f9c884fe","resolution":{"observed_at":"2026-08-10T21:42:11.656824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2501.04302."}