{"as_of":"2026-08-19T04:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a0bf2f4963173a20c4371506c7df389e59015634606153cd8d16ef597dab6eb","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:15:55.834763Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06072/citation-record","integrity":"/paper/2507.06072/integrity","json":"/paper/2507.06072/citation-record.json","paper":"/paper/2507.06072"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:02.051417Z","title":"Spatio-temporal dynamics and se- mantic attribute enriched visual encoding for video caption- ing","venue":null,"work_id":"d30e964f-11d9-4a61-bf36-8ff0c6cfb8cd","year":null},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:51.693713Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:6d0dd7a748d831172b292d5a9635cc78449e4d12c986f285c5bb3a690aea797d","observation_id":"89028ee0-0b70-4494-ba94-28430c64dfda","resolution":{"observed_at":"2026-08-06T19:16:02.118591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:01.913294Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":"a753c4c4-a973-454d-a44b-4bd70f31d77d","year":2016},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:51.767952Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:baafc4ddd9a8d82e10148f8b751119aff7dec8d00726bc27fc5d8b8af09da743","observation_id":"fa785253-d847-4c1f-8860-af2cfc55b373","resolution":{"observed_at":"2026-08-06T19:16:01.978664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:51.856249Z","title":"Covla: Comprehensive vision-language-action dataset for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:51.856249Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:bb7a24300f109f603652374049a015a68923ea43f9ac1ee3c6754c421cedc523","observation_id":"51361623-4519-4913-b172-1cb203345ccb","resolution":{"observed_at":"2026-08-06T19:15:51.856249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-16T14:03:39.369872Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-06T19:15:51.936727Z","title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:51.936727Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:dff72e470caded636f1143ae87a733102267308b5ad0d5c507f5312c27eb5a89","observation_id":"33c76992-50e8-44ba-9246-b3c7cc996789","resolution":{"observed_at":"2026-08-06T19:15:51.936727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:52.022860Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.022860Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:28fdccf86a7b523df08ff03e200069e461df449c1c667e9efb4c7ca3b1bd110c","observation_id":"1f37597d-ed3d-43c9-bc72-34c6bcaf9ed3","resolution":{"observed_at":"2026-08-06T19:15:52.022860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:01.754056Z","title":"Egocentric vehicle dense video captioning","venue":null,"work_id":"390bab5f-a1f4-4b99-9392-834d9e2ce4ae","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.082107Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:5cdb9a9a75878c488a33fc63efc02b45894c8fb15674d78de49916d286161aff","observation_id":"9b4c892c-c7b2-431e-9b3c-45e983b49fee","resolution":{"observed_at":"2026-08-06T19:16:01.823687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:01.584558Z","title":"Tem- adapter: Adapting image-text pretraining for video question answer","venue":null,"work_id":"0eb3a812-1259-4208-880c-57374196ccf6","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.215115Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:2ede5db6b2b2c0d06071c307e38568fd386f83a93a8efd3d6c71f71520c2a1fa","observation_id":"92989898-f2b5-49af-b013-f11327f9883a","resolution":{"observed_at":"2026-08-06T19:16:01.665888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:01.447027Z","title":"Llcp: Learning latent causal processes for reasoning-based video question answer","venue":null,"work_id":"396a03ae-6621-4cf6-a1ce-8950675a5114","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.328341Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:ae23699d06e803a81ae0792da92173147494ff289dd6296305b0b2ca469e8ab2","observation_id":"4d5ebcdb-3054-438d-b7e9-c1dca0430c33","resolution":{"observed_at":"2026-08-06T19:16:01.502522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04302","last_updated":"2025-01-08T06:26:16Z","snapshot_observed_at":"2026-08-13T05:47:25.729099Z","submitted_at":"2025-01-08T06:26:16Z","title":"H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04302","snapshot_observed_at":"2026-08-06T19:15:52.438880Z","title":"H-mba: Hierarchical mamba adaptation for multi-modal video understanding in autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.438880Z"},"links":{"cited_paper":"/paper/2501.04302","citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:59d0a6fab99e888ce5912016edde1c073044006634a251bbe1a04e52f1c92ecd","observation_id":"b8382273-60d4-45b3-9dad-33c9b164ae7b","resolution":{"observed_at":"2026-08-06T19:15:52.438880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:01.337959Z","title":"Spatial-temporal trans- former for dynamic scene graph generation","venue":null,"work_id":"4fcfda67-7a62-442b-bbaa-20dbe8340ed7","year":2021},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.522416Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:ab52708eab21bca9e1af63357e50bbd0d91579972ed68fe753528f438a1fb43d","observation_id":"9fcc3e3e-ffe9-4c38-b258-121821e08c59","resolution":{"observed_at":"2026-08-06T19:16:01.400190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:01.259499Z","title":"Trafficvlm: A controllable visual lan- guage model for traffic video captioning","venue":null,"work_id":"b84b3748-6ac1-45ed-9b1b-16d3ed663186","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.611203Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:447c1bac84c0a7b20f1a42cc6d86543f29afdf23571a56aa83c5d3eb9c86d3a9","observation_id":"2ca91166-6193-4900-88b1-f2b7fb1b3c92","resolution":{"observed_at":"2026-08-06T19:16:01.286301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:01.215906Z","title":"Reversed in time: A novel temporal-emphasized benchmark for cross-modal video-text retrieval","venue":null,"work_id":"a9c466f4-b90e-4c30-a2ed-001d221472d3","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.730614Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:9a09fbcebc8599860f7293e03871e3882fb1eb1db23e4a6423d3e34edf6ebcd0","observation_id":"b0e785c1-0a5e-446b-9148-c0991612fcf1","resolution":{"observed_at":"2026-08-06T19:16:01.220112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19406","snapshot_observed_at":"2026-08-06T19:15:52.844188Z","title":"Mllm-sul: Mul- timodal large language model for semantic scene under- standing and localization in traffic scenarios","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.844188Z"},"links":{"cited_paper":"/paper/2412.19406","citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:064e7ce6b91f8f54aceb03ce630192657222d29dd1729a5a9cd73c645cd3b09a","observation_id":"75cccf7c-c386-4424-b487-f15c47ba9a51","resolution":{"observed_at":"2026-08-06T19:15:52.844188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:01.062344Z","title":"Hierarchical representation net- work with auxiliary tasks for video captioning and video question answering","venue":null,"work_id":"0bb620bd-4242-43ee-ad57-76d9bc1a2e69","year":2021},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.979990Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:1cea6688b16db018b2fd5afb32b52d26e4ab89d2521f9d7d760a97538facd812","observation_id":"6bfba898-4c05-4dd7-b574-29ff23bc40e8","resolution":{"observed_at":"2026-08-06T19:16:01.137806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:00.911844Z","title":"Text with knowledge graph aug- mented transformer for video captioning","venue":null,"work_id":"b80af854-3ad6-4869-b2de-68c4e54f330f","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.060296Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:2d87f580e543321c70c6de0168c0fb9b80cd2d21ff96949e6413ce64a9351377","observation_id":"907367e7-4c4c-46a9-97d5-b78322f75558","resolution":{"observed_at":"2026-08-06T19:16:00.984175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:00.763762Z","title":"Video re- cap: Recursive captioning of hour-long videos","venue":null,"work_id":"fdbba7b6-0c36-4ee6-adcc-c48b798df555","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.164839Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:d539233eab3fb9b7ec73ae136bdbce99309b9b59527aeaa3f0c54512d9ddcc4f","observation_id":"adec4662-b589-4bc5-bbd6-503d136867c5","resolution":{"observed_at":"2026-08-06T19:16:00.830894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:00.609257Z","title":"Adapt: Action-aware driving caption transformer","venue":null,"work_id":"e2b4cfa5-b75b-436e-93ef-ec68ddea1cc4","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.291205Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:e1f3311728afee2ddd51889ef77bdd44ab1968dc81059781952db32aad7abb45","observation_id":"1d7ba409-7d9f-4509-a8d6-dd0c11050aa3","resolution":{"observed_at":"2026-08-06T19:16:00.681506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:00.481525Z","title":"Cladder: Assessing causal reasoning in language models","venue":null,"work_id":"39df9e34-7256-40db-8806-9e826b687a7f","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.415582Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:72c543a3ebdda685d4bc16493ddee2f83014c19800f5861f9dd4e0a5db98720d","observation_id":"a2f44626-fccb-441c-934d-61c85406d0c8","resolution":{"observed_at":"2026-08-06T19:16:00.532441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01683","last_updated":"2026-07-08T10:46:26Z","snapshot_observed_at":"2026-08-16T13:03:22.761691Z","submitted_at":"2024-11-03T20:46:50Z","title":"ROAD-Waymo: A Large-Scale Action Awareness Dataset for Autonomous Driving","version":3},"cited_work":{"arxiv_id":"2411.01683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.01683","snapshot_observed_at":"2026-08-06T19:15:56.377234Z","title":"ROAD-Waymo: A Large-Scale Action Awareness Dataset for Autonomous Driving","venue":"cs.CV","work_id":"04775a60-b524-431b-a9de-ce0eed52c765","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.530074Z"},"links":{"cited_paper":"/paper/2411.01683","citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:edfdc6ece1afddaa29d97b5222a0c8718fb5ad8a872cbd2a908b1d71353c07a8","observation_id":"66869762-d884-4ced-a7c7-cd5668e87800","resolution":{"observed_at":"2026-08-06T19:15:56.454572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:00.350307Z","title":"Textual explanations for self-driving ve- hicles","venue":null,"work_id":"240ac0c5-18e8-428a-b6ae-dd883957d888","year":2018},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.649717Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:1cb0de57ea22a09a8110b88c2d6c545406d38f9258a639265fc97be27f1980fb","observation_id":"312eff15-ef43-4eab-8270-9bbf460de6ca","resolution":{"observed_at":"2026-08-06T19:16:00.407176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:00.182849Z","title":"Learning hierarchical modular networks for video captioning","venue":null,"work_id":"cf191d35-e515-435a-bdf5-a61386ca8555","year":null},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.699498Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:8b3421cb7b163f2e17bdec8ce0641a6785bc991c8cc5e14571fc353035338a1c","observation_id":"036c0c0a-005f-49a5-a080-cdd862b711ae","resolution":{"observed_at":"2026-08-06T19:16:00.252180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:00.005475Z","title":"Automatic evaluation of machine translation quality using longest common sub- sequence and skip-bigram statistics","venue":null,"work_id":"0f0838ef-a6bc-4d7b-a6f8-6d6064a00941","year":2004},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.772761Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:ae6b540d0734f49fccfe9cd19746c77e250a3e691a628d4c9de955a75076d67b","observation_id":"ef5a778b-e72d-4a5f-9f8d-252a2bcc39e7","resolution":{"observed_at":"2026-08-06T19:16:00.099477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:59.826877Z","title":"Swin- bert: End-to-end transformers with sparse attention for video 9 captioning","venue":null,"work_id":"667b2a46-c2c7-41ab-a733-abfadd25221f","year":2022},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.820496Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:17806b6fa2da3e12fb6492e6278584b048b27d903572989e123b79dd3579ede9","observation_id":"1b6d1d58-7bd1-42ce-9ef8-4a50ab2f3e20","resolution":{"observed_at":"2026-08-06T19:15:59.925750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:59.670430Z","title":"Cross-modal causal relational reasoning for event-level visual question answer- ing","venue":null,"work_id":"ebf35ebd-ffba-46ab-b892-0500d073b5ac","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.892898Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:6c7743d25d5c849cce94dcaa43192db91d02066614dac79737e2d5a6fddd8489","observation_id":"da708e17-d4ef-481b-b5c5-ccfa7c2724e2","resolution":{"observed_at":"2026-08-06T19:15:59.744926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:59.512571Z","title":"Spatio-temporal pixel- level contrastive learning-based source-free domain adapta- tion for video semantic segmentation","venue":null,"work_id":"d6a1c009-25b3-40de-ac9a-74aab8a8e33e","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:53.957464Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:ac1579af176c25481455f422ec0e70f92668b0fadd35558f0004fd8df0e6393b","observation_id":"8b5cf959-bf80-4a92-a2e5-e81aae9ab809","resolution":{"observed_at":"2026-08-06T19:15:59.592783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:59.360109Z","title":"Llavilo: Boosting video moment retrieval via adapter-based multimodal modeling","venue":null,"work_id":"43d1d780-e8d3-4598-a0d6-c28326762be3","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.018598Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:94a40e56f58d21e58707700c70a8a43774a5f880e7b5434fa0ffde8338322793","observation_id":"8df80fa6-841c-4ac0-9d8d-eed51ab677ad","resolution":{"observed_at":"2026-08-06T19:15:59.434867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:59.221747Z","title":"Icsvr: Investigating compositional and syntactic understanding in video retrieval models","venue":null,"work_id":"18213d1b-e1a1-4678-882a-8370f21e8573","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.081336Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:5131e85d04620f6e7950580b8f3e8fd0afbffa9a2ee832555bae879d74aa0b7d","observation_id":"fa48fc39-b120-4253-8ffe-447cd0d85699","resolution":{"observed_at":"2026-08-06T19:15:59.280031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:54.142836Z","title":"Drama: Joint risk localization and captioning in driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.142836Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:2e080a2ab7ca94bfd0ec2c1b09b80acc918ce693d9d372689d4d9f12e90833bc","observation_id":"75acad3b-7d49-4586-be85-06eccf90de14","resolution":{"observed_at":"2026-08-06T19:15:54.142836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:59.078135Z","title":"Lingoqa: Visual question answering for autonomous driv- ing","venue":null,"work_id":"ea07c089-e333-444a-8d56-cb6d2da9f5cf","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.205076Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:d2ea48f4635e405b31b59f0ad74c62105418da27ed4115ff51bd347cb1f2a0f2","observation_id":"af2edada-4990-401f-8ce5-0bc77a322194","resolution":{"observed_at":"2026-08-06T19:15:59.146754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:58.903473Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection","venue":null,"work_id":"cc9facca-38bf-4435-afb5-f66a5ddae0d5","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.268006Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:349206ff1faaf5445af0b07740f4df053684be2438c0659ccec0981a32332804","observation_id":"8eaed610-8a7f-4637-a4ab-dfc195e1a606","resolution":{"observed_at":"2026-08-06T19:15:58.999449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:54.333943Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.333943Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:fa0446b2bcf4744485e9d6a87aff2727af4130eee7098a48541f4b7c468bdbfe","observation_id":"0de4e240-8c09-44ba-a2a6-58d77b00490a","resolution":{"observed_at":"2026-08-06T19:15:54.333943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:58.745219Z","title":"Causality","venue":null,"work_id":"a5265e88-e0ee-4abb-a367-b43d246800ee","year":2009},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.392034Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:393df99c563b0a82b266d0e66186cc434550d3e88d3de8e29dcbaf5cf8d79213","observation_id":"6b958ed7-0d40-4415-9aea-ac001b0267ce","resolution":{"observed_at":"2026-08-06T19:15:58.815478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01426","last_updated":"2024-10-27T04:18:04Z","snapshot_observed_at":"2026-08-16T14:30:14.709761Z","submitted_at":"2024-01-02T20:31:15Z","title":"Modular Learning of Deep Causal Generative Models for High-dimensional Causal Inference","version":2},"cited_work":{"arxiv_id":"2401.01426","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01426","snapshot_observed_at":"2026-08-06T19:15:56.232405Z","title":"Modular Learning of Deep Causal Generative Models for High-dimensional Causal Inference","venue":"cs.LG","work_id":"71305e00-d48e-4e34-9e6d-504cd402bea3","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.452774Z"},"links":{"cited_paper":"/paper/2401.01426","citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:40b79d95ee4db7bd1a5b233dd40ad8232da55ee7e855527fa4cb9c1235254789","observation_id":"0fbc6361-e44d-4f1e-8c4d-95bc4571c14d","resolution":{"observed_at":"2026-08-06T19:15:56.313290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:58.599535Z","title":"Clip4caption: Clip for video caption","venue":null,"work_id":"e06f9f1d-bd06-4a89-abe0-2cc48daf27e5","year":2021},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.513741Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:396de319301494a69bfbb29af32bac19834e8d936a51396e7f4f0260c8e3f0c4","observation_id":"6dc8d77b-3255-4585-92c4-b2bff229ab42","resolution":{"observed_at":"2026-08-06T19:15:58.668315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:54.574799Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.574799Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:f772c7b0714ac44a94dec80f5e19538576bb6e305927645b050099621a9f5ef3","observation_id":"feb098ee-39da-4e81-bdcf-6c8f634b6d7d","resolution":{"observed_at":"2026-08-06T19:15:54.574799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:58.440655Z","title":"Sequence to sequence-video to text","venue":null,"work_id":"01ca95f8-0e58-4335-83ee-97a91eee2e43","year":2015},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.639691Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:1a26146527470476bcc72ad0eca89a28262dfcfe5a3ba5f137fa14e30981020f","observation_id":"8e73d360-1c84-4fc5-ac8d-65a3e63e56be","resolution":{"observed_at":"2026-08-06T19:15:58.512611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:58.296518Z","title":"Deconfounding causal inference for zero-shot action recognition","venue":null,"work_id":"0d02b41f-8c8c-4b1c-9080-80c44c915486","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.699040Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:cd8839df574a034595885cfaaaea143d3b75f60178a5da6f7e258dd5bdc5b0b8","observation_id":"2e0f0f3b-4662-4617-a249-6721fd31ee13","resolution":{"observed_at":"2026-08-06T19:15:58.367986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:58.168335Z","title":"Weakly- supervised video object grounding via causal intervention","venue":null,"work_id":"8ac4e17a-2706-484f-9fea-4c8350e23d2e","year":2022},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.765633Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:7eeb4e53b7ba1a38fe6d1ba62e554b99a6d6f12289902012169c0676982aeada","observation_id":"30b8abb7-4683-404d-9561-ee063b4d9ca9","resolution":{"observed_at":"2026-08-06T19:15:58.232681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.11050","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:56.110599Z","title":"Rac3: Retrieval-augmented corner case comprehen- sion for autonomous driving with vision-language models","venue":null,"work_id":"959534df-f320-4379-a7d0-71a717e7d0eb","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.840851Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:e03eef0b543d4efc94d04a55646a205a11e91c72a26f604b8e0c168bff17cd00","observation_id":"82606f18-851c-4af0-8918-e1f7b9e75b31","resolution":{"observed_at":"2026-08-06T19:15:56.152954Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:58.033090Z","title":"Visual causal scene refinement for video question an- swering","venue":null,"work_id":"79f78c2e-bcef-40c9-b636-4c4a05a9b44a","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.905112Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:b763b980e6c61609afc1ea4844412e548fb6922c3529f9d4c4d05565ff3d0f60","observation_id":"9affc6dc-4edd-442c-bce0-b7523d5c5af6","resolution":{"observed_at":"2026-08-06T19:15:58.107868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:57.879346Z","title":"Bridging the gap: A unified video comprehension framework for mo- ment retrieval and highlight detection","venue":null,"work_id":"030262bf-fac3-4341-a42a-b7e014e1d880","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:54.986106Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:2a3bc6491bfb59491ac114c2793119b79c09e3a71bccd34d1bc528f0ba5ace64","observation_id":"95e67e85-3683-40c8-9eb2-4c7234110ca1","resolution":{"observed_at":"2026-08-06T19:15:57.954692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:57.756224Z","title":"Retrieval-augmented egocentric video captioning","venue":null,"work_id":"fd4fac09-96a1-477b-aa53-faa7053c7a2d","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:55.043092Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:e3e000845f6dc747a2e3fe7518be5c0799888f0e982a366e34f62ff2f29a4681","observation_id":"bfd72214-3e30-428f-b3f6-de1783938c66","resolution":{"observed_at":"2026-08-06T19:15:57.808237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:57.614605Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model","venue":null,"work_id":"ab02d1b1-f96c-4794-8d9b-690124eec34d","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:55.194858Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:3a1db2a5234271e13f0809e8c009b6149bd1c74ebc5561a857dfab4189717ed8","observation_id":"462a7aec-368e-4131-b654-957751a05e3d","resolution":{"observed_at":"2026-08-06T19:15:57.672526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:57.485727Z","title":"Prompt learns prompt: Exploring knowledge-aware generative prompt collaboration for video captioning","venue":null,"work_id":"fe3b3ca5-3803-408e-823e-c472d23a2f67","year":2023},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:55.301118Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:ddce2f3280812799515bbc60812b11eee8985c87590ba6161aab9bf2b909788f","observation_id":"a8756662-d0f3-4695-a37d-f6a3fb4bab33","resolution":{"observed_at":"2026-08-06T19:15:57.555070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:57.332260Z","title":"Causal attention for vision-language tasks","venue":null,"work_id":"e84da047-e992-4faa-9b7c-ba6934e07fa7","year":2021},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:55.419088Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:c286b2f301bdff98d4216f031f9de5103a1ae5bf7bd983edb1d58fb7cb9e1c1f","observation_id":"61f4aff8-1ddd-4279-a54d-022e0a998088","resolution":{"observed_at":"2026-08-06T19:15:57.412920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:55.528946Z","title":"Rag-driver: Gen- eralisable driving explanations with retrieval-augmented in- context learning in multi-modal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:55.528946Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:005708f36406279f37f139d73ecab50ec0e3e88a66aea2c1b8737ecd0f54e83a","observation_id":"f5aee295-bc9f-4513-a243-d486342fcb1c","resolution":{"observed_at":"2026-08-06T19:15:55.528946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:57.081921Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"60640a20-f522-4b3f-98d8-ce5d1452cd2e","year":null},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:55.655076Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:c0898104f81846eed5a7c787a14f97c8d764dd682c4752cfbef41d176c1b5653","observation_id":"73eec33c-2fd0-4186-9717-925de6e64b7d","resolution":{"observed_at":"2026-08-06T19:15:57.203793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:56.804041Z","title":"Causal inference with latent variables: 10 Figure 7","venue":null,"work_id":"4a962eaf-caf0-4bd3-8d31-2b25d37e3f20","year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:55.734302Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:293a36ad0e9fa9c65bd7911ca1ad0d3d5098a6a5076ae005afe4820555f81b60","observation_id":"e312ab5e-73c3-4ef7-8f16-19a13624324a","resolution":{"observed_at":"2026-08-06T19:15:56.951227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:56.613432Z","title":null,"venue":null,"work_id":"c93a6cc0-d699-4399-9b63-65ba609916a9","year":null},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:55.834763Z"},"links":{"citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:e6084f3f604e021a6b5bbe61c3bcf55c7dc75fcdbf22ceb1c57e2f6ccdf6c33f","observation_id":"ea6f08e4-87bf-4d4c-b4ba-01dc38dd7cad","resolution":{"observed_at":"2026-08-06T19:15:56.683905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":3,"verified_fuzzy":36},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2507.06072."}