{"as_of":"2026-08-09T21:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6fcc08860dc2a0b084eed97c78c2e0bad61beb624620fa3d316d848ae8739885","coverage":[{"denominator":97,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":97,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:43:07.779736Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T14:39:27.242094Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"cited_work":{"arxiv_id":"2507.02074","doi":"10.48550/arxiv.2507.02074","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Akter, I","venue":"arXiv (Cornell University)","work_id":"6afdab24-94d0-40a0-9d70-bb045b5dbe27","year":2025},"citing_paper":{"arxiv_id":"2604.15332","last_updated":"2026-03-09T16:15:28Z","snapshot_observed_at":"2026-08-09T08:44:52.515305Z","submitted_at":"2026-03-09T16:15:28Z","title":"Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T14:46:41.877762Z"},"links":{"cited_paper":"/paper/2507.02074","citing_paper":"/paper/2604.15332"},"observation_digest":"sha256:42492b44ee95560f04889b6cbda2b521b62fb6b4e8b40b53d07e86e46aeb2e0c","observation_id":"290e8f37-2e24-426b-9fd2-ef980f75c9ae","resolution":{"observed_at":"2026-05-15T14:50:04.412900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"cited_work":{"arxiv_id":"2507.02074","doi":"10.48550/arxiv.2507.02074","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Akter, I","venue":"arXiv (Cornell University)","work_id":"6afdab24-94d0-40a0-9d70-bb045b5dbe27","year":2025},"citing_paper":{"arxiv_id":"2606.01737","last_updated":"2026-06-01T06:01:04Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T06:01:04Z","title":"TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T14:39:27.242094Z"},"links":{"cited_paper":"/paper/2507.02074","citing_paper":"/paper/2606.01737"},"observation_digest":"sha256:7fd60cb4472a3385d6c4e564825f340d2557df412852e10895051a5d2a559ac1","observation_id":"eaa701fc-b87b-4e5a-b9bf-14c87c2f02c3","resolution":{"observed_at":"2026-07-01T23:06:20.629333Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02074/citation-record","integrity":"/paper/2507.02074/integrity","json":"/paper/2507.02074/citation-record.json","paper":"/paper/2507.02074"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:01.707781Z","title":"Traffic monitoring and accident detection at intersections,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:01.707781Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:62730cc42e02ccf724c9e521ee29137a5df02d13a23be85fc891e53050add918","observation_id":"7a0a023e-1640-479c-8230-95ecd1fee14f","resolution":{"observed_at":"2026-08-06T20:43:01.707781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:01.751587Z","title":"A survey of vision-based trajec- tory learning and analysis for surveillance,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:01.751587Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:18f3db5e55472859d7839e1e91fa822e95629760aef5a821c02f113f4655efe0","observation_id":"c181588d-b6cb-4a3f-bc51-1a7a23a84639","resolution":{"observed_at":"2026-08-06T20:43:01.751587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:01.863066Z","title":"Trajectory-based anomalous event detection,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:01.863066Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:6707180ad8be83ea1db8c075a139e1a39e808500432b33f6c3ac2ba9745785a4","observation_id":"eb5f2631-df82-4955-818f-e45ad5f2f003","resolution":{"observed_at":"2026-08-06T20:43:01.863066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:01.915387Z","title":"Development of artificial neural network models to predict driver injury severity in traffic accidents at signalized intersections,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:01.915387Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:5355cf445ec91d30c611c5f188dd1d336c01790eb14bd05c40447204b3c4bd43","observation_id":"af03812a-3686-4184-84ee-a0e3a288fe7d","resolution":{"observed_at":"2026-08-06T20:43:01.915387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:01.988904Z","title":"Severity of driver injury and vehicle damage in traffic crashes at intersections: a bayesian hierarchical analysis,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:01.988904Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:0181a4c42495f66d6d682a1daa81f21d2bbe98a182a05849e6e509485524d35e","observation_id":"7475dead-8473-4927-bb23-ac060d15e6e1","resolution":{"observed_at":"2026-08-06T20:43:01.988904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.099954Z","title":"Two-stream convolutional networks for action recognition in videos,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.099954Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f73355da26b8d347571fa96976f209626a540f0377a9d3a46883bcd7430ccd74","observation_id":"2dcb33f7-1c66-470b-8d73-e91b9984e679","resolution":{"observed_at":"2026-08-06T20:43:02.099954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.171761Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.171761Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:ec9bf572872cb1197ffed6d5ebbc7b25eaac0aeb374cd12d9e8d5c28fc8976ea","observation_id":"b9e77609-0058-4ad8-8a89-7f5eecde20c5","resolution":{"observed_at":"2026-08-06T20:43:02.171761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.230067Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.230067Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c311295251ca0d9ef4ef04edbac7d98de3b7a76da3ca40fc3c8530de01418d83","observation_id":"c2a74191-4297-4f9a-acf7-95cd6c5c69a5","resolution":{"observed_at":"2026-08-06T20:43:02.230067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.302154Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.302154Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:a1f0694c5219cb5daf4bbb22467850eff56ad9d71316cdff9ca62cc63d20abd3","observation_id":"c1e8de97-b561-499b-9a09-5acac53269e2","resolution":{"observed_at":"2026-08-06T20:43:02.302154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.364456Z","title":"Real-world anomaly detection in surveillance videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.364456Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:09e3a0aac59622faf989c6c0fe8c43aac27b34d9f4beebc5fadd6a3ae37cf3a2","observation_id":"8ae9d92e-0c55-4c14-b260-63172779b037","resolution":{"observed_at":"2026-08-06T20:43:02.364456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.398110Z","title":"Future frame prediction for anomaly detection–a new baseline,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.398110Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:7d6f13f624bc38a67601075270a47ad9de315ab9e6c1ced1b69900cbce2eb609","observation_id":"762e0d57-d62c-4959-8d6e-688d5eb3f115","resolution":{"observed_at":"2026-08-06T20:43:02.398110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.461330Z","title":"Learning memory-guided nor- mality for anomaly detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.461330Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:760a3baf2c792586cd48b961739d74c4125c2963da447341a392d7e7e5615c95","observation_id":"45769cbc-de9b-4547-9175-371aa7ada1b0","resolution":{"observed_at":"2026-08-06T20:43:02.461330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.527630Z","title":"Uniter: Universal image-text representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.527630Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:736ee07b7f5703130ad3d70dc6b1486f7fe319796249336a75e3f1032e529cbf","observation_id":"8a4ed46c-ec87-4d43-9dbf-1810b13cdf36","resolution":{"observed_at":"2026-08-06T20:43:02.527630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.565716Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.565716Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:203fbf3f41af14b5f4faa8521bb1510bdec30133774ab109d2df5fd4106f50c9","observation_id":"0d915eb2-cc12-4d91-a601-a02dd232d72c","resolution":{"observed_at":"2026-08-06T20:43:02.565716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.649490Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.649490Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:d7fb5929866ecc90de90ea241c9f9e370e969ddac034a2a7244ce80170e53f7c","observation_id":"cc6bc847-2d23-4df1-be3b-f5ccf41a3dda","resolution":{"observed_at":"2026-08-06T20:43:02.649490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.726302Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.726302Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:8a442e4bd3a287c24143f892418d1ac6e142f5f06989d5184c3b7875f76cdeb0","observation_id":"a7cd5b0e-f429-4709-8374-5fc24d5e9207","resolution":{"observed_at":"2026-08-06T20:43:02.726302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:43:02.777750Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.777750Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:0389f592e68f14714457a855e7fbbedf981f4a3ca4799c1cc9218931806978fa","observation_id":"ca12865d-0f16-49f5-8ce6-5b324cb69aa9","resolution":{"observed_at":"2026-08-06T20:43:02.777750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.860733Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.860733Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:5bfaa1b515b85340abb9f20b3dfca5f87b3b44e68cdfb66d0b17fb3c966317b2","observation_id":"2320f2c0-64dc-4ff6-a19c-0b4923c6b4b7","resolution":{"observed_at":"2026-08-06T20:43:02.860733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:17.971898Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"e482bdf7-496a-4307-ae10-6c36167af8c9","year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.905256Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:345c57b9ee5dc9ef99784ec11393f7ab8c9d1a2ff7548900974fdbc63906f9ec","observation_id":"ef9a3f3c-0c3d-4a13-a339-aecce4443c8a","resolution":{"observed_at":"2026-08-06T20:43:18.064337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:17.818707Z","title":"Anomalous video event detection using spatiotemporal context,","venue":null,"work_id":"89447a78-cb17-4dbd-b84f-fb284539f5b0","year":2011},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.943513Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:4c3bace149df8a93974f8f7d47036ecf4bda69e6ff755bccb0c512c68211999d","observation_id":"7da91b94-5ee5-4c89-92c3-19dd261cdbed","resolution":{"observed_at":"2026-08-06T20:43:17.890932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:17.569304Z","title":"Detecting anomalies in people’s trajectories using spectral graph analysis,","venue":null,"work_id":"8dc93213-6f7a-4572-bf00-615424dbb206","year":2011},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.974628Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:fe32da8061054d932d54c5f68f8bbb8bf41d375279bcad78dab775353a5dcd95","observation_id":"46d4f0b0-2231-4793-95df-c756a1ab9b1c","resolution":{"observed_at":"2026-08-06T20:43:17.678953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:17.369923Z","title":"Using support vector machine models for crash injury severity analysis,","venue":null,"work_id":"3f9a18dc-0b26-4037-9fbd-f9ef4c53e57f","year":2012},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.022540Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:767af649ec2f6f7b4a66fbef30f730486523cf63ea0f4a613d33a6cf5fbae3e1","observation_id":"314d5834-1e69-40c3-9d01-9abd50c48051","resolution":{"observed_at":"2026-08-06T20:43:17.464120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:17.207985Z","title":"Accident detection system using image processing and mdr,","venue":null,"work_id":"352a95f5-bae9-46d4-974b-d555caf3e33c","year":2008},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.096962Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:4aabf95fab13409a0432aebf06c8e952f2eb573464e9e49b784cb07ee4cefb29","observation_id":"9540b7bf-4036-4920-9371-8967656132ea","resolution":{"observed_at":"2026-08-06T20:43:17.285156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.987237Z","title":"Temporal segment networks: Towards good practices for deep action recognition,","venue":null,"work_id":"6763f3ec-4798-4bcf-8f7e-3d281a3a9660","year":2016},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.146316Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f745ebd1c64b1e8831b624f99155aa9d6f7c9a891c1c0a53b861ff66bb381fb2","observation_id":"66facb1f-0cab-46fa-ac98-36c9e68c0d40","resolution":{"observed_at":"2026-08-06T20:43:17.095290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.809422Z","title":"Multimodal machine learning: A survey and taxonomy,","venue":null,"work_id":"d1e240b0-77fb-4657-97f2-68ed20c4d2cf","year":2018},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.180713Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:1e999fbd66375fd18c1a1da22d8f25650d81f31a9a6ccbc8d07628aba29d1f33","observation_id":"c6f9de2a-893b-4ad6-a4ce-5c6cf1c02cf2","resolution":{"observed_at":"2026-08-06T20:43:16.847350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.639624Z","title":"Multimodal deep learning,","venue":null,"work_id":"1eeff43c-8816-476d-bc4e-ef3080622444","year":2011},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.231501Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:27b5f27de542faf077956df860760e9975b6617779ded13f40abdfaa67362e7c","observation_id":"f350ee47-b512-4855-9074-cec27d8e6948","resolution":{"observed_at":"2026-08-06T20:43:16.714894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.471468Z","title":"Deep multimodal learning: A survey on recent advances and trends,","venue":null,"work_id":"d38cce52-12d1-44d3-ab97-255bfdebb574","year":2017},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.284396Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:2f721b655a89fa4232e1acf5b71c0b00928946fc299642f04eac93c6067e5dbc","observation_id":"545500c2-2f2f-4e0a-b70f-1704dd55d722","resolution":{"observed_at":"2026-08-06T20:43:16.548682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T20:43:03.339629Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.339629Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:d1f8ac5ef16dc5215ad5d56088099d6cd43d95cbae655a6778873e8606e2bf32","observation_id":"354e4939-3157-42f6-b4cd-52aaf15c6c4d","resolution":{"observed_at":"2026-08-06T20:43:03.339629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.259273Z","title":"All in one: Exploring unified video-language pre-training,","venue":null,"work_id":"b15c6bf0-d3c9-4266-9daa-5ac56fe07c70","year":2022},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.378057Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:117fd18b3e916ded4a58dcfceeac6898607da41c7a20c35ef337cdccca8dc114","observation_id":"ccb2bec7-8af5-441a-aa14-603706962798","resolution":{"observed_at":"2026-08-06T20:43:16.365975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.025447Z","title":"The cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":"b2d6fdfe-1567-4aa1-9a0e-5b794bb469ec","year":2016},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.426557Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:58d86442e6c9cd6c7a59d234a02e3939c8541cb146659b997edc3b5ee26606c7","observation_id":"6da57f0e-1e22-43e5-89db-908caa2860bc","resolution":{"observed_at":"2026-08-06T20:43:16.104420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:03.452329Z","title":"nuscenes: A multimodal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.452329Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f72105f1751b02f283d14e636954d173e764eddf078390ff785349bdefce450e","observation_id":"542aa650-d6ad-4e3c-8889-155d0b67985d","resolution":{"observed_at":"2026-08-06T20:43:03.452329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.805617Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite,","venue":null,"work_id":"291f1936-5f60-4101-83a5-e90ab308e9df","year":2012},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.511845Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:06c830bc560b84244f9becff3d8adb356dc4322899870dbacaec60b2432c9edf","observation_id":"ba54830f-f768-497f-bf37-d5e80076dc7e","resolution":{"observed_at":"2026-08-06T20:43:15.881441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:03.545890Z","title":"Edge computing: Vision and challenges,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.545890Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:38972bb011b95eecff4c69101dea9556012c88515b535692591b135aba24e4c1","observation_id":"19ce6e3b-dbdf-4dd9-901a-bc713e0c3bdf","resolution":{"observed_at":"2026-08-06T20:43:03.545890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:03.594786Z","title":"Edge intelligence: Paving the last mile of artificial intelligence with edge computing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.594786Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:9655ec2f1b455029c9496f181025703ebba6affc65894be1a94da91f843177d0","observation_id":"e2e764c7-9eec-447c-9be3-1f8a6ff2552c","resolution":{"observed_at":"2026-08-06T20:43:03.594786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.545879Z","title":"Videobert: A joint model for video and language representa- tion learning,","venue":null,"work_id":"0bec8dc4-5c61-46c4-97a9-ed6a3b20e284","year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.634399Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:d77a7637a48bbe6c5833f8e82dfddd3c1352ea41ff9e5ad749b5197f34bc0f93","observation_id":"3bba2dc6-21de-4146-94df-ce35b2cb5aaa","resolution":{"observed_at":"2026-08-06T20:43:15.615669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.390519Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":"90dedb0f-2175-45d8-bf26-8ea7443ea1cf","year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.667379Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:28a0f43df7274026b9c7e66dfff2411a1e63950dc947ee48bc7dafd4eaf6aae8","observation_id":"bd6011d1-151f-439f-a5ed-162557e87440","resolution":{"observed_at":"2026-08-06T20:43:15.456053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.253347Z","title":"Videogpt: Video generation using vq-vae and transformers,","venue":null,"work_id":"b96293d0-e987-4d9e-ac5c-379792f51275","year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.731997Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:e63d0428f318f53b626b995fb02dfe9fcfbeeffe0336688e5640995a9825e854","observation_id":"9d5659d3-d7e4-42a9-93ba-4ad4b01dfb20","resolution":{"observed_at":"2026-08-06T20:43:15.309881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T20:43:03.778153Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.778153Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:9ab106caf17ab8558167311ef6cfe0446147a5c5f1013aebfcd98cb311926570","observation_id":"7ef8defa-413b-433e-9a5a-4870e5fa5414","resolution":{"observed_at":"2026-08-06T20:43:03.778153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T20:43:03.846253Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.846253Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:de68f9bbfbc474f77e025531987ff349bfb6fb3848cb4ddb2122b886c75cd913","observation_id":"288793db-74eb-4782-b296-5890ae443464","resolution":{"observed_at":"2026-08-06T20:43:03.846253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T20:43:03.913715Z","title":"Palm-e: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.913715Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:adf13b7a91aa39dcbf378c842500f294b86b8b34200b748023502186ee9fc004","observation_id":"d137ac91-53fc-401f-9595-d28fe3e60348","resolution":{"observed_at":"2026-08-06T20:43:03.913715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.185771Z","title":"Gpt-4v(ision) system card,","venue":null,"work_id":"9abd67e6-d4c1-43c5-ab95-d2804781e9de","year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.964175Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:a561cedf3759da8018313e761877837701e5023f7c492f3c2e766eae5cc8d67c","observation_id":"6fad97ba-8ab2-499e-b3b6-d74d9cb07c50","resolution":{"observed_at":"2026-08-06T20:43:15.210868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.093170Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":"ddbac36e-3650-4aba-97f1-35e47fb828e9","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.030238Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:ef0b656ed15ecf443729ebdb70c2e3163c0b6a08dba78ec1e2878edecc69eca1","observation_id":"00e885d6-1256-4256-aa5c-44a0ad06ce9e","resolution":{"observed_at":"2026-08-06T20:43:15.151435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:14.868365Z","title":"Sora: Creating video from text,","venue":null,"work_id":"342cdc1b-7f97-4d00-9141-8fc03c8b104b","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.098209Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:732b706bab9f84b46428dbd667a0a37bf7c6e25abeb91eb17a70037b796aeb0b","observation_id":"b7be538e-2e9e-4368-a47b-acbe008365b6","resolution":{"observed_at":"2026-08-06T20:43:14.993735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:14.684850Z","title":"Crash: Crash recognition and anticipation system harnessing with context-aware and temporal focus attentions,","venue":null,"work_id":"99cf53f9-c591-4864-b1df-01b2987f991d","year":null},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.154363Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:618aa87367ee6567237609af25d99fbf7ac1ffbbe3914a91179f6cc2bdeccc60","observation_id":"a12d3737-8413-4032-9198-c63c793d755e","resolution":{"observed_at":"2026-08-06T20:43:14.782918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10604","last_updated":"2025-01-17T23:35:34Z","snapshot_observed_at":"2026-08-06T18:15:19.361212Z","submitted_at":"2025-01-17T23:35:34Z","title":"When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10604","snapshot_observed_at":"2026-08-06T20:43:04.297014Z","title":"When language and vision meet road safety: Leveraging multimodal large language models for video-based traffic accident analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.297014Z"},"links":{"cited_paper":"/paper/2501.10604","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:99e9d8c8635c11ca1fc5726397597c4dda68740b0104418c16a75930f60fb2f0","observation_id":"f0149b61-9c89-4859-b042-ebcfd31e88a7","resolution":{"observed_at":"2026-08-06T20:43:04.297014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:04.364558Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.364558Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:1fe61a8176a1d02bc27e718901783c072037fdf62c8006ecb82370ef403f02a9","observation_id":"4a95e254-d30b-42cf-a757-3dc95da00af2","resolution":{"observed_at":"2026-08-06T20:43:04.364558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-07T09:11:01.956830Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-06T20:43:04.406744Z","title":"Clip4clip: An empirical study of clip for end-to-end video clip retrieval and captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.406744Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:5ce2ae1b51aa5445949bd498594092e524fc4c9726105f2b85e7ab4de21102e5","observation_id":"17b3a461-14f7-47f8-a8ff-fbd05e9e0b22","resolution":{"observed_at":"2026-08-06T20:43:04.406744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T20:43:04.442302Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.442302Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:df7ca5e446ab46fd3269e4b474d0d51c7459b685bbf450d4e772c8f851004e48","observation_id":"448b17bc-4b82-4f38-aa8e-10cba87233f4","resolution":{"observed_at":"2026-08-06T20:43:04.442302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:14.380584Z","title":"Quick and robust detection of crash events from video streams,","venue":null,"work_id":"bb31b57b-5ee7-4489-94f2-0bc3f22eb98a","year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.505518Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:9d5992ba0a7f037d848b859cc2041d2500db5153622a47ff691603cc0292200b","observation_id":"abd4cb4e-e83c-44dc-8829-7d0d6ddcc42b","resolution":{"observed_at":"2026-08-06T20:43:14.537088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:14.117467Z","title":"A real-time system for detection of road accidents from video streams,","venue":null,"work_id":"47948c33-4713-45c2-b2cb-2f5394db7d3b","year":2018},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.570143Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:7e6cdfefd6f3db9ba4f25fff7c26a585daf1bf05234f6e2e7e990ee5c173cb93","observation_id":"1de8b4b1-d6cf-4634-9aca-c2428ce4f0ad","resolution":{"observed_at":"2026-08-06T20:43:14.256997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:13.817313Z","title":"Video-based traffic accident detection: A survey,","venue":null,"work_id":"02827881-55e8-4404-abd9-a2912c9a8c57","year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.622770Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:4adaa38fa8719a923c49dd1e7d8a16f42f88bd680b5b57492217c57a25c57795","observation_id":"3a3c7fb1-97ac-4f3a-987e-eb14d147d8a6","resolution":{"observed_at":"2026-08-06T20:43:13.942348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T20:43:04.679275Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.679275Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:816cf6007ed9271e22e1f97ac58cb8b966aaedbc862ab6769cd8814fb5e3a47e","observation_id":"87610921-fe17-4f72-9711-b5b7c8f55caf","resolution":{"observed_at":"2026-08-06T20:43:04.679275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16682","last_updated":"2024-02-26T16:01:22Z","snapshot_observed_at":"2026-08-07T09:28:35.669766Z","submitted_at":"2024-02-26T16:01:22Z","title":"Pentagon relation and Biedenharn-Elliott identity","version":1},"cited_work":{"arxiv_id":"2402.16682","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16682","snapshot_observed_at":"2026-08-06T20:43:10.099554Z","title":"Pentagon relation and Biedenharn-Elliott identity","venue":"math.GT","work_id":"2b31f553-bfe9-4edb-a579-eac882e8ea04","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.749137Z"},"links":{"cited_paper":"/paper/2402.16682","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:cee8687ee1f12c83b3967e3e5e41ab735cfbcc8583ea99abe6e6dda6fa3f12e4","observation_id":"4ad41515-89e2-4ee8-aa36-f17d7c4f00e8","resolution":{"observed_at":"2026-08-06T20:43:10.153649Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14412","last_updated":"2024-01-19T23:48:04Z","snapshot_observed_at":"2026-07-06T17:20:33.356092Z","submitted_at":"2024-01-19T23:48:04Z","title":"Harnessing Neuron Stability to Improve DNN Verification","version":1},"cited_work":{"arxiv_id":"2401.14412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.14412","snapshot_observed_at":"2026-08-06T20:43:09.975927Z","title":"Harnessing Neuron Stability to Improve DNN Verification","venue":"cs.LG","work_id":"bd1a4940-7e91-4d23-bb50-d93496f2f41b","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.793014Z"},"links":{"cited_paper":"/paper/2401.14412","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:dc243e4664513c49ec1d08a8b08074976b9d624f6d5b5d52b3f04d398df73a65","observation_id":"a45733c2-3731-4332-a915-3102c9cd5cf3","resolution":{"observed_at":"2026-08-06T20:43:10.016965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13849","last_updated":"2024-02-21T14:50:44Z","snapshot_observed_at":"2026-07-06T17:33:29.707531Z","submitted_at":"2024-02-21T14:50:44Z","title":"Partially hyperbolic diffeomorphisms that are center fixing","version":1},"cited_work":{"arxiv_id":"2402.13849","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.13849","snapshot_observed_at":"2026-08-06T20:43:09.873853Z","title":"Partially hyperbolic diffeomorphisms that are center fixing","venue":"math.DS","work_id":"dcf53736-4838-40ff-893b-5267440abbce","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.825480Z"},"links":{"cited_paper":"/paper/2402.13849","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:cb00a40e4e190cb6d958a7816dd9af7acf946e2031226d98bc9e61b9b2987a65","observation_id":"240f0f88-0037-4bec-9b7f-087d9756e0e4","resolution":{"observed_at":"2026-08-06T20:43:09.921329Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07343","last_updated":"2023-05-18T12:56:52Z","snapshot_observed_at":"2026-07-06T15:26:22.787911Z","submitted_at":"2023-05-12T09:41:40Z","title":"On the consistency of relative facts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07343","snapshot_observed_at":"2026-08-06T20:43:04.866116Z","title":"Large language models are temporal and causal reasoners for video question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.866116Z"},"links":{"cited_paper":"/paper/2305.07343","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:16f1b2459ac7bee5b72f5e6487a955368e914bb64be73df722ee8d70f0c1d672","observation_id":"4956d886-5e93-4272-b982-2d98a7eb761a","resolution":{"observed_at":"2026-08-06T20:43:04.866116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:13.520449Z","title":"Leveraging video-llms for crash detection and narrative generation: Performance analysis and challenges,","venue":null,"work_id":"4dfe757b-9433-40d0-a05d-68702f188c56","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.920193Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c331a4ca82f695f96a3b29236d081a6538ec33b45a1936ca3a398c82d9d8737e","observation_id":"645beef6-394d-46aa-8ece-d71fc68a0b65","resolution":{"observed_at":"2026-08-06T20:43:13.654406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.07223","last_updated":"2021-05-19T06:36:47Z","snapshot_observed_at":"2026-07-06T07:46:14.077705Z","submitted_at":"2019-04-15T17:59:43Z","title":"Joint Discriminative and Generative Learning for Person Re-identification","version":3},"cited_work":{"arxiv_id":"1904.07223","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.07223","snapshot_observed_at":"2026-08-06T20:43:09.730663Z","title":"Joint Discriminative and Generative Learning for Person Re-identification","venue":"cs.CV","work_id":"5da90046-9c6c-4658-b1c7-4fcac09024d7","year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.980461Z"},"links":{"cited_paper":"/paper/1904.07223","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:e8c5e6d75815c4a68e607b2067390046ca71b99103cff2045c54f3fa783f288f","observation_id":"35443ac5-fef4-4937-b880-52f9a49d9bfa","resolution":{"observed_at":"2026-08-06T20:43:09.775500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:13.275253Z","title":"Trafficlens: A novel system for video-to-text conver- sion in multi-camera traffic environments,","venue":null,"work_id":"000af1ee-b114-4123-b224-ee117c65cbd7","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.013039Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:e2e9479b135211b529715398061ae5e13c6743b6801cbacaf1a3353acbc6c597","observation_id":"7b496f6e-da04-4812-97ca-db92a850519c","resolution":{"observed_at":"2026-08-06T20:43:13.417130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12204","last_updated":"2024-02-19T15:07:32Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:07:32Z","title":"Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages","version":1},"cited_work":{"arxiv_id":"2402.12204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12204","snapshot_observed_at":"2026-08-06T20:43:09.592530Z","title":"Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages","venue":"cs.CL","work_id":"f6fd02f7-d812-42c6-8454-03d611048877","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.071380Z"},"links":{"cited_paper":"/paper/2402.12204","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:a4c648e8dc52adfa62594268f81bac3c7ecd5146141fe1bf6f57cf3382bf43ef","observation_id":"7d91cfaf-5882-4ede-88c1-5be018cfc9ee","resolution":{"observed_at":"2026-08-06T20:43:09.652431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:13.062708Z","title":"Dad: A dashcam accident dataset,","venue":null,"work_id":"c8b789c1-f928-4333-b1cd-7c944b9c0a78","year":2016},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.117717Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c04d1966238caf29a6528483d937460920441e1d3ab392e43ba248d524cce04f","observation_id":"3377578f-c309-4f20-8dff-a41c5b3d58d6","resolution":{"observed_at":"2026-08-06T20:43:13.156123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:12.829458Z","title":"Cadp: A novel dataset for car accident detection and prediction from police reports,","venue":null,"work_id":"d090f58d-5e19-48ac-98a8-31f9b32ab55b","year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.153296Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:d204ec0ab4121c11fd228a3f2b06de73eacc7afd0541495086a7dd055d75b35f","observation_id":"7023c4c6-fb00-47d1-bced-8fdcceaeaa7c","resolution":{"observed_at":"2026-08-06T20:43:12.935784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04687","last_updated":"2020-04-08T09:25:06Z","snapshot_observed_at":"2026-08-08T14:55:35.331716Z","submitted_at":"2018-05-12T09:24:21Z","title":"BDD100K: A Diverse Driving Dataset for Heterogeneous Multitask Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.04687","snapshot_observed_at":"2026-08-06T20:43:05.206991Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitasking,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.206991Z"},"links":{"cited_paper":"/paper/1805.04687","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:b2db1c3841551f7381fe6bbe4be49d4d9a0d2f7a938aef6df90e42cbcb04b82e","observation_id":"ac938ad0-26ac-48b0-bb4c-abbdf1f6b792","resolution":{"observed_at":"2026-08-06T20:43:05.206991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.03759","last_updated":"2018-06-26T22:36:42Z","snapshot_observed_at":"2026-07-06T06:18:12.309168Z","submitted_at":"2018-01-11T13:55:34Z","title":"Bulk-Boundary Correspondence in the Quantum Hall Effect","version":2},"cited_work":{"arxiv_id":"1801.03759","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.03759","snapshot_observed_at":"2026-08-06T20:43:09.440679Z","title":"Bulk-Boundary Correspondence in the Quantum Hall Effect","venue":"hep-th","work_id":"c9d578c2-450a-4348-be1c-5f936aa1f80c","year":2018},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.265806Z"},"links":{"cited_paper":"/paper/1801.03759","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:a5664779944531adfc7d87931d73198deb87abc2f43efd14c2587a102f332595","observation_id":"37a20d0b-c064-4295-a336-bf917aa640d9","resolution":{"observed_at":"2026-08-06T20:43:09.499953Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00982","last_updated":"2025-01-13T16:27:06Z","snapshot_observed_at":"2026-07-06T19:25:28.300272Z","submitted_at":"2024-10-01T18:10:23Z","title":"ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding","version":2},"cited_work":{"arxiv_id":"2410.00982","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.00982","snapshot_observed_at":"2026-08-06T20:43:09.268997Z","title":"ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding","venue":"cs.CV","work_id":"d7c022b4-7785-4aff-94bf-13dde60c239b","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.322723Z"},"links":{"cited_paper":"/paper/2410.00982","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:2bfe7350e2fee08760fbdd81cd6e91e7fb5c70e54f3cd0d05d48a39ca2b6dd0b","observation_id":"c8fcad50-7dac-412b-834f-4a7807d1b478","resolution":{"observed_at":"2026-08-06T20:43:09.342500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09275","last_updated":"2024-04-14T14:51:44Z","snapshot_observed_at":"2026-07-06T17:59:58.611072Z","submitted_at":"2024-04-14T14:51:44Z","title":"TrafficVLM: A Controllable Visual Language Model for Traffic Video Captioning","version":1},"cited_work":{"arxiv_id":"2404.09275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09275","snapshot_observed_at":"2026-08-06T20:43:09.124603Z","title":"TrafficVLM: A Controllable Visual Language Model for Traffic Video Captioning","venue":"cs.CV","work_id":"bc2d010a-3ead-4eb1-a0e9-908e7845d24a","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.399630Z"},"links":{"cited_paper":"/paper/2404.09275","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:e6d38dbf474dd8f58ab77f5fd7c2fb94906c78ed0acc07c011d5e4d80b497363","observation_id":"0a3fc6ec-0e31-46ea-8ae6-ceae26073d34","resolution":{"observed_at":"2026-08-06T20:43:09.183265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:12.516680Z","title":"Crash: A context-aware attention-based framework for crash anticipation,","venue":null,"work_id":"955d6002-df81-46ce-908d-95cfd55f9495","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.463586Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f00041f139dd43066bb700b3a7ba753c47828182f15485517168762ff7da0268","observation_id":"bd857ff8-0747-497f-9992-a83301ee16c4","resolution":{"observed_at":"2026-08-06T20:43:12.649915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T20:43:05.505355Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.505355Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:ec54fdea8e920617fd193d5c63699149cc6c6801d2216dc39a8a89d3624ba6f3","observation_id":"db865e62-ee75-4544-9a9b-fff300e955c1","resolution":{"observed_at":"2026-08-06T20:43:05.505355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:12.214716Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":"bb36bedb-d649-4be4-886c-c8541d1e2359","year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.565916Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:b69cdc8aa0a54d36b66b7a71713290d666923e5a6895f8feb695f8b44f4c9033","observation_id":"d6bb9525-c2e1-4c40-85f6-0f802bb7578c","resolution":{"observed_at":"2026-08-06T20:43:12.373008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:11.946824Z","title":"Self-supervised anomaly detection: A survey and outlook,","venue":null,"work_id":"a7a745b6-9f81-4637-aa09-f663d4ee8cf4","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.645978Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:5f45dca6a5746010d5556194f87a41e3a17397a1f2e571407ed5a75fcdf32f94","observation_id":"2bceff8e-4009-4032-a3e3-a4939c79406e","resolution":{"observed_at":"2026-08-06T20:43:12.073096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:11.664200Z","title":"Few-shot fast-adaptive anomaly detection,","venue":null,"work_id":"1609e9a3-52f5-4ab9-861f-1d38e7610669","year":2022},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.691625Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:9d6fffc8f7616c023718ce99e37008a0b6f06af6482941ca6cb2d287c3e36a4f","observation_id":"eccf9c1e-c30b-4a11-8f5b-eb6dad9d780b","resolution":{"observed_at":"2026-08-06T20:43:11.794299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T20:43:05.739969Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.739969Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:a0d42a2307bcc4c86ac5992d32f874ba93bb9ca1340d0c8575082bdaea678675","observation_id":"accd368e-1106-4b7f-afb7-66e42b0905cd","resolution":{"observed_at":"2026-08-06T20:43:05.739969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14146","last_updated":"2020-09-29T16:40:46Z","snapshot_observed_at":"2026-07-06T09:59:53.503386Z","submitted_at":"2020-09-29T16:40:46Z","title":"A Survey on Deep Learning Techniques for Video Anomaly Detection","version":1},"cited_work":{"arxiv_id":"2009.14146","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.14146","snapshot_observed_at":"2026-08-06T20:43:08.874629Z","title":"A Survey on Deep Learning Techniques for Video Anomaly Detection","venue":"cs.CV","work_id":"66be4498-b1aa-450b-9a40-fade1f2da8e4","year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.823209Z"},"links":{"cited_paper":"/paper/2009.14146","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:8858508d3461ab82d2ade6ef8c200ab5f43baeb17555187d786285756abebbe9","observation_id":"7175c93d-b69a-401d-bf3f-7b819aa45d1c","resolution":{"observed_at":"2026-08-06T20:43:08.974237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:05.873151Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.873151Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c39e939c57c230d8378d4cf5b5a4b3cf8bc9d18808d728ff0efb477fd13e139a","observation_id":"e8ae7848-09dd-479d-af08-841db39a7e10","resolution":{"observed_at":"2026-08-06T20:43:05.873151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:11.453830Z","title":"Convolutional lstm network: A machine learning approach for precipitation nowcasting,","venue":null,"work_id":"8bf025ae-876f-444b-80bd-f7ffbbf17128","year":2015},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.939940Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:d6c0656dbbc3857f55ca8a6a7fe58ead7da496d872ca9548e4d11e51ab6938ff","observation_id":"d4f5159c-5cb2-409d-821f-611f7c353325","resolution":{"observed_at":"2026-08-06T20:43:11.532931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19387","last_updated":"2024-07-01T02:31:53Z","snapshot_observed_at":"2026-07-06T18:22:14.521977Z","submitted_at":"2024-05-29T17:56:31Z","title":"Video Anomaly Detection in 10 Years: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19387","snapshot_observed_at":"2026-08-06T20:43:06.026238Z","title":"Video anomaly detection in 10 years: A survey and outlook,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.026238Z"},"links":{"cited_paper":"/paper/2405.19387","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:3fc90a06c342d80c683697553b4d2a69ddee725ce203a4b79219e6224178b6fc","observation_id":"4d7b8a6e-051a-4240-a8bb-97af8b39e9e3","resolution":{"observed_at":"2026-08-06T20:43:06.026238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-06T03:32:00.098200Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-06T20:43:06.121709Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.121709Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f8b4d6bedf0328a548d2a3a7b81c6c2adb4bf065d2f4590f2280c2db5c9d53cc","observation_id":"2c97d037-7e18-4489-90a6-291bf823bb0d","resolution":{"observed_at":"2026-08-06T20:43:06.121709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:06.207625Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.207625Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:164fb46d49c65bd5ec592a72033ee84590f5a8eb57fa0af379b17f1f0139ab4e","observation_id":"2f72261b-2234-4b57-95af-49b625d86f30","resolution":{"observed_at":"2026-08-06T20:43:06.207625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:06.264040Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.264040Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:fd1240f13325d039851a6be6a2950e02b8defc37928e4eac2e6f423b0444fb5e","observation_id":"a7d6492b-55f1-461d-8dc3-ba0780cc329b","resolution":{"observed_at":"2026-08-06T20:43:06.264040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:06.334184Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.334184Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:8c25ce1e338d0eb72edb7e9bcf94c31003a06c19e03bcd0e42eb41a3d50bd84c","observation_id":"2a39a169-d8a1-46ae-b00c-51b6e5263cc6","resolution":{"observed_at":"2026-08-06T20:43:06.334184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:11.234210Z","title":"Sutd-trafficqa: A question answering benchmark and an efficient network for autonomous driving,","venue":null,"work_id":"2e9d45c7-cec7-4b43-b679-2347913071dd","year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.436310Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:9ee1a2d96a80298397143b30b6e77631921983e77a767626727980c797a44cdf","observation_id":"c1740d64-d080-4406-84b4-848f689fc2d8","resolution":{"observed_at":"2026-08-06T20:43:11.302437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:11.099359Z","title":"Causallp: Visual causal question answering with knowledge graphs,","venue":null,"work_id":"f8ba5a6a-6124-4e2d-985a-376245d7028b","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.486551Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:e4daa1aa3a520526a9558a12deafa8980db2369df413cbc85e30f82487ddcd2e","observation_id":"f1022a6c-eaa7-465b-98f8-9d7c89144724","resolution":{"observed_at":"2026-08-06T20:43:11.171794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01299","last_updated":"2026-07-04T18:00:49Z","snapshot_observed_at":"2026-07-09T23:17:08.249380Z","submitted_at":"2024-04-01T17:59:53Z","title":"CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes","version":3},"cited_work":{"arxiv_id":"2404.01299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01299","snapshot_observed_at":"2026-08-06T20:43:08.546066Z","title":"CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes","venue":"cs.CV","work_id":"e17fd188-f1bd-4045-8b25-a7dc3427312b","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.555774Z"},"links":{"cited_paper":"/paper/2404.01299","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:1c47811bf9c478740e0665c4ba411e10cf3362c54bfc9634255a886407bffd48","observation_id":"f5e412ca-fdd3-4dc9-9d33-1c1f18023792","resolution":{"observed_at":"2026-08-06T20:43:08.600662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:10.973107Z","title":"Bolstering causal reasoning in video question answering with multi-event causal discovery,","venue":null,"work_id":"d8fbcc02-285c-47c0-8b62-e7cfad4a739d","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.649287Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:2b4380b3a5c6ca41bef70ed63b4b927d8771c621d822aa65796a448421c792cd","observation_id":"046aa1f3-2440-482a-965b-f55308a449ac","resolution":{"observed_at":"2026-08-06T20:43:11.013528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12235","last_updated":"2024-06-29T08:15:27Z","snapshot_observed_at":"2026-08-08T10:20:53.120797Z","submitted_at":"2024-06-18T03:19:24Z","title":"Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12235","snapshot_observed_at":"2026-08-06T20:43:06.699602Z","title":"Holmes-vad: Towards unbi- ased and explainable video anomaly detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.699602Z"},"links":{"cited_paper":"/paper/2406.12235","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:3f14a3a37aa5e34c0b7edbd5e44260059e12ddae515f6fd4ad6850970973a126","observation_id":"5e2b02e0-e7f2-42f7-ab20-4f32a1d7f23b","resolution":{"observed_at":"2026-08-06T20:43:06.699602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.03235","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:08.316694Z","title":"Crash time matters: Hybridmamba for fine-grained temporal localization in traffic surveillance footage,","venue":null,"work_id":"57bcde7a-1f0d-4998-a756-9f03b6e2eb76","year":2025},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.823875Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:99211922b56426c48582154fb6ba63b3f1e1938d36f65fc0379153ebcb6fccaa","observation_id":"fa4a90d0-3923-4b4d-9ace-6a6bdbaffac6","resolution":{"observed_at":"2026-08-06T20:43:08.409542Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05383","last_updated":"2024-09-09T07:31:16Z","snapshot_observed_at":"2026-07-06T19:12:23.792177Z","submitted_at":"2024-09-09T07:31:16Z","title":"Deep Learning for Video Anomaly Detection: A Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05383","snapshot_observed_at":"2026-08-06T20:43:06.875392Z","title":"Deep learning for video anomaly detection: A review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.875392Z"},"links":{"cited_paper":"/paper/2409.05383","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:fbee458bc0daca1aec86d4481ddd6c6f60f1da906142abf886c62758fe71393a","observation_id":"de6cdf92-6b1d-4796-9fd7-13e3091f4760","resolution":{"observed_at":"2026-08-06T20:43:06.875392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14329","last_updated":"2023-03-25T02:11:31Z","snapshot_observed_at":"2026-08-05T04:18:18.416874Z","submitted_at":"2023-03-25T02:11:31Z","title":"Edge-Based Video Analytics: A Survey","version":1},"cited_work":{"arxiv_id":"2303.14329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.14329","snapshot_observed_at":"2026-08-06T20:43:07.960584Z","title":"Edge-Based Video Analytics: A Survey","venue":"cs.DC","work_id":"5f9bf19c-8866-4963-b163-071e9c9a008a","year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.975537Z"},"links":{"cited_paper":"/paper/2303.14329","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c062e96c819d491198bb52c2c4618f0f8b743c611c6aaf91d843e80408ea15b1","observation_id":"0b092ca4-8f8d-4826-b6ab-28e387c2b98d","resolution":{"observed_at":"2026-08-06T20:43:08.050272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:10.857309Z","title":"Synthetic datasets for autonomous driving: IEEE TRANSACTIONS ON INTELLIGENT TRANSPORTATION SYSTEMS, VOL. XX, NO. X, MONTH YEAR 24 A survey,","venue":null,"work_id":"46127c57-b148-445e-b5eb-d85a7dbc5ac5","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.129418Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:ae98bb8d1e8928b82f11e6b7e920b316555063a106b6c9b0f1d87cf497cd3a3d","observation_id":"717e465f-ae8d-4ec1-b57d-2bf8175191c6","resolution":{"observed_at":"2026-08-06T20:43:10.906404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:10.768265Z","title":"Domain general- ization through meta-learning: a survey,","venue":null,"work_id":"5cbd898c-b3f3-4df9-bc99-c81718fccd27","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.219424Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:dd6c959befff7a2c9902005668857e871875f18a26441952a6f34e329a74274f","observation_id":"b0c01428-eb14-473d-abfa-5624e1ff7f9c","resolution":{"observed_at":"2026-08-06T20:43:10.802463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11334","last_updated":"2024-01-23T07:36:33Z","snapshot_observed_at":"2026-08-09T19:23:41.731633Z","submitted_at":"2021-10-21T17:59:41Z","title":"Generalized Out-of-Distribution Detection: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.11334","snapshot_observed_at":"2026-08-06T20:43:07.278200Z","title":"Generalized out-of- distribution detection: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.278200Z"},"links":{"cited_paper":"/paper/2110.11334","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c2c1b1b3c3e64b654428f424d597e1ebafbe59b42dca378f3d42b0d2d688be8c","observation_id":"d82ac71d-4534-4271-872a-011aa335da6f","resolution":{"observed_at":"2026-08-06T20:43:07.278200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:07.353734Z","title":"Carla: An open urban driving simulator,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.353734Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c56f4e84319aa40b4ec324e48f4178707291c1bc4cf7536c50f905afe3cbc9af","observation_id":"8303e124-e7be-4be8-b8b6-ea50d8515671","resolution":{"observed_at":"2026-08-06T20:43:07.353734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:10.646601Z","title":"Perception, planning, control, and coordination for autonomous vehicles,","venue":null,"work_id":"24c07946-8dcc-466e-8935-975f52022979","year":2017},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.464300Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:edfd389cb36d2e0c39c1c298cf3d3077eacb428587e5d911972faaa859d96cfa","observation_id":"703f5a5a-6ad8-41be-8d29-cfa24306dade","resolution":{"observed_at":"2026-08-06T20:43:10.701373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:10.530614Z","title":"A survey of the multi-sensor fusion object detection task in autonomous driving,","venue":null,"work_id":"93340316-c6e2-4751-af2b-8d0bf0647045","year":2025},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.581462Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:7a2615e858d87e54cca2bdf3f9c8b8b1e40b1233e538ed2b0104013cefc7e9dc","observation_id":"a8c7cc71-d1b7-48aa-930d-07d82ab268c5","resolution":{"observed_at":"2026-08-06T20:43:10.573511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09724","last_updated":"2025-07-01T18:36:07Z","snapshot_observed_at":"2026-08-07T16:06:05.877098Z","submitted_at":"2025-04-13T21:12:24Z","title":"A Survey on Efficient Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09724","snapshot_observed_at":"2026-08-06T20:43:07.662405Z","title":"A survey on efficient vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.662405Z"},"links":{"cited_paper":"/paper/2504.09724","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:7050f3d6a15135f42ecbc5a412612715dc7d52f22bc2ffbb6b1b0d62dae8b9e8","observation_id":"c44dce93-6c64-4a7e-b261-b9159e25900e","resolution":{"observed_at":"2026-08-06T20:43:07.662405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14565","last_updated":"2025-06-28T09:36:36Z","snapshot_observed_at":"2026-07-06T19:54:05.139608Z","submitted_at":"2024-11-21T20:29:59Z","title":"Privacy-Preserving Video Anomaly Detection: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14565","snapshot_observed_at":"2026-08-06T20:43:07.779736Z","title":"Privacy-preserving video anomaly detection: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.779736Z"},"links":{"cited_paper":"/paper/2411.14565","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:60c8deae4fac9f590197609a9cc0bf03b7be0ba5c2ddf792a1453af0acd74339","observation_id":"e3e4edb3-e917-46a5-bf44-7a4e139f5ef5","resolution":{"observed_at":"2026-08-06T20:43:07.779736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17757","last_updated":"2024-07-25T04:12:49Z","snapshot_observed_at":"2026-07-06T18:51:41.167282Z","submitted_at":"2024-07-25T04:12:49Z","title":"CRASH: Crash Recognition and Anticipation System Harnessing with Context-Aware and Temporal Focus Attentions","version":1},"cited_work":{"arxiv_id":"2407.17757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.17757","snapshot_observed_at":"2026-08-06T20:43:10.328885Z","title":"CRASH: Crash Recognition and Anticipation System Harnessing with Context-Aware and Temporal Focus Attentions","venue":"cs.CV","work_id":"af74c347-5dfe-4405-b222-5c65a095a931","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.229060Z"},"links":{"cited_paper":"/paper/2407.17757","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:93cb0cda90293db4aa9321f8330a60aa9db37c14c97130c4fe497508a7f73762","observation_id":"2ff580c3-6c20-4f3b-beec-639e3d156ff0","resolution":{"observed_at":"2026-08-06T20:43:10.363170Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges"},"reference_resolution":{"displayed":97,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":46,"verified_exact":8,"verified_fuzzy":38},"total_outbound_references":97},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 2 inbound Pith citation observations for arXiv:2507.02074."}