{"as_of":"2026-08-14T18:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2747a41243d842549a44b9e62ce3f7698523e970ce482724aa70ec68395ae87c","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:44:08.780881Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:38:16.204012Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T00:15:52.849428Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"cited_work":{"arxiv_id":"2412.01132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01132","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"979a861d-1636-435b-8d60-22182c5d78f5","year":2024},"citing_paper":{"arxiv_id":"2604.08014","last_updated":"2026-04-21T06:24:07Z","snapshot_observed_at":"2026-08-12T18:01:28.612956Z","submitted_at":"2026-04-09T09:14:00Z","title":"Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T18:38:16.204012Z"},"links":{"cited_paper":"/paper/2412.01132","citing_paper":"/paper/2604.08014"},"observation_digest":"sha256:aac0a6ad9c1dc93d3f9b48c1e27b1ad27400429b59a2287d7bc61263003a8d51","observation_id":"f316b1d1-7c9a-494e-96fa-35b68ef33342","resolution":{"observed_at":"2026-05-11T00:15:52.858304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01132/citation-record","integrity":"/paper/2412.01132/integrity","json":"/paper/2412.01132/citation-record.json","paper":"/paper/2412.01132"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.628106Z","title":"Video question answering: Datasets, algorithms and challenges, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.628106Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:a16b860d440b3c73f273f25e8db8d50839b94a2d6556922471e7a47b01d42491","observation_id":"129e97fc-118e-48b7-a6ed-537ce680ce53","resolution":{"observed_at":"2026-08-12T04:44:08.628106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.156946Z","title":"Videoqa in the era of llms: An empirical study, 2024","venue":null,"work_id":"7bdabcb4-60d1-4325-b8fa-d4a654bc57d6","year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.631391Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:f4fee1da8d757e6b5b050921cde8f4bd82a44ec06069cee66a86d7e4b4299410","observation_id":"dfad524f-48b6-47a8-843c-d10e471f9518","resolution":{"observed_at":"2026-08-12T04:44:09.158989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.150958Z","title":"Francis, and Alessandro Oltramari","venue":null,"work_id":"b6f45992-3bea-4a01-adb8-2509aeb9436f","year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.634468Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:cc13d557ffecbdf183612b6e17018e92552dff07ef153731b17fbf8d33f6bc3e","observation_id":"44aedcde-13e9-4ce0-96ad-770869e13167","resolution":{"observed_at":"2026-08-12T04:44:09.152971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.638216Z","title":"Carla: An open urban driving simulator, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.638216Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:eabb670f8f73ea9c1282aab71f91df486128e56fd27325fde0172f54f6df9dec","observation_id":"7f603df1-b510-4b89-9090-6979884feb52","resolution":{"observed_at":"2026-08-12T04:44:08.638216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.139408Z","title":"Lingoqa: Visual question answering for autonomous driving, 2024","venue":null,"work_id":"3c94f2bc-af1f-454b-af34-01fd681aa797","year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.640880Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:87d2144290b5e28de40faa23d8e53b1862395c5699f37f191b98b3ead42bf942","observation_id":"4761f4e7-63f7-48f4-8915-06f870a3c798","resolution":{"observed_at":"2026-08-12T04:44:09.142418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.131420Z","title":"Align and aggregate: Compositional reasoning with video alignment and answer aggregation for video question-answering, 2024","venue":null,"work_id":"764904cf-3dc4-4278-a8b1-73cd8f2fe73a","year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.643534Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:ba953f1642ba7226312dd8586286bde69d3226f12d77312a0df2f37b15f2d7b3","observation_id":"20c7a9e5-ca6e-4f0d-967c-a60cf68fbd61","resolution":{"observed_at":"2026-08-12T04:44:09.135003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.123745Z","title":"GPT-4o: System Card","venue":null,"work_id":"0f94ba37-543d-4cb6-a500-b138e286aaa0","year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.646199Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:3a6d55633a991349046d35693ee69e2429bcb1bd0b2f9c3d49009c67b2dc6e18","observation_id":"c9995d22-7b77-4980-8a48-530f2f7d47e3","resolution":{"observed_at":"2026-08-12T04:44:09.126898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.116653Z","title":"Dynamic spatio-temporal graph reasoning for videoqa with self-supervised event recognition","venue":null,"work_id":"3f38bca0-9215-4540-a93d-4fbb996b55e0","year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.649449Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:b342b5458454e5e1a4118626936ae97a5436c360dd00ce01873247e1ec48ca63","observation_id":"872b3005-0b4b-4fe1-a58a-d34a9b1d47f3","resolution":{"observed_at":"2026-08-12T04:44:09.119502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.109995Z","title":"Recognizing an action using its name: A knowledge-based approach","venue":null,"work_id":"28a1d02e-0201-4469-b30c-c73df2af3092","year":2016},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.651945Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:8947f52ddc414b44db34c2ee105065cee7a86b41da57c6eb329aaf1c33e0ebd2","observation_id":"5248eca9-14de-4926-9522-8ba932fb945a","resolution":{"observed_at":"2026-08-12T04:44:09.112135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.101371Z","title":"Video representation learning with deep neural networks","venue":null,"work_id":"8d1dcc3c-9ea3-47c6-99e9-ad41396fcff4","year":2019},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.654520Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:484c319d8c6d35df8107e338dd16870b7ddd79b01d7dde9e82c6366d5ded458e","observation_id":"1f6253e7-a2ae-458e-8b2b-88901f668cc4","resolution":{"observed_at":"2026-08-12T04:44:09.104141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.657336Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.657336Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:66733218ed984368497c239bd1d80344344667f2de5f0872ded9fe94f35dcfde","observation_id":"f79878ee-26e8-49f2-a65b-bff1bcd36640","resolution":{"observed_at":"2026-08-12T04:44:08.657336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.089759Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representa- tions for vision-and-language tasks","venue":null,"work_id":"d62ab371-0504-4c58-ac42-af65856414ee","year":2019},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.659970Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:8ef217ab8a6a9ebc52c23286f78f7ebcbc095f5d65c113eed1840c2b9b1c8529","observation_id":"288832a7-3821-4f8b-a103-91085ed142b5","resolution":{"observed_at":"2026-08-12T04:44:09.092676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.081244Z","title":"Compositional attention networks with two-stream fusion for video question answering","venue":null,"work_id":"28143587-b236-4072-8417-abb741a9f355","year":2020},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.663000Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:71c2d603c49a7317033d802c01eca3bf37bb6f3c418882f829ee4eebba4ca223","observation_id":"b4658756-8c62-4aa0-967b-6cc2596ce35a","resolution":{"observed_at":"2026-08-12T04:44:09.083934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.073417Z","title":"Visualbert: A simple and performant baseline for vision and language, 2019","venue":null,"work_id":"29dda406-0d55-4a96-b47b-08fe1bd5c152","year":2019},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.665457Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:28b33eb64d49b399fe856b5cbd71135e5b8c4acac43ff28323269bb7a637b298","observation_id":"eff6c892-b8f5-4b73-bede-f3b5f70725ca","resolution":{"observed_at":"2026-08-12T04:44:09.075921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.065350Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"38a01b62-6dab-4b31-9427-5d7deee7b0d1","year":2015},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.668187Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:3c91725eec28393c8d388b26816aab01a60d9f4ad2bbc716b8ec9a1e965a8453","observation_id":"e93753ee-4fb1-42ea-af3b-7a21806dd383","resolution":{"observed_at":"2026-08-12T04:44:09.068111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.058095Z","title":"Tgif: A new dataset and benchmark on animated gif description, 2016","venue":null,"work_id":"87bbc736-2d97-40ca-8cc0-7b8857f9bd3d","year":2016},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.671405Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:21b5aba01165b9e5e97fb04e55c73c1f0e1757b09b9497f7424191c108896d3e","observation_id":"c73926d5-4343-4d0b-af80-0c22f0799a30","resolution":{"observed_at":"2026-08-12T04:44:09.061016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.050140Z","title":"Next-qa:next phase of question-answering to explaining temporal actions, 2021","venue":null,"work_id":"ad18c3f7-675c-4059-96c9-75be6a8ac323","year":2021},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.673233Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:18b6a4f4a8f451ce121e272b9328ec111b4fb25e423ba0a7c4f1ea1895e58d94","observation_id":"5d00888a-1c89-44a0-af8f-a916f2ee03a5","resolution":{"observed_at":"2026-08-12T04:44:09.052959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.042783Z","title":"Gemini: A family of highly capable multimodal models, 2024","venue":null,"work_id":"7c093004-9117-4baf-afd0-9143062fcb6f","year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.675015Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:b91b1967a4611aaa635d4bff6bff286daceb8fb24b7cd3d4e2e3582cc27ac2a5","observation_id":"79cac09c-c190-41f0-b3dd-f544ee9bf5d8","resolution":{"observed_at":"2026-08-12T04:44:09.045004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.677145Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.677145Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:fb69fa88a6edf3308212ac32d3c1d229ed90dc5909063d08bd8286db45c3d236","observation_id":"08f1446b-302c-487e-971f-60fdc007da69","resolution":{"observed_at":"2026-08-12T04:44:08.677145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.032680Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video, 2022","venue":null,"work_id":"8aed8217-7d44-408a-9fea-117da59c464f","year":2022},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.679543Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:6e7e431f0f88de06fe75b306bd57748e2162d14aa03ef6941420ddb3fe2a98f6","observation_id":"c726ee96-410e-46ec-9cbb-1a3f447843dd","resolution":{"observed_at":"2026-08-12T04:44:09.035218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.025681Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"6f2139d6-d601-4a24-9877-d1fcffc40d8c","year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.681380Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:ccfbabad262972bba717e9bc3e70adbd7a53edc26f591bec6ceeecff2840a2db","observation_id":"e9d99f4f-780b-4100-9884-961ae8c0217f","resolution":{"observed_at":"2026-08-12T04:44:09.028613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-14T05:21:47.116034Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-12T04:44:08.683715Z","title":"Cinepile: A long video question answering dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.683715Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:83b89599cbe9756c23ea954601089611cb3e61efb4235b80f4ba7c02bb3397b5","observation_id":"7573b07a-f401-4f63-8698-9066dda52739","resolution":{"observed_at":"2026-08-12T04:44:08.683715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.017189Z","title":"Mist: Medical image segmenta- tion transformer with convolutional attention mixing (cam) decoder","venue":null,"work_id":"674352cc-36fc-4a4a-8692-7e9d306aff2c","year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.687529Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:8e434b7ed72d9676ab39dcba16c259f28ac22c6e3d36afa0179dbf203abb920d","observation_id":"8d4d09cf-3d89-4d80-96f0-5dc03a22fba5","resolution":{"observed_at":"2026-08-12T04:44:09.020688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:09.008610Z","title":"A multi-world approach to question answering about real-world scenes based on uncertain input","venue":null,"work_id":"f6ad20ab-d8b4-428d-9661-ad8b4b6e31f8","year":2014},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.689912Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:33f5fea77f05651e6ba9097aeff59a2eae072b07a91c5518f4131aa921f66da7","observation_id":"757f607f-27dc-47d1-b85b-0de084d1c596","resolution":{"observed_at":"2026-08-12T04:44:09.011374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.999889Z","title":null,"venue":null,"work_id":"00501eb4-c2bb-4c27-9a87-ffd1e7674712","year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.692251Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:af2f0b57cb291a5c01faa4878c2ea1923e4ab8647de311ce6e798b135f94cbba","observation_id":"5da1ab1b-8c51-41a9-b746-be81af226e7f","resolution":{"observed_at":"2026-08-12T04:44:09.002771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.992387Z","title":"Sutd-trafficqa: A question answering benchmark and an efficient network for video reasoning over traffic events","venue":null,"work_id":"d9179dea-c0f2-46a2-920f-2c91ca09c673","year":2021},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.694585Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:cc65ecd2cae47921ec71da486f127f7179845171b2ab2dde07e9038a0f15f3e0","observation_id":"3b0ec725-2eeb-40b2-bb12-70ed4eb13ed5","resolution":{"observed_at":"2026-08-12T04:44:08.994916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.986017Z","title":"Argos vision: Advanced computer vision solutions, 2024","venue":null,"work_id":"f177732a-8674-4648-a243-498352631dca","year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.697182Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:055312bdbb43dd6899902cd2a571d5489fc487e0d2b0667811cb808484f8c8be","observation_id":"5d18766e-e981-475a-bb57-8f40c2e22232","resolution":{"observed_at":"2026-08-12T04:44:08.988205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.977902Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":"72458346-0a28-4022-aa9b-184b0bf5d61f","year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.699688Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:3ea9792e041ac583f8026c9e2e720b13b161050a32d9f387f321864186e7fd08","observation_id":"702591f2-84be-46f0-8228-b9617433be06","resolution":{"observed_at":"2026-08-12T04:44:08.981283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T04:44:08.703083Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.703083Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:7d7e1271ad5ac83bfbcd226a5b243177088b294834cd95604dd3abe03c48b559","observation_id":"61059adc-ffe0-4a6c-9a91-a63ae3a9cb7b","resolution":{"observed_at":"2026-08-12T04:44:08.703083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-12T04:44:08.706359Z","title":"Llava-next- interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.706359Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:c866dfa4e68e25d74acff7d98930a6352aa5c8d96296c434969b8d1bf45402c8","observation_id":"1dc40cf6-3779-4f84-adfb-f31fc1f4023c","resolution":{"observed_at":"2026-08-12T04:44:08.706359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T04:44:08.709264Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.709264Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:f4cce70d9122b2ec139b50d51e7df12a0b73f99e7beeb97e1472cd5e69662986","observation_id":"9366bec2-442a-4b46-9588-cd422ecda1d4","resolution":{"observed_at":"2026-08-12T04:44:08.709264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.712087Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.712087Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:1ff49149ce3a2983249e1d1d2639b9a1f3fc2966317f4b392c8b624ec4fed385","observation_id":"2562f93c-e1f9-4275-88af-c45b25505be9","resolution":{"observed_at":"2026-08-12T04:44:08.712087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-12T04:44:08.714649Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.714649Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:c17bcbd98016b0e0562caa40bf437820944bcff959ea86f31fddb37c644e696b","observation_id":"534606d4-8008-4126-b81e-c515c2655036","resolution":{"observed_at":"2026-08-12T04:44:08.714649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.966578Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"44e8d46e-8319-4e39-8dac-67d40a0bf699","year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.718434Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:ec36a3716629e4f5254aaaa1fe27c5ecd9badf0f7df63651c985424a4a62adab","observation_id":"5cc90ef3-4729-45c5-a76b-58a6d51ae024","resolution":{"observed_at":"2026-08-12T04:44:08.969301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-12T04:44:08.720642Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.720642Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:2b8a39c52a69ab01905a33cdd0360ef66d71620f4c4edd818dfdb678f1e67260","observation_id":"bcfcc618-7819-43ac-b05d-3f39601e250d","resolution":{"observed_at":"2026-08-12T04:44:08.720642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-12T04:44:08.722805Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.722805Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:af8239e7ad0aa43b0c14e4d0cbdc2142f3494e7f9474285ee427965d7552fc7c","observation_id":"09fad8df-814b-4bc4-a41d-6e3584624b82","resolution":{"observed_at":"2026-08-12T04:44:08.722805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-12T04:44:08.725326Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.725326Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:1cd7ace9041d00b4063bcd4399ff3f43f592444463d46ab55654e3b8c14070f6","observation_id":"609fe016-13b9-49e0-91f5-1451828ffdfa","resolution":{"observed_at":"2026-08-12T04:44:08.725326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T04:44:08.728515Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.728515Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:a80aa50ca628b76d511d3280c645bb8549e81b18ea552de124a8bb4b6c32f945","observation_id":"d87acb9a-73b4-425c-936a-2e63e780a536","resolution":{"observed_at":"2026-08-12T04:44:08.728515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.958767Z","title":"Minesh Mathew","venue":null,"work_id":"be572bea-cd39-4ca5-a4fb-08d30d65344a","year":2021},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.731416Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:e95e5a43a8f332d75d283567d3ff21b1559c3f324a5e7bbe586a44488be03ae4","observation_id":"185f6007-f6c3-4765-aa97-855bd88e3305","resolution":{"observed_at":"2026-08-12T04:44:08.961214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.952020Z","title":null,"venue":null,"work_id":"d1457e95-0019-45cd-ad08-9c97ec3673e2","year":2022},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.733741Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:b14413623d118c65451d20df7f3348a1543d61375b9110070ce217947d7c05ba","observation_id":"d2ac603b-7010-4854-ad84-de5d025caa2d","resolution":{"observed_at":"2026-08-12T04:44:08.954331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.945443Z","title":"Infographicvqa","venue":null,"work_id":"21c0857c-34f7-4f04-bc53-2b4c6ad5e62f","year":2022},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.737210Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:fad5cc3f34ef649f42650d0d427e2dcf930aefa921fc008ab1efacb83b72e779","observation_id":"2987ac11-a28d-4c06-8098-a0ae3a7b7454","resolution":{"observed_at":"2026-08-12T04:44:08.947975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.939299Z","title":"Towards vqa models that can read","venue":null,"work_id":"af0ff2bc-eda0-4b84-9dd3-228294b92497","year":2019},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.739917Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:a2675b329076ec76ebdd364fd6c5ef972e536bf9cae73781467b542fa868e70a","observation_id":"59ea8c61-fff6-4480-89f1-6123798168da","resolution":{"observed_at":"2026-08-12T04:44:08.941345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-12T04:44:08.742181Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.742181Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:3d27d976dd0f12384a8698ecdb5fc0ccda837986ba77a66bdfc52f7aac508378","observation_id":"3a21812c-f164-45cd-97ac-fd6c8ce900a6","resolution":{"observed_at":"2026-08-12T04:44:08.742181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.746244Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask agi, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.746244Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:9be4254ace780e127d0c85b7c1e0f52982e9e019bf764bd6db26b407410f7fa4","observation_id":"e0bb42d2-7d75-4433-9fe4-2636430cfaee","resolution":{"observed_at":"2026-08-12T04:44:08.746244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.928591Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"c7be0184-6594-4a56-9f6f-699cf823a9de","year":2021},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.749583Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:9756e10ca13b14ddd2b713ab1fd5764a0fd3262fdb8683fb7cd6ef380a0c03df","observation_id":"2f90c4b2-758f-4fed-ba1c-122d09534858","resolution":{"observed_at":"2026-08-12T04:44:08.932031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.920720Z","title":"Beats: Audio pre-training with acoustic tokenizers","venue":null,"work_id":"79dac25a-ebda-4c3c-a1be-27e050f2ca01","year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.752199Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:7df46635ddc87fdf07ceae21c795d651bc803197f7bf3b5e2bbfb6f9e4d5eedf","observation_id":"824b2fb0-b4b9-43eb-ae50-573ec8937a95","resolution":{"observed_at":"2026-08-12T04:44:08.923785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.754826Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.754826Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:6d041cdeed587a4b2dcdbebdb8f7cd4a42ccca7930534c680a4be19b25563a85","observation_id":"40d87ff2-f9ca-4180-a1f5-dfbe488898d5","resolution":{"observed_at":"2026-08-12T04:44:08.754826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19479","last_updated":"2024-02-29T18:59:50Z","snapshot_observed_at":"2026-08-14T07:36:16.844137Z","submitted_at":"2024-02-29T18:59:50Z","title":"Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19479","snapshot_observed_at":"2026-08-12T04:44:08.757039Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.757039Z"},"links":{"cited_paper":"/paper/2402.19479","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:8772edf53c0e5b20b4faaa9e50f989bd4fd6d510eada29ef6d90ac364fc1c70a","observation_id":"3f8fb43b-7709-4f52-b0a4-a0b2a3109792","resolution":{"observed_at":"2026-08-12T04:44:08.757039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-14T03:13:25.123360Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-12T04:44:08.759431Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.759431Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:c52534a1ab7e98f1ae809f1136c069629dc6a9eda2d44b9f56008eaa6a78832e","observation_id":"fd311754-fd02-46e3-b8ed-c8f7b2ddd62a","resolution":{"observed_at":"2026-08-12T04:44:08.759431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.908854Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"8d730b7a-7ad6-44d8-8f16-6e47401964dc","year":2021},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.762072Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:96ae7be70a0b450cb7ee8eb6c87d643dabda4820e2f5731a8a0dcac8c6990494","observation_id":"f0de5971-23ab-4a76-a6ac-dc29b659efeb","resolution":{"observed_at":"2026-08-12T04:44:08.911658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-12T04:44:08.765337Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.765337Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:32794929484f663c3f81959f9c1515bc23db922bf7d8d9c26d4813423903ccd2","observation_id":"bdeeb4e0-ac6c-41f9-a072-332ba319b5f3","resolution":{"observed_at":"2026-08-12T04:44:08.765337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.899849Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"e7f4b5c8-bf7b-4812-b6e0-03c088346cd9","year":2021},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.768099Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:376ad13ffa88409f995086bbcb517669bbc3848a4f17d8aae29142a7a0d83110","observation_id":"45b27448-3032-4290-8177-014191844ef8","resolution":{"observed_at":"2026-08-12T04:44:08.903229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08578","last_updated":"2024-06-17T14:30:51Z","snapshot_observed_at":"2026-08-13T05:02:53.341171Z","submitted_at":"2023-12-14T00:42:23Z","title":"A Picture is Worth More Than 77 Text Tokens: Evaluating CLIP-Style Models on Dense Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08578","snapshot_observed_at":"2026-08-12T04:44:08.770534Z","title":"A picture is worth more than 77 text tokens: Evaluating clip-style models on dense captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.770534Z"},"links":{"cited_paper":"/paper/2312.08578","citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:4216401aa4c7481e1bbd1524bd526d1d5d67e7b44923a6f5071b57d31976953a","observation_id":"f6484ece-c312-4ca4-8b39-8a7d9917b913","resolution":{"observed_at":"2026-08-12T04:44:08.770534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.772811Z","title":"Advancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.772811Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:6048a4712cbd530a85b88817b2fd7df93a26585e8f6a1a6016a3a5d9eeb2e5a0","observation_id":"ac9974fc-3fc7-408f-802f-d469af7619dd","resolution":{"observed_at":"2026-08-12T04:44:08.772811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.775565Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.775565Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:4ab69ea7c022999b591e6b2560d4006803b4a2f0b4a58ea5ac50ca15dec91b9e","observation_id":"683195b3-4202-4a26-8627-2b7242cd4580","resolution":{"observed_at":"2026-08-12T04:44:08.775565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.778585Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.778585Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:9774fbb29f2c8be3d25ff797c5f1a59692df446e9d2b1bbd9ac3f02ba0487286","observation_id":"59587831-6f21-4d66-b0dd-7251b5939791","resolution":{"observed_at":"2026-08-12T04:44:08.778585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:44:08.878901Z","title":"How many cars can you see?","venue":null,"work_id":"8738314f-241a-4c40-8827-9138e983f9b8","year":2024},"citing_paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.780881Z"},"links":{"citing_paper":"/paper/2412.01132"},"observation_digest":"sha256:5a2e3dffeb96bbae4e2714d6d924a936d2fadaa74701150a22f4449dffee9a43","observation_id":"ce52ce43-89c2-4ffe-a81b-12acc45d3999","resolution":{"observed_at":"2026-08-12T04:44:08.883904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01132","last_updated":"2024-12-02T05:15:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T14:24:30.349262Z","submitted_at":"2024-12-02T05:15:32Z","title":"Eyes on the Road: State-of-the-Art Video Question Answering Models Assessment for Traffic Monitoring Tasks"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2412.01132."}