{"as_of":"2026-08-18T03:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b6d096b0719745fc4b44f1600522ea3e64b2d6b4645d47eb6dba85b938946f6f","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:15:50.652098Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:20:12.739322Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:20:11.800532Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20091","snapshot_observed_at":"2026-08-06T22:20:12.739322Z","title":"Videomultiagents: A multi-agent framework for video question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21891","last_updated":"2025-06-27T04:05:12Z","snapshot_observed_at":"2026-08-15T10:08:41.332771Z","submitted_at":"2025-06-27T04:05:12Z","title":"DIVE: Deep-search Iterative Video Exploration A Technical Report for the CVRR Challenge at CVPR 2025","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:12.739322Z"},"links":{"cited_paper":"/paper/2504.20091","citing_paper":"/paper/2506.21891"},"observation_digest":"sha256:1aacbf18113a456c7dd7dda9d94504a0b269276895022c3192d187c6fa601918","observation_id":"bc3b5004-dfc5-4e02-a6dc-af4e8fc96a92","resolution":{"observed_at":"2026-08-06T22:20:12.739322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"cited_work":{"arxiv_id":"2504.20091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.20091","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videomultiagents: A multi-agent framework for video question answering","venue":null,"work_id":"aba974bd-5263-4843-8959-a118766217cb","year":2025},"citing_paper":{"arxiv_id":"2511.15578","last_updated":"2025-11-19T16:09:38Z","snapshot_observed_at":"2026-08-11T17:24:10.391404Z","submitted_at":"2025-11-19T16:09:38Z","title":"AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T20:18:19.580156Z"},"links":{"cited_paper":"/paper/2504.20091","citing_paper":"/paper/2511.15578"},"observation_digest":"sha256:1b6045647d5177db9e5e0fd17c56319b2e3bec028d31dd6f8820110d34b2ff19","observation_id":"f87ec8e5-4f9f-4518-a73d-372fddc88871","resolution":{"observed_at":"2026-05-17T20:20:11.802601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"cited_work":{"arxiv_id":"2504.20091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.20091","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videomultiagents: A multi-agent framework for video question answering","venue":null,"work_id":"aba974bd-5263-4843-8959-a118766217cb","year":2025},"citing_paper":{"arxiv_id":"2604.05076","last_updated":"2026-04-06T18:21:32Z","snapshot_observed_at":"2026-08-13T09:16:29.691363Z","submitted_at":"2026-04-06T18:21:32Z","title":"GLANCE: A Global-Local Coordination Multi-Agent Framework for Music-Grounded Non-Linear Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T19:13:30.400059Z"},"links":{"cited_paper":"/paper/2504.20091","citing_paper":"/paper/2604.05076"},"observation_digest":"sha256:00a0380a3a48d73a96a03f7383b940f3b9779ae7d20fce16ebf5f7b50c2a8ea4","observation_id":"b91c65b1-a8d0-4f39-9fc3-459a2d524396","resolution":{"observed_at":"2026-05-10T23:20:51.052309Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"cited_work":{"arxiv_id":"2504.20091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.20091","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videomultiagents: A multi-agent framework for video question answering","venue":null,"work_id":"aba974bd-5263-4843-8959-a118766217cb","year":2025},"citing_paper":{"arxiv_id":"2605.00444","last_updated":"2026-05-01T06:24:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:24:40Z","title":"Scaling Video Understanding via Compact Latent Multi-Agent Collaboration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T20:11:11.410051Z"},"links":{"cited_paper":"/paper/2504.20091","citing_paper":"/paper/2605.00444"},"observation_digest":"sha256:6984c271fe12a4dff438b99f4063e34cc2b709fe5887f055632b84753a602005","observation_id":"40b269ad-0e41-43eb-ac0d-a2e4c554f35b","resolution":{"observed_at":"2026-05-11T15:21:09.484637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20091","snapshot_observed_at":"2026-08-01T13:13:54.698349Z","title":"arXiv preprint arXiv:2504.20091(2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22715","last_updated":"2026-07-21T15:29:39Z","snapshot_observed_at":"2026-08-15T12:44:44.405713Z","submitted_at":"2026-07-21T15:29:39Z","title":"Child-Oriented AIGC Video Risk Reviewing: A Benchmark and Knowledge-Supported Iterative Reasoning Framework","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T13:13:54.698349Z"},"links":{"cited_paper":"/paper/2504.20091","citing_paper":"/paper/2607.22715"},"observation_digest":"sha256:c6a095443b44d5be2986281ba367c7fc1d437c9bfb96aa1ab6663362b9bb1fbb","observation_id":"b6d20c69-d121-4d76-bb05-73b40e4804ad","resolution":{"observed_at":"2026-08-01T13:13:54.698349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20091","snapshot_observed_at":"2026-08-05T12:48:10.936504Z","title":"arXiv preprint arXiv:2504.20091 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03779","last_updated":"2026-08-04T15:01:59Z","snapshot_observed_at":"2026-08-14T19:33:22.196222Z","submitted_at":"2026-08-04T15:01:59Z","title":"AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T12:48:10.936504Z"},"links":{"cited_paper":"/paper/2504.20091","citing_paper":"/paper/2608.03779"},"observation_digest":"sha256:92852da846f247ef5c4ba96bbcf06eb7b1e73509825e5610d5f07724d67183df","observation_id":"de8679bc-353a-45a9-b2ca-0d4f70d4bb3c","resolution":{"observed_at":"2026-08-05T12:48:10.936504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.20091/citation-record","integrity":"/paper/2504.20091/integrity","json":"/paper/2504.20091/citation-record.json","paper":"/paper/2504.20091"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.14194","last_updated":"2026-04-07T03:28:51Z","snapshot_observed_at":"2026-08-10T21:39:41.231181Z","submitted_at":"2025-01-24T02:56:59Z","title":"ENTER: Event Based Interpretable Reasoning for VideoQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14194","snapshot_observed_at":"2026-08-16T10:15:50.482442Z","title":"Ayyubi, Junzhang Liu, Ali Asgarov, Zaber Ibn Abdul Hakim, Najibul Haque Sarker, Zhecan Wang, Chia-Wei Tang, Hani Alomari, Md","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.482442Z"},"links":{"cited_paper":"/paper/2501.14194","citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:e3bdf2c0b7922b0cfcf5aeed2100d12a6b2596453f9c57f363e3a27c225a6486","observation_id":"aa1e6425-295d-4105-908b-86faefb6c1c4","resolution":{"observed_at":"2026-08-16T10:15:50.482442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04998","last_updated":"2024-11-07T18:59:16Z","snapshot_observed_at":"2026-08-16T13:01:59.691630Z","submitted_at":"2024-11-07T18:59:16Z","title":"HourVideo: 1-Hour Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04998","snapshot_observed_at":"2026-08-16T10:15:50.488285Z","title":"Hadzic, Taran Kota, Jimming He, Cristobal Eyzaguirre, Zane Du- rante, Manling Li, Jiajun Wu, and Fei-Fei Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.488285Z"},"links":{"cited_paper":"/paper/2411.04998","citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:857f1f12756b3d49f0c78eeae2b2d56767c06139a1df35ed71a1667ac5650d48","observation_id":"5551cb9e-2eff-4e80-b4dc-475bf1407573","resolution":{"observed_at":"2026-08-16T10:15:50.488285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:50.493392Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video- llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.493392Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:8d2f14b6d8bb46a55802c02540a7bc014fe82981a0547a66027cfd533d0ce16b","observation_id":"3e0ccdbc-dc61-4c8e-9ba9-47889b54753e","resolution":{"observed_at":"2026-08-16T10:15:50.493392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.272666Z","title":"Adaptive video relationship detection via graph matching and attention","venue":null,"work_id":"3d745d45-6b55-48f5-8393-35fef2d742b7","year":2021},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.498350Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:084c3c3126bdee900be6fdf33a8bfc48d05361ac6f5c95a32325e9b43874a638","observation_id":"2c2dd7f3-ec03-476e-906b-b993d97fa18c","resolution":{"observed_at":"2026-08-16T10:15:51.278269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11331","last_updated":"2023-03-22T14:10:37Z","snapshot_observed_at":"2026-08-16T15:46:46.482584Z","submitted_at":"2023-03-20T17:59:59Z","title":"EVA-02: A Visual Representation for Neon Genesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11331","snapshot_observed_at":"2026-08-16T10:15:50.503049Z","title":"Towards fine-grained video question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.503049Z"},"links":{"cited_paper":"/paper/2303.11331","citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:834f738fc3ac36ca85f011dfd5be41898ed065e30f4be27f8c8384f444bb1e6c","observation_id":"6a83fc47-71a2-43f2-9405-f98f961ab9e5","resolution":{"observed_at":"2026-08-16T10:15:50.503049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11481","last_updated":"2024-07-15T09:54:30Z","snapshot_observed_at":"2026-08-16T14:08:56.880908Z","submitted_at":"2024-03-18T05:07:59Z","title":"VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11481","snapshot_observed_at":"2026-08-16T10:15:50.508081Z","title":"Videoagent: A memory- augmented multimodal agent for video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.508081Z"},"links":{"cited_paper":"/paper/2403.11481","citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:6d51099dedde9cb6c9222e836890a5eb5b5682d437ad9b323a203da6ce6630b4","observation_id":"d32cc318-6bac-40e6-9653-2b7e2686b168","resolution":{"observed_at":"2026-08-16T10:15:50.508081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.256772Z","title":"Linvt: Empower your image- level large language model to understand videos, 2024","venue":null,"work_id":"46be98ae-2262-4013-822d-bb3f9122f24e","year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.513182Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:8b691c64ecb0d9ff7a5c7c6b3419889b624de075b6f07b90274663770edfc4ee","observation_id":"c5d50635-7b9b-4544-8983-b4e1ef5550e8","resolution":{"observed_at":"2026-08-16T10:15:51.261938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.240855Z","title":"Learning situation hyper-graphs for video question answering","venue":null,"work_id":"dc314f4e-5b25-4968-99e1-fef8977d27b6","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.518252Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:7079e1e9118ee54065d0960a4cd7d6a190fd3c509a79ce731b093904fd97f269","observation_id":"676aa8b4-368e-4b74-9eaf-265bf3b8d0cf","resolution":{"observed_at":"2026-08-16T10:15:51.245868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.224630Z","title":"An image grid can be worth a video: Zero-shot video question answering using a vlm","venue":null,"work_id":"f1f377e0-7218-43cb-b535-9368d99993ba","year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.522952Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:d8f7712acee799de244eab44cf86e724ef387b41d571fee7a43d528892344941","observation_id":"5836d3ee-1455-4a25-a072-05b14e1848f2","resolution":{"observed_at":"2026-08-16T10:15:51.229551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03610","last_updated":"2024-07-04T03:40:36Z","snapshot_observed_at":"2026-08-16T13:37:11.573392Z","submitted_at":"2024-07-04T03:40:36Z","title":"VDMA: Video Question Answering with Dynamically Generated Multi-Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03610","snapshot_observed_at":"2026-08-16T10:15:50.527617Z","title":"Vdma: Video question answering with dynamically generated multi-agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.527617Z"},"links":{"cited_paper":"/paper/2407.03610","citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:f96ad3dd72090e784d85e9d10cd54d36b6a91f12156652c71ae5d0f40ca2ef6c","observation_id":"acb824ff-54de-4b32-ae30-a082cbfa9acc","resolution":{"observed_at":"2026-08-16T10:15:50.527617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:50.532725Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.532725Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:c1289184db37bb66378ef11025c8d36d70e9b2a33942aa9936aaaec23e7d52ae","observation_id":"3416796f-bb40-4e78-b057-3022daf27627","resolution":{"observed_at":"2026-08-16T10:15:50.532725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.198781Z","title":"In- tentqa: Context-aware video intent reasoning","venue":null,"work_id":"2f86d8d4-a7c9-4dd0-96b0-534a3c92f637","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.537796Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:1461dcc82dd71b167fde0e5e7616dc02d1f7c90cb38d36ead214c1cd082a8da7","observation_id":"1e40d79c-2319-4eef-bd6c-4144028489e6","resolution":{"observed_at":"2026-08-16T10:15:51.203549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.183610Z","title":"Videoinsta: Zero-shot long video understanding via informative spatial- temporal reasoning with llms","venue":null,"work_id":"e3569340-8d37-41ff-964a-acf52229b9d5","year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.542328Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:ae67346068a792cd37155c05fb03723e267b64d6e6259d9561ba8984f22d80f7","observation_id":"bc3043f9-0cf1-473e-be77-879fd79acd5a","resolution":{"observed_at":"2026-08-16T10:15:51.188693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.168761Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"4dd60c6a-5fe4-4ba9-b659-040710145b4e","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.546971Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:f51ff512ceaf24a526437aa3742f9cb50633ea55f1b8fe6921ab1fc98e76d0c5","observation_id":"80967dbf-8a0f-4626-a629-ed2604852816","resolution":{"observed_at":"2026-08-16T10:15:51.173758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.152940Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"e9370208-653a-44ea-b516-37f436502b4b","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.551514Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:6caebcfcb5179f854413b1d017a4c02c9c433ef4d2d6e85469d4159bdfec26e7","observation_id":"f11da199-0d8f-475b-bc97-8fe9002f8627","resolution":{"observed_at":"2026-08-16T10:15:51.158095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19773","last_updated":"2023-10-30T17:44:09Z","snapshot_observed_at":"2026-08-16T14:47:32.169134Z","submitted_at":"2023-10-30T17:44:09Z","title":"MM-VID: Advancing Video Understanding with GPT-4V(ision)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19773","snapshot_observed_at":"2026-08-16T10:15:50.555962Z","title":"Mm-vid: Advancing video understanding with gpt-4v(ision)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.555962Z"},"links":{"cited_paper":"/paper/2310.19773","citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:6c76fc96112ecc37669125c04ea84048dda9d6028f59c71a9ff0d6f029a505ca","observation_id":"4d65ce78-8e5d-41de-bee1-00065871fba9","resolution":{"observed_at":"2026-08-16T10:15:50.555962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.137815Z","title":"Khan, and Fahad Shahbaz Khan","venue":null,"work_id":"87b684f1-c86b-4371-b5cc-91f766e163c2","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.561041Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:4a43aad41170bc2278305ded56bcd25d83ac2ab75e27c9e494da06672e2fd371","observation_id":"6707995e-12e0-4b8b-a491-f2475c8c986c","resolution":{"observed_at":"2026-08-16T10:15:51.142683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.121568Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"617dbeb9-a826-48a4-9fc0-6eb121fc35b6","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.565450Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:033e02d582624aea0c736db4ed6950679aaf0900ffbd318f3eb7e07e988f8217","observation_id":"45917096-e0dd-4428-bb9f-d77a939518b0","resolution":{"observed_at":"2026-08-16T10:15:51.126501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.105749Z","title":"Hello GPT-4o: OpenAI’s Multimodal GPT-4 Omni Announcement","venue":null,"work_id":"81412d39-705e-48cd-ad28-a92feefd3080","year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.569840Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:d15701cad7c0f792c2cf56186dd48202b54a1225e51775c71d71d0e489c428f8","observation_id":"fa273361-0a44-4342-80b3-1be3f7b0f28d","resolution":{"observed_at":"2026-08-16T10:15:51.110811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:50.574935Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.574935Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:62e49e04da5435133b79238a81996c40e5cb9bc67c6a54d550102b7304b235ba","observation_id":"f791700f-3d40-4d0e-a349-76e78e40ad0b","resolution":{"observed_at":"2026-08-16T10:15:50.574935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.090099Z","title":"Ts-llava: Constructing visual tokens through thumbnail-and-sampling for training-free video large language models, 2024","venue":null,"work_id":"7d4abe45-9db4-4556-92c8-720452b316df","year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.580148Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:fd2e53f6056d5949b3c61d26e6c8caa8a5fc2153070cd5515f273f8695898d4f","observation_id":"cb6589cf-d9c5-43c5-b877-59a6d59dbd4c","resolution":{"observed_at":"2026-08-16T10:15:51.095293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.074525Z","title":"Action scene graphs for long- form understanding of egocentric videos, 2023","venue":null,"work_id":"1adadc4e-ce21-417a-a840-a5663b6cf866","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.584750Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:ed6cafcc0ed8be4f22cfb96ab36d2f6d68c23a089a98657d8900c29d3ee199d3","observation_id":"97a32367-ab6e-45cc-b227-af4ff9e9ec34","resolution":{"observed_at":"2026-08-16T10:15:51.079501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.057750Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoor- thi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":"487a1bbf-774e-419b-8018-29d47a8a00a1","year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.589237Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:9bb517ba60ab463b0eacf0b5bff614fefa92479785918356260294fafdc9c412","observation_id":"84acb3fe-1c1f-4021-9b55-da674452dbdf","resolution":{"observed_at":"2026-08-16T10:15:51.062980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.042215Z","title":"Moviechat: From dense token to sparse memory for long video under- standing","venue":null,"work_id":"1597803d-5183-4970-940d-d53a08ef0ae4","year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.593711Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:5d86b87296aee64f9dfb03c4aa5514095f808424b9d15733cb54c175623c6b7a","observation_id":"2c8a76bc-621d-4092-acb6-e445bb50f265","resolution":{"observed_at":"2026-08-16T10:15:51.047294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.025217Z","title":"Videoagent: Long-form video un- derstanding with large language model as agent","venue":null,"work_id":"17a7c070-e5bb-47fa-8014-2377bb404230","year":null},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.598329Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:ff144f73fb4788bb390c7dec1a24c0e33af6bfcd673ddabf6889af8782c5164d","observation_id":"7a3f4cf5-44cc-4270-b6f8-d474997add27","resolution":{"observed_at":"2026-08-16T10:15:51.030965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:51.009540Z","title":"Tarsier: Recipes for training and evaluating large video description models, 2024","venue":null,"work_id":"b5172ca5-e57c-4a04-97ef-c4f52c86d089","year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.603064Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:5ab1cae88fba570625b5fa6e4350f662bcffb1fe17d5d78a849419e8b9b47183","observation_id":"a3c7cb4f-0f8f-4371-84f3-041ca0843897","resolution":{"observed_at":"2026-08-16T10:15:51.014535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-08-16T14:09:21.368307Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-16T10:15:50.607489Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.607489Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:aa6e1153ed22336f5bca8d8f44535f5415ebf8105559ee7064cf53e2491453d8","observation_id":"bce10fed-84dc-4364-9e42-6b80d4908e68","resolution":{"observed_at":"2026-08-16T10:15:50.607489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-16T10:15:50.612744Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.612744Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:6a6f10c2ea3f8b6352c6cde96c7fe5abbf27421d6fe51c49238611656d19563a","observation_id":"08c727bb-4fa1-4e23-83e3-4214c8c997a3","resolution":{"observed_at":"2026-08-16T10:15:50.612744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:50.991631Z","title":"Lifelongmem- ory: Leveraging llms for answering queries in long-form egocentric videos","venue":null,"work_id":"be68a0ba-a05e-433a-8528-68603e38ad87","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.617432Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:4bcf172eb31f686c4e535ac1fca674413b8babfd5db4b4133b8827814d609407","observation_id":"89ee353c-6709-4e50-adad-69c4ec3deb23","resolution":{"observed_at":"2026-08-16T10:15:50.997159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-17T21:35:27.995630Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-16T10:15:50.621828Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.621828Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:9fdc6e236e18802a91a1bc62bb3016926796387e9fde5a500df8cc91a9c1cc03","observation_id":"35c81d8f-7884-47de-9fd4-8725fa37067a","resolution":{"observed_at":"2026-08-16T10:15:50.621828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:50.974619Z","title":"NExT-QA: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"5684c4ce-2c85-48fb-9113-70130e3a0343","year":2021},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.627092Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:17acede4a2161ea1a48df1b1587958ff1913126fae7e26a99a6dae98acb119fa","observation_id":"e6caa70b-ae80-4def-aee5-4b9b0d1a4316","resolution":{"observed_at":"2026-08-16T10:15:50.979557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-16T10:15:50.632416Z","title":"mplug-owl: Modularization empowers large language models with mul- timodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.632416Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:8054fb699a05cf2eb43f6058a8e482cca44a0fe31c7618185f078a576366897b","observation_id":"058e9ed9-55b4-4611-9aa0-7e1994c72b8a","resolution":{"observed_at":"2026-08-16T10:15:50.632416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:50.958808Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"e55460b6-aaf7-44b8-9603-2a5ce52578d1","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.637968Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:334f09c7cf769f81b9ac89efce765cd4b9f609aa94535153992a758a570e3f2b","observation_id":"5040b133-e85b-4888-86ab-2128b412cfc9","resolution":{"observed_at":"2026-08-16T10:15:50.963748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:50.942351Z","title":"A simple llm framework for long-range video question-answering","venue":null,"work_id":"cc3a733d-5b5b-4286-8f84-5e0da9c42ea5","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.642750Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:1fe1e2bdfa9ec8a5cc90482329d68bb2a4eff591b476b01a8d0ec6c2fe1e904e","observation_id":"0e88c148-a2b3-47b4-a6da-388ddad66e52","resolution":{"observed_at":"2026-08-16T10:15:50.947691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:50.924501Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"30fa8bfe-e41c-4c94-810d-f1167282f597","year":2023},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.647211Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:010fe6e50958ac1d3fbe3894995a55c51171d0b2efa944c433817c335772ce5c","observation_id":"09e99bca-4720-465d-9119-c997c76926be","resolution":{"observed_at":"2026-08-16T10:15:50.930519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:15:50.907754Z","title":"Hcqa @ ego4d egoschema challenge 2024, 2024","venue":null,"work_id":"dd8d641f-c3d3-482f-97b9-09d29261305a","year":2024},"citing_paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:15:50.652098Z"},"links":{"citing_paper":"/paper/2504.20091"},"observation_digest":"sha256:b0d41f13358ca9d5e977bb7d06684bdadec4881cd81bd3b331f792ce19806c04","observation_id":"ac40e92a-6de6-4aa7-bede-adcf353767c4","resolution":{"observed_at":"2026-08-16T10:15:50.913525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.20091","last_updated":"2025-04-30T03:42:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:08:53.505195Z","submitted_at":"2025-04-25T22:08:09Z","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 6 inbound Pith citation observations for arXiv:2504.20091."}