{"as_of":"2026-08-17T22:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f093cc8633f9fb7a655e389ab9dfa8874bee7e9cfbe6272b70baf059801b71a5","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:00:53.893326Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:29:12.184772Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T12:48:11.224098Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18071","snapshot_observed_at":"2026-08-05T20:29:12.184772Z","title":"Dang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-13T23:10:52.614750Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":299,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:12.184772Z"},"links":{"cited_paper":"/paper/2506.18071","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:2fce0defa60989c1f9f493238312ba2e5f05069ea1e3d364989a3553b19d1810","observation_id":"d43ad810-ce2b-4674-9050-c89d21b9c3d3","resolution":{"observed_at":"2026-08-05T20:29:12.184772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"cited_work":{"arxiv_id":"2506.18071","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18071","snapshot_observed_at":"2026-08-05T12:48:11.224098Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","venue":"cs.CV","work_id":"44b59e31-11ee-4fa3-90be-1a078e340392","year":2025},"citing_paper":{"arxiv_id":"2608.03779","last_updated":"2026-08-04T15:01:59Z","snapshot_observed_at":"2026-08-14T19:33:22.196222Z","submitted_at":"2026-08-04T15:01:59Z","title":"AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T12:48:10.950796Z"},"links":{"cited_paper":"/paper/2506.18071","citing_paper":"/paper/2608.03779"},"observation_digest":"sha256:b56a965787dc7348bf2e0d524ae6b245210c0d12d456c4924f747955d00f1b4d","observation_id":"f805b6e5-edd3-4b9e-bb4f-aad1b3ec0003","resolution":{"observed_at":"2026-08-05T12:48:11.229386Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18071/citation-record","integrity":"/paper/2506.18071/integrity","json":"/paper/2506.18071/citation-record.json","paper":"/paper/2506.18071"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2206.03428","last_updated":"2022-06-07T16:28:30Z","snapshot_observed_at":"2026-08-16T16:54:41.012342Z","submitted_at":"2022-06-07T16:28:30Z","title":"Revealing Single Frame Bias for Video-and-Language Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03428","snapshot_observed_at":"2026-08-15T19:00:53.580027Z","title":"Revealing single frame bias for video-and-language learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.580027Z"},"links":{"cited_paper":"/paper/2206.03428","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:3776a0e35db427cea35e7a40b19ef85ca86b728170a03f54836ac757bb9fd2d1","observation_id":"942b5cc6-c1e0-4267-903d-465920c8a26b","resolution":{"observed_at":"2026-08-15T19:00:53.580027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T19:00:53.586090Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.586090Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:2fadcf09f77702292ed098a0258c93c3b5d116eb51a89edd8a30f18358148759","observation_id":"4371d76a-03a6-4234-86ec-cb89e8140eee","resolution":{"observed_at":"2026-08-15T19:00:53.586090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.11544","last_updated":"2022-11-02T09:00:33Z","snapshot_observed_at":"2026-08-16T17:04:50.963176Z","submitted_at":"2022-04-25T10:42:07Z","title":"Rethinking Multi-Modal Alignment in Video Question Answering from Feature and Sample Perspectives","version":2},"cited_work":{"arxiv_id":"2204.11544","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.11544","snapshot_observed_at":"2026-08-06T23:29:32.707594Z","title":"Rethinking Multi-Modal Alignment in Video Question Answering from Feature and Sample Perspectives","venue":"cs.CV","work_id":"b839b79c-651d-451f-8d20-3cc9f7a9f0f2","year":2022},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.591633Z"},"links":{"cited_paper":"/paper/2204.11544","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:5be90463919246cff5e59589321437a39eb5e1898d332d78b572cfc20ff792fc","observation_id":"49e78f3d-95ca-403d-98ea-5f93fb05274a","resolution":{"observed_at":"2026-08-06T23:29:32.849926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.243637Z","title":"Can I trust your answer? Visually grounded video question answering,","venue":null,"work_id":"b2a9c006-e252-4a79-889e-c3b1e5a228ff","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.597435Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:f2007023b0f2bb9c9c3b0cb2715002ca36db7c64a9f80c2c6de885bf0068d380","observation_id":"bf141f48-2def-40b8-ab0c-419cec439151","resolution":{"observed_at":"2026-08-15T19:00:55.248445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-08-14T18:32:30.931998Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-15T19:00:53.602487Z","title":"Tvqa: Localized, compositional video question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.602487Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:1e5cb0cb99755f438483bba6f08ee4fd6dbad3830c0bdfb6600e99c76a39f1a9","observation_id":"0fce756f-5b13-4b99-8dab-6464bc2e4262","resolution":{"observed_at":"2026-08-15T19:00:53.602487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.227852Z","title":"Zero-shot video question answering via frozen bidirectional language models,","venue":null,"work_id":"2ae22e7a-8b8a-4846-b25c-7be692d57274","year":2022},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.607566Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:f9fe4bee5dd821b01d4445ccd5d4a0100f4050bb4405cfb0558f986518b13bf5","observation_id":"0a142e82-9404-4b2c-8701-4934220fbc1e","resolution":{"observed_at":"2026-08-15T19:00:55.233212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17510","last_updated":"2024-07-31T21:02:12Z","snapshot_observed_at":"2026-08-16T14:14:54.607793Z","submitted_at":"2024-02-27T13:50:34Z","title":"Demonstrating and Reducing Shortcuts in Vision-Language Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17510","snapshot_observed_at":"2026-08-15T19:00:53.613167Z","title":"Demonstrating and reducing shortcuts in vision-language representation learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.613167Z"},"links":{"cited_paper":"/paper/2402.17510","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:c8b4330c39d6752b49626c801f9a0ee736e14957460c93a56c9cb5d9092a13c4","observation_id":"2ad3b221-e083-4d99-8ef1-4e2d65c5a961","resolution":{"observed_at":"2026-08-15T19:00:53.613167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04388","last_updated":"2025-05-16T08:24:31Z","snapshot_observed_at":"2026-08-16T13:20:42.130409Z","submitted_at":"2024-09-06T16:27:52Z","title":"Question-Answering Dense Video Events","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04388","snapshot_observed_at":"2026-08-15T19:00:53.618558Z","title":"Question-Answering Dense Video Events,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.618558Z"},"links":{"cited_paper":"/paper/2409.04388","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:75719579e503bfd24ab9b65a9232d4e76fd5ab2a229b73849f4c4026975bb82e","observation_id":"34393161-975c-44b4-a476-336271239f40","resolution":{"observed_at":"2026-08-15T19:00:53.618558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.183451Z","title":"Grounding action descrip- tions in videos,","venue":null,"work_id":"292a655a-5bdf-424d-8fa3-5ccae80ee1cd","year":2013},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.623593Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:4677b339f7d4536e3e3f7958a664cc28c4e48b5ea24404ed06e459bb788b4dde","observation_id":"490d0bf9-db27-4924-9463-5b39c8645118","resolution":{"observed_at":"2026-08-15T19:00:55.188067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09609","last_updated":"2021-11-29T18:35:51Z","snapshot_observed_at":"2026-08-16T18:08:44.225996Z","submitted_at":"2021-07-20T16:42:58Z","title":"QVHighlights: Detecting Moments and Highlights in Videos via Natural Language Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09609","snapshot_observed_at":"2026-08-15T19:00:53.628143Z","title":"Qvhighlights: Detecting moments and highlights in videos via natural language queries.(2021),","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.628143Z"},"links":{"cited_paper":"/paper/2107.09609","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:45ce39241006650723c0377ba089bdbcfd69f3cd22909665a2e877b7af0b4d70","observation_id":"66f1ab7a-3e27-4924-a21c-034eb1d2399d","resolution":{"observed_at":"2026-08-15T19:00:53.628143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.167718Z","title":"Videoagent: Long-form video understanding with large language model as agent,","venue":null,"work_id":"6fd384b6-2b0f-4758-b663-1e117f247524","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.633884Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:ce3c5863cb644e5371e27b7148ccc11a8522b0d66ca6cf3405753b6ecd48494d","observation_id":"486cf951-d285-4c6e-b262-02403b9c0613","resolution":{"observed_at":"2026-08-15T19:00:55.173111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.151026Z","title":"Morevqa: Exploring modular reason- ing models for video question answering,","venue":null,"work_id":"5d62e74c-7ac3-4b0f-b9c2-ed7b644c242b","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.638742Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:db44846f378d9409f797032447e3f2efdcdeda2586ef7b08918c99203e687d11","observation_id":"4275111b-f150-48d2-b68e-a4e5ff29c538","resolution":{"observed_at":"2026-08-15T19:00:55.157058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.134016Z","title":"Videoagent: A memory-augmented multimodal agent for video understanding,","venue":null,"work_id":"84b3145a-522f-4262-b12c-301b5c50350c","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.643743Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:2d77235aeb7377bbfa01ad03dd7ccd127badf752b547675c0125cb3876bcf566","observation_id":"7ca7c569-43f1-4401-8869-754d63aac396","resolution":{"observed_at":"2026-08-15T19:00:55.138961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:53.648253Z","title":"Retrieval-based video language model for efficient long video question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.648253Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:3999ad53995c54fe4f44e6f979335ad72fee39dffc7163eb7173045eb38f3b0e","observation_id":"a42b439b-c627-43ab-9266-5bc606dd7ebe","resolution":{"observed_at":"2026-08-15T19:00:53.648253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.117992Z","title":"Hierarchical video-moment retrieval and step-captioning,","venue":null,"work_id":"d274b4fb-c471-44d3-b2fc-2ce8259ce42f","year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.653074Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:ac21080d580cf8c7285d45819a67b0be3b96f6cfcaaa5811124238d48cd72c75","observation_id":"6b0f2aa3-d150-427e-8eb8-043a64b0eab1","resolution":{"observed_at":"2026-08-15T19:00:55.122910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.102104Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering,","venue":null,"work_id":"3bdc15d0-4f38-4d74-91c7-33fda77f175c","year":2017},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.657697Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:75ff974eaf4141a509eea2a903efc7b47d0ac1fb66efa2869a336187f94e35f3","observation_id":"579fb63d-d934-4edd-baad-39d9d9769205","resolution":{"observed_at":"2026-08-15T19:00:55.107800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.086384Z","title":"Video Question Answering via Gradually Refined Attention over Appearance and Motion,","venue":null,"work_id":"1247ee74-51d4-499b-a8eb-ff4f0578c4b7","year":2017},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.662516Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:ca35aafa8af51fd6c32c5e1d406560579589a2a70927727e337bb457c219f8ea","observation_id":"29a55d55-1b52-47d1-ae58-4fe1058fcea3","resolution":{"observed_at":"2026-08-15T19:00:55.091516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.069809Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering,","venue":null,"work_id":"2a1b618e-4e47-41b4-b430-ef0edceeb633","year":2019},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.666947Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:8acd39486bcfd5e306693b502bb519eeb0da1f01f5276fe3a6f4aef39329a865","observation_id":"a50117b2-d411-4d59-b4b3-0321affd932a","resolution":{"observed_at":"2026-08-15T19:00:55.074807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.053284Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions,","venue":null,"work_id":"ef849d25-db5b-4ac1-acf0-4db02846df3e","year":2021},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.672141Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:b2af3cbd1cb79724c80a6359f529121d320570e0025bdbd01bd3f4b5ee8affe2","observation_id":"883e909c-3ab7-4b22-835c-c41a0327fb11","resolution":{"observed_at":"2026-08-15T19:00:55.058415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:53.676692Z","title":"VideoMind: A Chain-of-LoRA Agent for Long Video Reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.676692Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:54c9ac1f564495c34d6c538c9bdd4d1fa006f6fb9c347969368ae1d93ffc92f9","observation_id":"a224856a-f3a5-423a-be12-2c0f7b0bb0ff","resolution":{"observed_at":"2026-08-15T19:00:53.676692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.033267Z","title":"Videoqa in the era of llms: An empirical study,","venue":null,"work_id":"3d53a296-6222-4df0-b220-10a3e43831bf","year":2025},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.681419Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:781d7411c2a610b9a0a645fdc8ad962b78af6cfd259806e5bfb66861d90733f9","observation_id":"10c933d8-c36a-440b-af01-670e17a2033b","resolution":{"observed_at":"2026-08-15T19:00:55.040034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-16T13:12:38.920225Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-15T19:00:53.686027Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.686027Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:d76d3bb3a5d4d1dafd311cb7223c13de69fba807e8dcf08c721c5b6b093cc61c","observation_id":"874431d9-8e44-4c9c-b80f-5fc8a6dcd538","resolution":{"observed_at":"2026-08-15T19:00:53.686027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-17T14:14:30.066593Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-15T19:00:53.690487Z","title":"Cinepile: A long video question answering dataset and benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.690487Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:af9baa8c4b67c50436285bb78e1a23794acbd27fd5be05683a4853710af85066","observation_id":"69c68b6f-8159-423e-891e-37fa0df608fe","resolution":{"observed_at":"2026-08-15T19:00:53.690487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:53.696992Z","title":"The surprising effectiveness of multimodal large language models for video moment retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.696992Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:76ba2a415cd888391a0ed6954070666c19ccfcc4a2192923ce55db565c41653e","observation_id":"ab1b9624-74c4-4b86-a858-ad85889528ba","resolution":{"observed_at":"2026-08-15T19:00:53.696992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09582","last_updated":"2025-01-18T00:52:42Z","snapshot_observed_at":"2026-08-17T06:39:08.796450Z","submitted_at":"2024-12-12T18:54:48Z","title":"Neptune: The Long Orbit to Benchmarking Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09582","snapshot_observed_at":"2026-08-15T19:00:53.701216Z","title":"Neptune: The Long Orbit to Bench- marking Long Video Understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.701216Z"},"links":{"cited_paper":"/paper/2412.09582","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:5d6e33491c2a54c24832c05a863adc06badc7126c9f8f65671c36b17a554125f","observation_id":"befc7197-8c2a-4874-8216-32df8b207f42","resolution":{"observed_at":"2026-08-15T19:00:53.701216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T19:00:53.705612Z","title":"Self-consistency improves chain of thought reasoning in language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.705612Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:fa80596920cc506104a60ad043bc77b6eb711d0708731b320f011dc3374e5081","observation_id":"c6a76298-fcd8-4d55-9888-91c570d78e00","resolution":{"observed_at":"2026-08-15T19:00:53.705612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.017081Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":"1e07d9b6-649a-42c3-b776-528518b108a3","year":2022},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.710534Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:3422154f12afe90b7eb7ce0420b9b0869bf373250b2df2578faeee40fc0e6904","observation_id":"c90003f2-4a8c-4125-a83e-90d3dedde6a5","resolution":{"observed_at":"2026-08-15T19:00:55.022186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:55.001642Z","title":"Tree of thoughts: Deliberate problem solving with large language models,","venue":null,"work_id":"a23e4d85-ff63-4da2-a003-85bd2933e1da","year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.715152Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:d9146faced05367b2f1e6ce1ae5c547f5ffbbd8def4477400f37c4471821545d","observation_id":"0a1ed0f3-7b84-4780-a6fc-9d7abe54ff1e","resolution":{"observed_at":"2026-08-15T19:00:55.006531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00430","last_updated":"2025-01-03T02:50:59Z","snapshot_observed_at":"2026-08-14T04:35:21.122527Z","submitted_at":"2024-12-31T13:11:20Z","title":"Enhancing LLM Reasoning with Multi-Path Collaborative Reactive and Reflection agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00430","snapshot_observed_at":"2026-08-15T19:00:53.720119Z","title":"Enhancing LLM Reasoning with Multi-Path Collaborative Reactive and Reflection agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.720119Z"},"links":{"cited_paper":"/paper/2501.00430","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:879bf9c4571c97e40795e2cfa994cb2c8879a9a621d0b6bc33f76ed9244f50b5","observation_id":"73066226-61b1-409f-9adc-a292341aec1c","resolution":{"observed_at":"2026-08-15T19:00:53.720119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.986446Z","title":"React: Synergizing reasoning and acting in language models,","venue":null,"work_id":"4b9c3819-9023-482f-b4fd-15e1dbd682d7","year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.725282Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:84ffb97c9e5f6d273ef7c43b9b4a4ce578f9e81ab0f0a0f9e9a691d51d40a1c7","observation_id":"b4b2cec0-88c3-43ed-9a78-cbf0295ed019","resolution":{"observed_at":"2026-08-15T19:00:54.991169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.970275Z","title":"Reflexion: Language agents with verbal reinforcement learning,","venue":null,"work_id":"8c13e689-ddf0-4708-8d9c-fbaaa59148b0","year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.730311Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:b94059a41ddb96486ac8b4254c5a3a91cd2ea4ed4dc203cf9e210fe5f90d5aca","observation_id":"691c59fc-a183-447f-9d1b-227cd61f2eac","resolution":{"observed_at":"2026-08-15T19:00:54.975804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11776","last_updated":"2024-06-17T17:33:09Z","snapshot_observed_at":"2026-08-16T13:42:08.899625Z","submitted_at":"2024-06-17T17:33:09Z","title":"Improving Multi-Agent Debate with Sparse Communication Topology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11776","snapshot_observed_at":"2026-08-15T19:00:53.735081Z","title":"Improving multi-agent debate with sparse communication topology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.735081Z"},"links":{"cited_paper":"/paper/2406.11776","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:98d09356d6f45936f35d7f6e530cb2ad2f85c159637f69a59f78fdbc21687dd2","observation_id":"80b74b4e-4832-473f-8d13-9486d172d2ea","resolution":{"observed_at":"2026-08-15T19:00:53.735081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.955239Z","title":"An empirical study of end-to-end video-language transformers with masked visual modeling,","venue":null,"work_id":"c5696112-1c84-4f61-9f26-c292b1d3f141","year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.739820Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:f33a592a7309f6540a91ceefcccac00810e292a09af674fb7d227f8e33f7fe6d","observation_id":"e36baa93-5abf-457d-94bc-0bb89a440846","resolution":{"observed_at":"2026-08-15T19:00:54.960413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14622","last_updated":"2024-12-20T15:06:14Z","snapshot_observed_at":"2026-08-16T14:07:34.498797Z","submitted_at":"2024-03-21T17:59:35Z","title":"Language Repository for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14622","snapshot_observed_at":"2026-08-15T19:00:53.744283Z","title":"Lan- guage repository for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.744283Z"},"links":{"cited_paper":"/paper/2403.14622","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:9300775de50a7d9e408e62d302dc62d29b60da674b7adb0bd9c5d9af44b0a208","observation_id":"0731a994-2002-4fc0-9026-e61e684b35e5","resolution":{"observed_at":"2026-08-15T19:00:53.744283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.940420Z","title":"Streaming long video understanding with large language models,","venue":null,"work_id":"39330d91-a048-4f45-bbbf-d635f7794188","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.749453Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:0a7387811e3c398d3dda035340b74f97623c872d801439a5d54a9e4241fa1b82","observation_id":"37c4d89a-2e30-4d24-ac7c-c243654f4fca","resolution":{"observed_at":"2026-08-15T19:00:54.945221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17235","last_updated":"2024-10-10T05:17:00Z","snapshot_observed_at":"2026-08-16T14:31:04.705062Z","submitted_at":"2023-12-28T18:58:01Z","title":"A Simple LLM Framework for Long-Range Video Question-Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17235","snapshot_observed_at":"2026-08-15T19:00:53.754001Z","title":"A simple LLM framework for long-range video question-answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.754001Z"},"links":{"cited_paper":"/paper/2312.17235","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:68593757b832d85da7bf06e6f4a81bd120adb4d9348166bfe1ababe75a13f119","observation_id":"0cd89e7c-11c0-45cd-8bc6-4f53a320ddf1","resolution":{"observed_at":"2026-08-15T19:00:53.754001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-17T03:13:20.368954Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-15T19:00:53.758638Z","title":"Hawkeye: Training video-text LLMs for grounding text in videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.758638Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:b87c91dd74cecd352fe28c766f9229ebfcc18afae11593a5be12eb20c5010d99","observation_id":"b27e939a-30d3-47d2-b4aa-8417e26ffd4b","resolution":{"observed_at":"2026-08-15T19:00:53.758638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-13T13:43:26.165297Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-08-15T19:00:53.763494Z","title":"Task preference optimization: Improving multimodal large language models with vision task alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.763494Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:4a671eca8ea5bff89099e4792f6b1a605a2b2210ad16b3327d73af67490d2680","observation_id":"14bcbbf9-5db4-4c97-b06d-1947d947e93e","resolution":{"observed_at":"2026-08-15T19:00:53.763494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.923906Z","title":"TVR: A large-scale dataset for video-subtitle moment retrieval,","venue":null,"work_id":"2c93d7fb-9231-4896-ac5f-93163875081f","year":2020},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.768041Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:f7f737793fd08bddef9ea91dde0f5d2330bd887707f5ccc06154bb644cd37a4a","observation_id":"4fe0df4f-7736-4f3a-8c85-8fe84cf4168c","resolution":{"observed_at":"2026-08-15T19:00:54.929247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.907818Z","title":"UMT: Unified multi-modal transformers for joint video moment retrieval and highlight detection,","venue":null,"work_id":"6a7510af-a679-47f5-91fd-6b9a9e7d257f","year":2022},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.772748Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:22b6c80795c1acd6980b9902f6ad97c868ffcbf57b16805fe4a523be2f0f1d26","observation_id":"910ce7cb-ed85-437d-8b31-3a40b512272f","resolution":{"observed_at":"2026-08-15T19:00:54.914079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.891151Z","title":"MomentDiff: Generative video moment retrieval from random to real,","venue":null,"work_id":"403d5f5f-d721-43dc-86da-72fcfe6686d3","year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.777175Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:c60ec8765e746a2fbad41a9962aba98115aa5cf15ad4bf0e85db7e9a2c2664f1","observation_id":"2374e396-d699-4e0f-af41-dd23b32cb7b4","resolution":{"observed_at":"2026-08-15T19:00:54.896056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.871424Z","title":"Query-dependent video representation for moment retrieval and highlight detection,","venue":null,"work_id":"9b88f965-9f19-423e-a09f-ca6f0ac00dd8","year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.782460Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:a7f6e802f17960bad3b5e940b8090cc097e688945f59aedb38ad4e0140e93a5e","observation_id":"ded4ff59-0737-408c-bec3-9f2ffcb38396","resolution":{"observed_at":"2026-08-15T19:00:54.876372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.855533Z","title":"UnivTG: Towards unified video- language temporal grounding,","venue":null,"work_id":"8aa1a67e-e326-4ad4-94a5-dd7a2d9dd7c1","year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.787534Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:e256f80fc7e6ef9e6fb0f7a92b197b6083ef44be3d3c941fb160a8a2019c8b0d","observation_id":"98945433-9869-4053-b1fd-5ad38e202e5f","resolution":{"observed_at":"2026-08-15T19:00:54.860298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.839192Z","title":"R2-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding,","venue":null,"work_id":"58e9cdb7-3a8b-4393-87a7-f42f0eb41f3d","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.791921Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:c8978b24582ab8045be6a60434f0e390038e8f9d2fa181569449ea494bbb2a34","observation_id":"7d622ec3-cbfb-4999-8861-bdd96a132ab1","resolution":{"observed_at":"2026-08-15T19:00:54.845143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.821696Z","title":"Learning 2D temporal adjacent networks for moment localization with natural language,","venue":null,"work_id":"05b6ea15-e98e-4387-98b1-41c3b38d4911","year":2020},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.796584Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:280f8267fa7c18ec77288886ca856dddede351cfafc78467c77696b722b1d1ac","observation_id":"a3b1b74d-b7c2-4d27-8c98-d3915b8a67fa","resolution":{"observed_at":"2026-08-15T19:00:54.827568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13931","last_updated":"2020-06-14T08:49:07Z","snapshot_observed_at":"2026-08-13T01:07:23.856467Z","submitted_at":"2020-04-29T02:47:04Z","title":"Span-based Localizing Network for Natural Language Video Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13931","snapshot_observed_at":"2026-08-15T19:00:53.801367Z","title":"Span-based localizing network for natural language video localization,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.801367Z"},"links":{"cited_paper":"/paper/2004.13931","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:3dcee32a26b4d22d7ecf38589e0f0ebe92f9d29ed3e3f634a9f40ccb4d8b6522","observation_id":"8fa31332-25ce-4b36-930f-88143aa3d190","resolution":{"observed_at":"2026-08-15T19:00:53.801367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.804982Z","title":"Dense- captioning events in videos,","venue":null,"work_id":"8880393b-3709-46cd-b738-76fa61ee2fbb","year":2017},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.806272Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:5d9aeda6c84b0bcb3064469ddfa5712a7e7c02b33e66a48591416bf6af423a75","observation_id":"9753c3ad-6f30-43bc-91bc-1c2a6873d5ff","resolution":{"observed_at":"2026-08-15T19:00:54.810505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.787926Z","title":"Negative sample matters: A renaissance of metric learning for temporal grounding,","venue":null,"work_id":"1e5919d4-d22c-485d-a0d0-8953dfe3246a","year":2022},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.811120Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:d303bd7679c8128878284301889fc81fdaa60dde48995d59b0aaed7d01f99062","observation_id":"f972f6ef-90ea-4ee1-aaea-583067b4cf6f","resolution":{"observed_at":"2026-08-15T19:00:54.793195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.769965Z","title":"Towards generalisable video moment retrieval: Visual-dynamic injection to image-text pre-training,","venue":null,"work_id":"e016c296-fc43-4002-854c-190a72daa094","year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.815679Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:5711b2e2cfe042f0ad27fff9ce84f502fad08e27e63503ea4608efdb53575a69","observation_id":"6bc3d9d4-aae2-4a43-94a2-edeae21d62ae","resolution":{"observed_at":"2026-08-15T19:00:54.776043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-15T19:00:53.820562Z","title":"VideoChat: Chat-centric video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.820562Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:fc6d40fd8e339cb5c2e3b33283388813349754fc0f2b0a04bcb092fe8731cfd9","observation_id":"cc5d28cb-ac01-4903-b3b0-4cb656dca795","resolution":{"observed_at":"2026-08-15T19:00:53.820562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-15T19:00:53.825598Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.825598Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:fbc0f33e09915d35295bfa16fa9208ce053132c39b239227d4460b77d484c174","observation_id":"8d4d5ceb-99c8-4215-9611-00b53748ee86","resolution":{"observed_at":"2026-08-15T19:00:53.825598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-15T19:00:53.830018Z","title":"Video- ChatGPT: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.830018Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:4c05bf2b4b61305efecfae063a18ce37f3c481612e1937cdb23e5f72bdae8089","observation_id":"aaa9ef30-e5fc-4914-88d2-77452ecc3a11","resolution":{"observed_at":"2026-08-15T19:00:53.830018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-16T15:24:32.944943Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-15T19:00:53.834507Z","title":"V ALLEY: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.834507Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:6ee8e1bcdb6fadb6ee96c9f9308836b1d478c1772efc37ccd2baf6ab38dceecb","observation_id":"cf23a219-89bd-4daf-9ae1-0fcb6e0aa809","resolution":{"observed_at":"2026-08-15T19:00:53.834507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.750586Z","title":"ChatVTG: Video temporal grounding via chat with video dialogue large language models,","venue":null,"work_id":"d0295cb2-3f01-4a64-959b-e2d19a5360a4","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.838938Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:da9a3e3106df493a189f6e20ebe371cddc79ee093e7c446de2f8105fb53646b0","observation_id":"0cf37d3a-1bec-4b1b-b90a-134b86d2267c","resolution":{"observed_at":"2026-08-15T19:00:54.756324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-16T14:17:41.002456Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-15T19:00:53.843205Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.843205Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:5ef84104966f52e49facb8dfff0d019e8b873caeba45a57d6d11a56aab743400","observation_id":"8be569d4-d419-4088-9988-07dad5799294","resolution":{"observed_at":"2026-08-15T19:00:53.843205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.733460Z","title":"ET Bench: Towards open-ended event-level video-language understanding,","venue":null,"work_id":"a61290fe-294e-4289-b9f5-5fc5f21f046f","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.847643Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:0bdfb099f409af1ec47f0b0d4c53713b7d954cf8b0eeda1cee56d1c57da92c29","observation_id":"279424c7-390e-4244-a812-fa0606c0b5b0","resolution":{"observed_at":"2026-08-15T19:00:54.738634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.714044Z","title":"LITA: Language instructed temporal-localization assistant,","venue":null,"work_id":"cf7cf8db-b601-4f96-bf29-aa78051d5997","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.852202Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:894256192763fe13cbdb62f2fdd073b6822fe97c5827a323ccd1ed4fe990c58e","observation_id":"6032c6eb-f3bc-41de-8e72-97f1af116b77","resolution":{"observed_at":"2026-08-15T19:00:54.721063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.697068Z","title":"RexTime: A benchmark suite for reasoning- across-time in videos,","venue":null,"work_id":"8b6a63ed-3965-45a7-8098-172bc6e15e44","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.856811Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:08a9535feb58928a1803b0bc8889678afcdf989c26acb322f2a5b4c0c60d0daa","observation_id":"6fa56daa-10e0-4b4e-b521-292f6c61a455","resolution":{"observed_at":"2026-08-15T19:00:54.702056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:54.678338Z","title":"VTimeLLM: Empower LLM to grasp video moments,","venue":null,"work_id":"d3ddf18a-2acf-48c4-a715-1222e633348f","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.861293Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:f0bdd7b049974b825172713bfe495ca2ca98d60cc12dcdc76f73ccd138e74022","observation_id":"a62dc9f2-9263-44d4-a011-a31ae332ecd6","resolution":{"observed_at":"2026-08-15T19:00:54.685218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:29:33.609457Z","title":"TimeChat: A time-sensitive mul- timodal large language model for long video understanding,","venue":null,"work_id":"f5bf580f-a654-4dee-9907-6908d6a8f197","year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.865550Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:b09d33d5dbb37d34053cf1144b3d53075a5f5da9669d912ef832eff9e15421bf","observation_id":"cdb0f847-a985-4c2b-9961-23bfd09a57a2","resolution":{"observed_at":"2026-08-06T23:29:33.770677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:29:33.347698Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"53bf351d-351f-4e35-a04d-75ee36c95223","year":2022},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.870517Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:20fe1a078f665c15c03faa38e407b28cf856c6e6768c7515216b3acd8bccc527","observation_id":"3d1c0ed6-f37d-4e71-a1b4-b9afbcb2cd9d","resolution":{"observed_at":"2026-08-06T23:29:33.429952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:29:33.029591Z","title":"Self-chained image-language model for video localization and question answering,","venue":null,"work_id":"1265c3dc-7c1f-4354-b230-9a6deecb87ec","year":2023},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.874850Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:c96593f03b79df59b99cbc81e71a8a014a9b92ccfd3a680684dd74a9badd6e0b","observation_id":"cc93a4c8-9b42-4e89-abc0-2e71454545d3","resolution":{"observed_at":"2026-08-06T23:29:33.179156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T19:00:53.879350Z","title":"GPT-4o System Card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.879350Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:097857708c6cfd36c9d1db8ff49dce0503cbc145159805a32eb536e4879c6da4","observation_id":"478cef9a-fc6c-433b-b6e2-ab7fe14ac6f3","resolution":{"observed_at":"2026-08-15T19:00:53.879350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00849","last_updated":"2024-01-01T18:58:42Z","snapshot_observed_at":"2026-08-16T14:30:26.924804Z","submitted_at":"2024-01-01T18:58:42Z","title":"COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00849","snapshot_observed_at":"2026-08-15T19:00:53.883615Z","title":"Cosmo: Contrastive streamlined multimodal model with interleaved pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.883615Z"},"links":{"cited_paper":"/paper/2401.00849","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:76191e261defa764ab68c802195c25b882d0fc5c8749d0b1b1f7a8ad9dd6a29e","observation_id":"c0116188-38b5-4aea-b3ea-07233c71b8ed","resolution":{"observed_at":"2026-08-15T19:00:53.883615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-14T19:57:36.845039Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24718","snapshot_observed_at":"2026-08-15T19:00:53.888143Z","title":"Reinforcing video reasoning with focused thinking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.888143Z"},"links":{"cited_paper":"/paper/2505.24718","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:8f751e8de755266413873117dcdc322bf4f34dc8b04dc12155b0f07e6ca1154d","observation_id":"f5846c80-5fad-47c0-a4f5-ee604d4987cf","resolution":{"observed_at":"2026-08-15T19:00:53.888143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:00:53.893326Z","title":"SynPO: Synergizing descriptiveness and preference optimization for video detailed captioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:53.893326Z"},"links":{"citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:6a26981dd02f5c1b0a62149415d3c2129e5eb9aaf300630fde5f2cc5c4466962","observation_id":"4d294098-dead-4bd6-b080-4485f8f9914d","resolution":{"observed_at":"2026-08-15T19:00:53.893326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:53:06.234079Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2506.18071."}