{"as_of":"2026-08-18T23:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30517644a85aa0d56408073e4947731dbd03fa17cfc76a00b25552b055e1936a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:43:17.642133Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:48:39.311466Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-16T10:43:17.642133Z","title":"Frame-voyager: Learn- ing to query frames for video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17447","last_updated":"2025-04-24T11:19:18Z","snapshot_observed_at":"2026-08-17T05:13:46.552289Z","submitted_at":"2025-04-24T11:19:18Z","title":"FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:43:17.642133Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2504.17447"},"observation_digest":"sha256:a3161e760d57246663a5eadf3a37d8251d4a3e767db84c02b672f3e43624d851","observation_id":"a1c67c44-1506-41e7-bf7e-73884a4d6389","resolution":{"observed_at":"2026-08-16T10:43:17.642133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-07T15:20:59.359347Z","title":"Frame-voyager: Learning to query frames for video large language models.arXiv preprint arXiv:2410.03226, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-14T13:01:23.064925Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.359347Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:1c282aa35421f004bed160600d4a93d169ef08d1e3553012e019feedb51caaef","observation_id":"7a6ad6ee-18f4-468e-92b1-152590b8d05f","resolution":{"observed_at":"2026-08-07T15:20:59.359347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-06T23:49:48.564539Z","title":"arXiv preprint arXiv:2410.03226 (2024) 6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16112","last_updated":"2026-07-11T03:45:43Z","snapshot_observed_at":"2026-08-17T01:26:20.913190Z","submitted_at":"2025-06-19T08:02:53Z","title":"AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:48.564539Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2506.16112"},"observation_digest":"sha256:356f014b6de9c9bc6813158496681154a8138a87d189062ec1172ceea266df58","observation_id":"9e52b349-53d8-4935-9c12-82ce955bb5a3","resolution":{"observed_at":"2026-08-06T23:49:48.564539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2604.05546","last_updated":"2026-04-14T01:04:46Z","snapshot_observed_at":"2026-08-15T05:20:03.302508Z","submitted_at":"2026-04-07T07:44:11Z","title":"Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:54:04.104227Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2604.05546"},"observation_digest":"sha256:0637b3499bdf92a94732ceb0ebabb8cf35cfe780ead277de041081b46c8774c7","observation_id":"9d9bea43-a372-45d6-b384-315d1127dfa2","resolution":{"observed_at":"2026-05-10T23:45:50.900812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-13T14:22:51.440674Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:43b957d2a3d3db493913d78d0269765dd16fa27df713a622d98f9cb470008fa2","observation_id":"06bb0f4f-f16a-48d2-9ff6-5bc1390fabbc","resolution":{"observed_at":"2026-05-10T06:56:47.793873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2604.17422","last_updated":"2026-04-19T13:04:18Z","snapshot_observed_at":"2026-08-13T20:16:42.635679Z","submitted_at":"2026-04-19T13:04:18Z","title":"Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T06:05:42.693414Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2604.17422"},"observation_digest":"sha256:7835f5d10513b64069c6acc2a040064568683c01a9cf10cf3e11e977582a863c","observation_id":"4aa6b946-fcc9-4bb5-b2c2-e00affac752a","resolution":{"observed_at":"2026-05-10T06:06:18.453570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.00444","last_updated":"2026-05-01T06:24:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:24:40Z","title":"Scaling Video Understanding via Compact Latent Multi-Agent Collaboration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T20:11:11.410051Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.00444"},"observation_digest":"sha256:9a1fbd2ffe92f3db5e08b48cea34c773b642536ddd31a979fbaf01485e21b569","observation_id":"43a3f401-4615-432e-9084-fb3c277ef531","resolution":{"observed_at":"2026-05-11T15:21:09.372447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-17T18:28:31.952547Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:06:09.753634Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:c77524d4c7cbcb08875fa9daa78fc14b9e661260e219a35931ed0badf699c1ed","observation_id":"3f272805-1538-4152-a8ea-e4246272ed3a","resolution":{"observed_at":"2026-05-12T03:06:18.732601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-17T18:28:31.952547Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T22:47:19.742035Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:2f87ad5fd0d90771410c67517986aec9c7da4865a282608620305b133874a219","observation_id":"a0b484d7-b770-47d4-b6b8-6108417516d6","resolution":{"observed_at":"2026-07-01T13:45:46.067925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-03T00:18:47.184473Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-17T18:28:31.952547Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T00:18:47.184473Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:91deb7152362df3842ee0b8f7a754ca34bce34ccca71bc15a8dc63faacfc9266","observation_id":"259f1a6a-af71-450b-ae9d-8f161d098566","resolution":{"observed_at":"2026-08-03T00:18:47.184473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.09874","last_updated":"2026-05-11T01:59:59Z","snapshot_observed_at":"2026-08-11T17:21:30.246380Z","submitted_at":"2026-05-11T01:59:59Z","title":"EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-12T04:37:46.090777Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.09874"},"observation_digest":"sha256:1ca5a94374c914aa954a189afb4766290ab8b6b057c22913e51c5ab3c575bd55","observation_id":"6164b0f7-2f0c-485d-b498-4bde4d7aac52","resolution":{"observed_at":"2026-05-12T06:06:24.666927Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.10762","last_updated":"2026-05-11T15:57:46Z","snapshot_observed_at":"2026-08-12T20:32:51.175035Z","submitted_at":"2026-05-11T15:57:46Z","title":"GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T03:46:31.117768Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.10762"},"observation_digest":"sha256:136e4bba10d13fdbec35500985ec0962e7a400dc46e0b5a7f9c37bcccf9df4c3","observation_id":"3bee2c53-0ed7-4dba-887f-b6d0f707c14d","resolution":{"observed_at":"2026-05-12T06:56:31.888199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.22678","last_updated":"2026-05-21T16:20:31Z","snapshot_observed_at":"2026-08-16T13:54:15.621351Z","submitted_at":"2026-05-21T16:20:31Z","title":"Swift Sampling: Selecting Temporal Surprises via Taylor Series","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T05:55:23.479344Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.22678"},"observation_digest":"sha256:b543b33f666e8a458e139e14985dd86f3f388016d32cdb408f69f9d4602fe8be","observation_id":"5c6ae177-15a2-4474-b644-ec505447ea3f","resolution":{"observed_at":"2026-05-22T05:56:07.987176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-12T15:34:37.002001Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T15:34:37.002001Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:4ca794dd81e4adb1900c8d9f01515560a4715f675a85b0848c66d23b83d69249","observation_id":"32192981-6306-4a94-8f07-ba3494ad48c6","resolution":{"observed_at":"2026-07-12T15:34:37.002001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-14T18:39:24.915547Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T18:39:24.915547Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:a845d42d522f4af305e0fe0408ceb37e0cbce990b67b5fc93a2c4b8e6ca19dc9","observation_id":"7c5854a6-82cb-4e11-a9c3-16149366b5b3","resolution":{"observed_at":"2026-07-14T18:39:24.915547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2605.31029","last_updated":"2026-05-29T09:01:56Z","snapshot_observed_at":"2026-07-06T23:40:12.939143Z","submitted_at":"2026-05-29T09:01:56Z","title":"PEEK: Picking Essential frames via Efficient Knowledge distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T22:46:53.704892Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2605.31029"},"observation_digest":"sha256:1718a506e9d667757539ec8e07722f928926982b697cadf4499c3d0620e68a36","observation_id":"63b209a2-1207-4cd3-8edd-d2c2329d48ee","resolution":{"observed_at":"2026-07-01T19:16:01.323446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":"2410.03226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-07-03T16:48:39.311466Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"51713dfe-618e-428f-9bb3-977fea81bba9","year":2024},"citing_paper":{"arxiv_id":"2607.01737","last_updated":"2026-07-02T05:46:42Z","snapshot_observed_at":"2026-08-06T03:19:52.093893Z","submitted_at":"2026-07-02T05:46:42Z","title":"ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-03T16:45:20.139230Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.01737"},"observation_digest":"sha256:952843f44810fdee6dbdad1ba30c681a873bf2c6750be98973f3ff74fb736668","observation_id":"c65816b4-fe99-4de6-9260-bc06b7cd04ec","resolution":{"observed_at":"2026-07-03T16:48:39.312873Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-01T22:38:43.297703Z","title":"arXiv preprint arXiv:2410.03226 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-15T02:51:45.155150Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.297703Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:28afa7f3da20d2c418dc7c0449b8d9e5f37c4ccc8220cda345dde5f10ebce3c8","observation_id":"732a5076-6ed2-4016-b11f-da781c3c7154","resolution":{"observed_at":"2026-08-01T22:38:43.297703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-01T18:11:03.661242Z","title":"Frame-voyager: Learning to query frames for video large language models.arXiv preprint arXiv:2410.03226, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17386","last_updated":"2026-07-19T19:07:19Z","snapshot_observed_at":"2026-08-15T16:28:55.516200Z","submitted_at":"2026-07-19T19:07:19Z","title":"SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T18:11:03.661242Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.17386"},"observation_digest":"sha256:82b6ac08adaa1b48efec44d013cf72d20f11cbf7fef3215933d6f27ce97fffe5","observation_id":"4a2ee8db-e65b-4904-8f56-7f723e0d407d","resolution":{"observed_at":"2026-08-01T18:11:03.661242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-02T09:17:00.686105Z","title":"arXiv preprint arXiv:2410.03226 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-14T09:16:45.162118Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.686105Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:6b93f29bee4e791e3c8c0a09d3606762528333f1ce5411c4490989f7547811cb","observation_id":"4d60bb00-203a-46b2-aa67-6539123e0776","resolution":{"observed_at":"2026-08-02T09:17:00.686105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-01T02:59:25.283484Z","title":"arXiv preprint arXiv:2410.03226 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25266","last_updated":"2026-07-30T21:59:18Z","snapshot_observed_at":"2026-08-17T13:03:38.590868Z","submitted_at":"2026-07-28T04:09:49Z","title":"FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T02:59:25.283484Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.25266"},"observation_digest":"sha256:392fd99d9400a5fbe7a0b3f707b89b809ea0cdb550ff74e84fc853b4742c34d6","observation_id":"6a6c0170-65b3-4825-8aa3-1f58c845d0a6","resolution":{"observed_at":"2026-08-01T02:59:25.283484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-03T01:46:08.921261Z","title":"arXiv preprint arXiv:2410.03226 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25266","last_updated":"2026-07-30T21:59:18Z","snapshot_observed_at":"2026-08-17T13:03:38.590868Z","submitted_at":"2026-07-28T04:09:49Z","title":"FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T01:46:08.921261Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.25266"},"observation_digest":"sha256:d6d16bc4fa95b1ac07546ff7c80d2113e3b229e932345035fe7596a2733cdd6a","observation_id":"7f1b878f-50f5-4223-a2f1-686a3e954218","resolution":{"observed_at":"2026-08-03T01:46:08.921261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-07T23:42:35.158387Z","title":"arXiv preprint arXiv:2410.03226 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-15T18:24:14.532849Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.158387Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:30e834f5c2a12c409a089203a94589dbc0f8cac84d393b697e80cd794bae7223","observation_id":"949b5c8a-2cf7-4ce3-a17a-63fc99fbed09","resolution":{"observed_at":"2026-08-07T23:42:35.158387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.03226/citation-record","integrity":"/paper/2410.03226/integrity","json":"/paper/2410.03226/citation-record.json","paper":"/paper/2410.03226"},"outbound":[],"paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T10:22:39.426541Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2410.03226."}