{"as_of":"2026-08-20T06:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1af84b1babbc1dd5e1956004d16ef6476d28b0a6e52e6449a589fddc7132d1d","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:31:04.642937Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:18:48.890691Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T18:53:38.996149Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16173","snapshot_observed_at":"2026-08-12T10:18:48.890691Z","title":"Sa- lova: Segment-augmented long video assistant for targeted retrieval and routing in long-form video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19460","last_updated":"2024-11-29T04:12:13Z","snapshot_observed_at":"2026-08-17T15:54:45.665952Z","submitted_at":"2024-11-29T04:12:13Z","title":"Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:48.890691Z"},"links":{"cited_paper":"/paper/2411.16173","citing_paper":"/paper/2411.19460"},"observation_digest":"sha256:d1373e347b7d964be958dc35ef9626111a5a7d80f6c4c92f0b894c0396ccd294","observation_id":"e2fbcb1b-fc7c-481e-ad04-a3026aca8db2","resolution":{"observed_at":"2026-08-12T10:18:48.890691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16173","snapshot_observed_at":"2026-08-07T11:51:26.782912Z","title":"Salova: Segment-augmented long video assistant for targeted retrieval and routing in long-form video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01274","last_updated":"2026-06-11T17:06:50Z","snapshot_observed_at":"2026-08-10T04:03:56.011290Z","submitted_at":"2025-06-02T03:08:07Z","title":"ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:26.782912Z"},"links":{"cited_paper":"/paper/2411.16173","citing_paper":"/paper/2506.01274"},"observation_digest":"sha256:3ed93da07a55e3e1bfbc6f37a4cf33e1655b5bf45872e043a6c80aa0f0995372","observation_id":"3a68fc8c-0d7f-4210-b4c3-d18e7ecdc0d4","resolution":{"observed_at":"2026-08-07T11:51:26.782912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"cited_work":{"arxiv_id":"2411.16173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16173","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Salova: Segment-augmented long video assistant for targeted retrieval and routing in long-form video analysis","venue":null,"work_id":"de6a0ab4-435c-4e07-9bff-86fa35402416","year":2024},"citing_paper":{"arxiv_id":"2605.15764","last_updated":"2026-05-15T09:24:41Z","snapshot_observed_at":"2026-07-06T23:27:01.213106Z","submitted_at":"2026-05-15T09:24:41Z","title":"GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T18:49:18.815456Z"},"links":{"cited_paper":"/paper/2411.16173","citing_paper":"/paper/2605.15764"},"observation_digest":"sha256:28dcb27846df4580a21765a9aefe9c653b4081e027f5eebe9714cd12196223f9","observation_id":"305c3027-cfc9-4e7a-8d23-f314ba2448b6","resolution":{"observed_at":"2026-05-20T18:53:38.997930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.16173/citation-record","integrity":"/paper/2411.16173/integrity","json":"/paper/2411.16173/citation-record.json","paper":"/paper/2411.16173"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-12T13:31:03.955094Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:03.955094Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:bd9efa672a115acc71570ca9cffadcd78f317feaf1541045a44bcd3f88285af6","observation_id":"57e231a7-ea8f-496b-a33d-a6ae56e950b3","resolution":{"observed_at":"2026-08-12T13:31:03.955094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:03.961916Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:03.961916Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:e7812c9931b30315a507c9560f0b0cacd846e418e7e7933ac2456576faa9031b","observation_id":"f30c46be-108a-4b7c-a23a-05c66c022612","resolution":{"observed_at":"2026-08-12T13:31:03.961916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T13:31:03.970336Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:03.970336Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:a0b69d83b7710ccde9f09aadfd59e5ca63ba33500fabdb7605327006be0be189","observation_id":"35b0cc40-492e-4f56-b313-504ba88fe11d","resolution":{"observed_at":"2026-08-12T13:31:03.970336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:03.975755Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:03.975755Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:aacebc2a1e3b9563491a52ebc7ee473ccb74d199dc92a61cbf0604fd38411949","observation_id":"58727375-4b88-4fce-87d1-500447a09a19","resolution":{"observed_at":"2026-08-12T13:31:03.975755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:03.987744Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:03.987744Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:e6849a1779932236d1fc3866ec8e8f29c11eeb50479550f92da4a2601a82c48b","observation_id":"70d5b1df-bbd2-4b14-ad30-864834dd6e21","resolution":{"observed_at":"2026-08-12T13:31:03.987744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.491306Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"73105e59-eb49-46f9-80d2-2d888c31d50e","year":2015},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:03.997771Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:a4e7c6f114cb9fa92bb4e04d5ada7f09af90ab63daef8c2273ee33276eb4ee7b","observation_id":"aeb4c7d7-ef0a-43a8-9e10-a9bd27aab885","resolution":{"observed_at":"2026-08-12T13:31:06.495865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06742","last_updated":"2024-04-01T03:00:06Z","snapshot_observed_at":"2026-08-18T02:59:31.716529Z","submitted_at":"2023-12-11T18:59:06Z","title":"Honeybee: Locality-enhanced Projector for Multimodal LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06742","snapshot_observed_at":"2026-08-12T13:31:04.008071Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.008071Z"},"links":{"cited_paper":"/paper/2312.06742","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:5769fe2c52ba309a4be2ea288c32d77bb3aec79121378e986b6da69b3e2f2282","observation_id":"9b4856bd-ad5b-49d8-9f3b-c6ebb171409e","resolution":{"observed_at":"2026-08-12T13:31:04.008071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-12T13:31:04.016872Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.016872Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:95ea697747ec389bdb6624f71126c004c17d02992897265d8442c8d00924f70d","observation_id":"d115cd80-01c9-43a4-be4d-04a3b491d210","resolution":{"observed_at":"2026-08-12T13:31:04.016872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-12T13:31:04.025102Z","title":"Training deep nets with sublinear memory cost","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.025102Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:2a02db0d279aa7bd196ea003e17a29468e7731a1aa33649206cf7ac58915f9ca","observation_id":"a7d7b95f-b852-4a5c-9dd7-ac6c129150fa","resolution":{"observed_at":"2026-08-12T13:31:04.025102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:04.036608Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.036608Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:590cec8e942525ae1284f79d91d43c6f53eb2caadb6a74fca08046d9c7559d07","observation_id":"f5ebbed0-bea7-42cd-9ccf-14966dd6a3f3","resolution":{"observed_at":"2026-08-12T13:31:04.036608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-12T13:31:04.042655Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.042655Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:85c1f406932584e676786ba24b6508ef7bfd22d07343fc717e0b5363894acd14","observation_id":"c2f1a3ba-b6cd-4faa-9ae6-b73478f4aff1","resolution":{"observed_at":"2026-08-12T13:31:04.042655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T13:31:04.051362Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.051362Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:8ce78a69667fd2967dac3b396b8c28a9074136bb21ef9dc9f87ca0e94ab18e6e","observation_id":"e3a92d58-ee71-4499-ac88-fd22ed3be7b1","resolution":{"observed_at":"2026-08-12T13:31:04.051362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:04.058867Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.058867Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:aaaa0ad3f0088323cc305bbbeb3a84543a2b6f32290e3b6507a8435a9eed459d","observation_id":"7a423278-109c-4505-a66e-7b863c51a2cd","resolution":{"observed_at":"2026-08-12T13:31:04.058867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.458616Z","title":"InstructBLIP: Towards general-purpose vision- language models with instruction tuning","venue":null,"work_id":"a7ede482-91de-4c49-b316-2a5b8e5b7b7e","year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.067305Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:321cab16725058ceccd92f513e677290a0817d9488022ff868076f768d18f7e3","observation_id":"1531c6b0-7512-4441-b98c-a26d17260198","resolution":{"observed_at":"2026-08-12T13:31:06.464072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-12T13:31:04.077714Z","title":"Flashattention-2: Faster attention with bet- ter parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.077714Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:a578575199d2ebbc90007f06915161ef624309320fc129086b38d4d057d0ba9a","observation_id":"e98ad8a7-fb69-4b87-8731-3af104786d0a","resolution":{"observed_at":"2026-08-12T13:31:04.077714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.444795Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution","venue":null,"work_id":"899a57d9-60cf-49cf-881b-3024bd874325","year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.086355Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:982446ce1b967b83c21d3fbc12a6fa51b4a67323bb269e447879f3551b53f4b5","observation_id":"d2c8bc61-368b-4447-b94a-6ff9e3e29571","resolution":{"observed_at":"2026-08-12T13:31:06.449361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-12T13:31:04.096194Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and compre- hension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.096194Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:43533bb7fce53851ec81648f06969b1f5411da1e586e3284a66641d2969aef01","observation_id":"9855ebe5-7360-4b12-bc9a-c8eefe3d9b8d","resolution":{"observed_at":"2026-08-12T13:31:04.096194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T13:31:04.102463Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.102463Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:eef56271f89034520bbce5f2744671fb882985fa3b39b987f586a83b4b08c1c9","observation_id":"a8d85cd7-4d49-49e3-859d-04e545fedc8c","resolution":{"observed_at":"2026-08-12T13:31:04.102463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.430316Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"bc817b3c-52cc-4a3c-9330-bb16adbc5379","year":2019},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.113593Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:c304c8c9f522d0d89dd1d4f81d2baf1d9b4df8ea890c42dfb0bc8b829ae784db","observation_id":"a9b923ba-1570-4c45-a686-8919fb0580a9","resolution":{"observed_at":"2026-08-12T13:31:06.435705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-12T13:31:04.119531Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.119531Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:b420d14658eea13d5b3ef2b8df07d24607a1a988621395c7a4f6173cc1817b25","observation_id":"a483f1a2-da3e-4714-808b-17345e50c169","resolution":{"observed_at":"2026-08-12T13:31:04.119531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-19T19:31:39.899491Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-08-12T13:31:04.127586Z","title":"Short film dataset (sfd): A benchmark for story- level video understanding.arXiv preprint arXiv:2406.10221,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.127586Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:baee2c6be7511a6bd4f7837b4a515f15e1c489546f120da7d64fe2d8dc45b5ed","observation_id":"31425c59-ec50-4615-a346-5b13beed029b","resolution":{"observed_at":"2026-08-12T13:31:04.127586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:04.134099Z","title":"Gemini, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.134099Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:372d8c7dd58f7fa90559eed0dbf767389ea118beec5d57598c3d680cd9bf6e5f","observation_id":"593182dd-316b-4b18-a780-637c6680b74a","resolution":{"observed_at":"2026-08-12T13:31:04.134099Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.403343Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"a8da8b20-4cc4-4f2d-90d7-f2676e594f43","year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.140328Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:d33cac7276a1d78923fd9da0d5c19b0f95b45dd0fe924aa528672d0282a1f038","observation_id":"67b4aa85-c730-4367-b10c-e3009ae6c505","resolution":{"observed_at":"2026-08-12T13:31:06.410889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T13:31:04.150807Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.150807Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:ce767cfbd141cc17e8b6f831aec0864c6db54b261d32c06b894588c258741444","observation_id":"955a6b36-8383-4a74-8f11-c3f770b2fc6a","resolution":{"observed_at":"2026-08-12T13:31:04.150807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:04.156057Z","title":"Language is not all you need: Aligning perception with language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.156057Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:b31eda9d626dafedffeb692d98172dcf613af4f0e63a104bf1622ac79ed38b8f","observation_id":"b61891ba-2acd-45cf-ba8d-e0846530d678","resolution":{"observed_at":"2026-08-12T13:31:04.156057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.375899Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":"98395332-d74d-4559-8db0-7dcf65cf7a7d","year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.161739Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:1323fc918eef4149a6e17c4396d9bfdde3271435b0dbfba4a9b4c2461b5fc3b8","observation_id":"3b625dcc-6d42-4325-9f5b-550aa38baf81","resolution":{"observed_at":"2026-08-12T13:31:06.380546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06358","last_updated":"2024-07-08T19:58:59Z","snapshot_observed_at":"2026-08-16T13:36:00.528382Z","submitted_at":"2024-07-08T19:58:59Z","title":"MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06358","snapshot_observed_at":"2026-08-12T13:31:04.168046Z","title":"Miradata: A large-scale video dataset with long durations and structured captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.168046Z"},"links":{"cited_paper":"/paper/2407.06358","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:882482621fe6be6b35818cd8df0435e1b763d95df3162d3df33188aab4c8902a","observation_id":"ecb673a5-47a4-4bd5-815c-1231256f4f9b","resolution":{"observed_at":"2026-08-12T13:31:04.168046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:04.176091Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.176091Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:86c83c5ebe27e09e75ede3fa4e64272a9be8e4f17f37785edf91f526865eac26","observation_id":"af23ba6b-26fe-4df3-b4be-2cc75786ba3f","resolution":{"observed_at":"2026-08-12T13:31:04.176091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T13:31:04.185703Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.185703Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:9544bdf404e1a7fc210f93fea2807c8fe9ebc69203f04a35bf87374edcf7cb7c","observation_id":"4200f90e-e588-4b41-9218-d25a475f9c82","resolution":{"observed_at":"2026-08-12T13:31:04.185703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-12T13:31:04.194172Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.194172Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:e63f620ee82114ab4851883f90ac5443ccb47de6c1a24d03def357d695cd28f0","observation_id":"afd45411-2347-471e-979c-258f4d30e4cb","resolution":{"observed_at":"2026-08-12T13:31:04.194172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.352022Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"f96934d0-dd44-4832-8693-b331ae29a677","year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.200577Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:585672088bdbf3190e37b26e5315a63b499a1a63035ab9685460d47e8341e169","observation_id":"ce9f6c74-54a6-4763-9dc7-d899d4e50287","resolution":{"observed_at":"2026-08-12T13:31:06.356650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.337694Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"be123738-b03c-40c7-9a4b-9beeb75647a0","year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.206745Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:70c628f8fcbd81f841ef3879b4e97db5505a242d777950ae623a0b8496f55079","observation_id":"b6cf23d7-e0a9-4138-8760-5c6d1b56e995","resolution":{"observed_at":"2026-08-12T13:31:06.342554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.322318Z","title":"Mo- mentdiff: Generative video moment retrieval from random to real","venue":null,"work_id":"7132bd0f-e42c-42e1-8c07-b5a355f965ee","year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.223008Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:e4a3c33935061e43f14b0df171522fcfcea8035f46767903e7303beef9a63c63","observation_id":"7617c986-c22f-4574-8bad-e999925e9145","resolution":{"observed_at":"2026-08-12T13:31:06.327010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.288998Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"6df3d558-b912-426e-969b-82f4c9395603","year":2025},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.230679Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:bc18414d985d0d9b08194847305426cac5f180f3195043a51605dd136c1381fd","observation_id":"d3a3f9f2-fd55-4d69-886b-072e49de2732","resolution":{"observed_at":"2026-08-12T13:31:06.309061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T13:31:04.241041Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.241041Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:7021925325fdeedb3459391c15f98851963c9c6301fb329c921ff421e2287e10","observation_id":"98bd8e06-81c9-436b-8443-e79d3005ca83","resolution":{"observed_at":"2026-08-12T13:31:04.241041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.266978Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"1328b935-8bd4-4105-8c29-9513e5dd0cd2","year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.246495Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:ed1ce318786332570eef37d183185f3c3dff8a74520df1af205f57382a732780","observation_id":"92c44ada-7a89-4e0e-a43d-58809150ce82","resolution":{"observed_at":"2026-08-12T13:31:06.272272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-12T13:31:04.252680Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.252680Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:a4b596a4ba5c8b17d02b902383213e3be72628535d8eeeafb5f4f770b1ac3700","observation_id":"c9180e20-dc9b-4d94-a9c9-7b2a3274d05c","resolution":{"observed_at":"2026-08-12T13:31:04.252680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.244694Z","title":"Visual instruction tuning","venue":null,"work_id":"794407b0-51e0-456a-894f-4b23ddf577f3","year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.259329Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:1693c425afdcbf6b252baaa3c9d4a42788f4a2f483014d3ed4bf18608a01e90a","observation_id":"187f7b3f-9c74-4ddc-ac85-d5c472fc4290","resolution":{"observed_at":"2026-08-12T13:31:06.253897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.225537Z","title":"St-llm: Large language models are effective tem- poral learners","venue":null,"work_id":"c2cffdc0-3313-4fd4-99ee-6dc22dc65898","year":2025},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.264431Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:bc4e0506139c16db26967cf01043247edc169c75aafbdd107a4bd8ab5d839b0f","observation_id":"76d12409-f3aa-4272-bbf8-01b22871879c","resolution":{"observed_at":"2026-08-12T13:31:06.231627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-12T13:31:04.276218Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.276218Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:139c9f69c0b8cb9ce1f336c6b24c62c78b95d895a227f6b1892d72d26d8a1b1b","observation_id":"72545038-e80b-4558-ac72-88e87644066f","resolution":{"observed_at":"2026-08-12T13:31:04.276218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T13:31:04.286311Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.286311Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:bf578a1e53aa210e3206c88f8c4ba791dc7c648dde52349298ed2d6b31a31c75","observation_id":"5f7cf55e-fe58-4508-8046-b1e46a8e1da8","resolution":{"observed_at":"2026-08-12T13:31:04.286311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-12T13:31:04.298444Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.298444Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:7c9e97d67e966dc932f5e926b8e06dfe52542d669b91256ca9ca568a2600b6d4","observation_id":"6c6c3ab3-4ad6-405e-8bfb-4be734a5e7a6","resolution":{"observed_at":"2026-08-12T13:31:04.298444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:04.314096Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.314096Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:1ff41606fbf25e37e35ee239308787d02bf0ad4c8478e9b062438485fc09bc46","observation_id":"c11bf21f-bd96-4bb1-8a9b-1f1e41bdafbb","resolution":{"observed_at":"2026-08-12T13:31:04.314096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.194650Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"9b61be5f-f22c-4371-82c6-26200d605dc3","year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.321808Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:a4ba2ff93f19fd4408471638c220e324a09a5eef3e28635338d4b20cb3b23365","observation_id":"e1bff855-85a9-404b-9f39-3caf5e0eba79","resolution":{"observed_at":"2026-08-12T13:31:06.199637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:04.330818Z","title":"GPT-4V(ision) System Card, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.330818Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:b0f24b05a992c2a759d40f97bdb078f55b8cf3daf178c0712f591a47cd397363","observation_id":"20d9bed8-ea03-41be-8302-c3beb6c69331","resolution":{"observed_at":"2026-08-12T13:31:04.330818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.170422Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":"ba31f2b2-77c9-45d2-85e9-76dd7c3eb9e4","year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.339055Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:a6999c58967e89405c277072d1306bcbedbe74dd34b3656daadf650342095c21","observation_id":"78b39bb4-a728-49bb-966f-22c22a91afcd","resolution":{"observed_at":"2026-08-12T13:31:06.175294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.154395Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"842fab78-4c57-49df-9ebd-12854e4bbbde","year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.348248Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:59dafedb7eb060e1059fd87beb51fc0ff911ef7ef81d40c714b72eea498a7924","observation_id":"dedd7203-000c-475d-b2ea-113194113098","resolution":{"observed_at":"2026-08-12T13:31:06.160148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.131445Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"c37a66e2-fa40-4b0e-a62d-cdf499cb8cac","year":2021},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.355067Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:5a144905168b1296950573b5da7496bb50507b1781e2fdd9abbfe62ee2addf5b","observation_id":"8f7b9ade-22f0-46ad-af56-680ccbc8cbae","resolution":{"observed_at":"2026-08-12T13:31:06.138060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.112536Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"5923c85d-a3d3-4b80-9061-820e0fab976b","year":2020},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.364815Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:d55e67a90dc53fcb53d359359fbfb59fb452546d45e7437eb04e3ea654c19d5b","observation_id":"f8ece6f2-1ed1-4ca2-bd29-0a08c526bacf","resolution":{"observed_at":"2026-08-12T13:31:06.118763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T13:31:04.377417Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.377417Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:d2f9d0b69a244b0e5b83071429b82d082381a1f7297e2e738850fe0fd0c6d542","observation_id":"8fa5a5ea-fb52-465e-8c49-5783e0c1999b","resolution":{"observed_at":"2026-08-12T13:31:04.377417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.083061Z","title":"Sharegemini: Scaling up video caption data for mul- timodal large language models, 2024","venue":null,"work_id":"e8e90050-7aba-469b-badf-953bc8277a89","year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.387877Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:bf68d2e0d6bf461379f9a98a4aeda0b50bef7d06fad3cc1e86a4d1d7cca418ec","observation_id":"487b258f-0b1d-4602-ab57-21fe59e4f393","resolution":{"observed_at":"2026-08-12T13:31:06.090774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:04.396335Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.396335Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:ed3e58bfb95a90242a31ee002726b49598c3ec5b733f70de42048ac5480bd6e3","observation_id":"75f9b14d-e66a-46ab-b856-546296abac5e","resolution":{"observed_at":"2026-08-12T13:31:04.396335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.036451Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"4417389c-fd21-4513-b5a1-ec8e5b99324a","year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.405996Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:b0ff1f5bfe71f3a14eb8f0d31fa6a8f8e48d2e9c951c60b65502e80b871d9d5a","observation_id":"3340ab37-0b6a-41dd-8b98-5c21220e616d","resolution":{"observed_at":"2026-08-12T13:31:06.043356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:06.005698Z","title":"Augmented SBERT: Data augmentation method for improving bi-encoders for pairwise sentence scoring tasks","venue":null,"work_id":"5fd2bce6-182d-46f2-bd03-aef39cbc8375","year":2021},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.418605Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:20943891446c9b7892b40c2a7733610111d4cdf736fc1da03e227eade91992ae","observation_id":"0b280126-5486-4eda-a7f5-bc4ad7429f77","resolution":{"observed_at":"2026-08-12T13:31:06.016300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T13:31:04.434969Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.434969Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:5a9ca3b58add0ecbcb6426a48128887e5040be571f8d96406585237bdd678850","observation_id":"e2b0f3f6-6c41-4eab-9d38-bcf90bae6fd5","resolution":{"observed_at":"2026-08-12T13:31:04.434969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-12T13:31:04.453981Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.453981Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:1dd14d79ce38c528ddfefcabc8b423e2c3dde139e7fecc5ac181829011e960ed","observation_id":"67f76ad6-0355-494f-a814-30bded0c0e2c","resolution":{"observed_at":"2026-08-12T13:31:04.453981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-15T01:28:11.776642Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-12T13:31:04.464160Z","title":"Longvideobench: A benchmark for long-context inter- leaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.464160Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:2e3692a675c5eec687affd5aab400bb5bcebec39859e083234c5678c5ba719c6","observation_id":"3d5832b1-e6aa-43c5-9750-01e677997025","resolution":{"observed_at":"2026-08-12T13:31:04.464160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:04.471598Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.471598Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:d0f77a941710a8f757cfc6012b0a3efe502eb1a3850eec46ffb126966869d9ff","observation_id":"5995798c-f68f-4787-b17f-0f1239bca1b3","resolution":{"observed_at":"2026-08-12T13:31:04.471598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T13:31:04.481024Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.481024Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:b4a610a8facbcce19493cb82c07221c9ff72241ba317e6ef4712aea7a4c39f99","observation_id":"5b6bea90-eff3-4416-bbed-44242b21081a","resolution":{"observed_at":"2026-08-12T13:31:04.481024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-16T13:32:02.889396Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-12T13:31:04.488520Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.488520Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:4583e2c72b36d06675a695a65d398f05a511de34a8cffaca2f5d85909883ae24","observation_id":"c536aed2-89b0-4e9b-aff9-8eade030e14f","resolution":{"observed_at":"2026-08-12T13:31:04.488520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-12T13:31:04.502907Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.502907Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:60e2e12cd88395ca9ca978498c99b6972b8e2bc7c5d296f6de6c7232c9302d06","observation_id":"b221bf69-f184-4f8b-b50b-59585d1ed87a","resolution":{"observed_at":"2026-08-12T13:31:04.502907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:04.527268Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.527268Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:78edf8150be844e83257edf7c6ff9b5d1970852f2977cb8447655f4d65339db0","observation_id":"b924dcfb-5840-45b1-b5e0-9d4e77e949c0","resolution":{"observed_at":"2026-08-12T13:31:04.527268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T13:31:04.539324Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.539324Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:1b653e27d2f730df54f9d03f7a520d13f2c7dc6e102c2a616d7c379e91b635cf","observation_id":"08fda050-74fa-4653-b030-5d8c6dd087dd","resolution":{"observed_at":"2026-08-12T13:31:04.539324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-16T23:01:47.789827Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-12T13:31:04.551482Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.551482Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:48a69f6b87e1c7f1cdbc06145a2d26c157289a449f33e617455e1eb0706304d3","observation_id":"59bda63b-3db2-46da-b9b5-a12b5ca0a35f","resolution":{"observed_at":"2026-08-12T13:31:04.551482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T13:31:04.561169Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.561169Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:ed18a8cdba7b9b57f45612d155617cc08b12f72065c66b88cef728ad2c6bfb81","observation_id":"36a8728f-5a81-4d03-8a19-4fdce3b012e3","resolution":{"observed_at":"2026-08-12T13:31:04.561169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:05.952606Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"66bb749b-d202-4661-965f-917d570c895e","year":2019},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.585042Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:c131b5443b1e0d047484e56c871ed82f88902bef4bd8587df4f38a8b289ef326","observation_id":"37140d12-d812-432d-b6a3-c34f6c01b849","resolution":{"observed_at":"2026-08-12T13:31:05.958307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:05.932244Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"67d39cdc-d41c-4d91-8cb9-059fbe710fbf","year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.601541Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:c9dd7113cf6ed08f1af65e23e02814d05d7c04ced1a1bc3fe0b38118df7368f7","observation_id":"1d21fcc6-94b7-4433-acbb-c6a258cca652","resolution":{"observed_at":"2026-08-12T13:31:05.937092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T13:31:04.607338Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.607338Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:253363e500e528c4b3178fd21c467167262354213b1827e3d25dfba3675e605c","observation_id":"8edc5634-90ce-4f6f-91ef-5363bcf79dbd","resolution":{"observed_at":"2026-08-12T13:31:04.607338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-12T13:31:04.614880Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual in- put and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.614880Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:3046aa574e5112b8b4bf9685cb4564a2dbd12d052c8b83bc98e4c929d9b30b1f","observation_id":"843cf036-d434-4165-8927-fece6d5dee9f","resolution":{"observed_at":"2026-08-12T13:31:04.614880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-12T13:31:04.620891Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.620891Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:cb1eb6e2a8c0dd178e7bbd66739d647b608060dde920dea13212a62e6ae9124d","observation_id":"4c4f305f-2f17-4920-8a54-88212773c02c","resolution":{"observed_at":"2026-08-12T13:31:04.620891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-12T13:31:04.629482Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.629482Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:0e3e6f136576e1003fd3caa0bb623c8180eaee7758fb5bd4f7bf5f35b55b5672","observation_id":"857e9d88-3a7e-43e0-9160-689b506dcb79","resolution":{"observed_at":"2026-08-12T13:31:04.629482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-16T13:43:37.776811Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-12T13:31:04.636677Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.636677Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:b0eaf7d8c9a79605a0a0a5aaba00360a4edb0138ed78ec96ff52b4c503fcb486","observation_id":"eec66a7f-c702-4e86-bd74-b72d55c96ba4","resolution":{"observed_at":"2026-08-12T13:31:04.636677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:31:05.898342Z","title":"Provide a detailed description of both the visual content and the storyline depicted in the video","venue":null,"work_id":"c3c6c1df-5036-4a83-869b-b05acc09a55b","year":null},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.642937Z"},"links":{"citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:3adb07380efa6e4ae1746d25d517d6c838df4dfebba5c8581d7b6eb4b90d3588","observation_id":"7f9b90d5-68b8-43b7-8f48-91d4183d0a95","resolution":{"observed_at":"2026-08-12T13:31:05.907211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T07:25:58.394063Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":48,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 3 inbound Pith citation observations for arXiv:2411.16173."}