{"as_of":"2026-08-08T19:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af173a88393860c6b367991a77136d3ca6815c0fb9770166cd948d26e8ecd8db","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:49:42.909084Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.03039/citation-record","integrity":"/paper/2508.03039/integrity","json":"/paper/2508.03039/citation-record.json","paper":"/paper/2508.03039"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2007.00394","last_updated":"2023-05-17T07:56:52Z","snapshot_observed_at":"2026-08-08T10:03:30.529298Z","submitted_at":"2020-07-01T11:34:46Z","title":"The IKEA ASM Dataset: Understanding People Assembling Furniture through Actions, Objects and Pose","version":2},"cited_work":{"arxiv_id":"2007.00394","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.00394","snapshot_observed_at":"2026-08-06T04:49:44.809694Z","title":"The IKEA ASM Dataset: Understanding People Assembling Furniture through Actions, Objects and Pose","venue":"cs.CV","work_id":"c07c8a5c-40e7-408e-b3d2-ab27c67acd0a","year":2020},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.193595Z"},"links":{"cited_paper":"/paper/2007.00394","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:6438cf2bbf597e2ff07ff1dd154ca689f21827c51fe47cd39d719b6fcaa14250","observation_id":"d0fc53e2-d681-4262-9f49-feb7351126b9","resolution":{"observed_at":"2026-08-06T04:49:44.836759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T04:49:37.262227Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.262227Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:3d7f15129af5200ef5eb2778659d74aefbfddacae4493fe724fb117bec05dcd0","observation_id":"8916b5d6-5696-4ab6-85bb-0c4570017a2e","resolution":{"observed_at":"2026-08-06T04:49:37.262227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-06T04:49:37.375757Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.375757Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:29f5f2956d4fb51837b0560fbf60ad8d6364db1a6d0f2ec83c6c7a4da2cab74a","observation_id":"dbbd0beb-e5af-453c-862f-f1b19e196efe","resolution":{"observed_at":"2026-08-06T04:49:37.375757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T04:49:37.464967Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.464967Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:381e8ffc65f43d8d08700f61c3459153327213ceb3756396e3edbec930b6560e","observation_id":"457862a8-afb3-48f7-85d2-efa803b70330","resolution":{"observed_at":"2026-08-06T04:49:37.464967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06299","last_updated":"2024-09-10T07:53:10Z","snapshot_observed_at":"2026-08-01T07:55:00.368118Z","submitted_at":"2024-09-10T07:53:10Z","title":"Enhancing Long Video Understanding via Hierarchical Event-Based Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06299","snapshot_observed_at":"2026-08-06T04:49:37.562864Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.562864Z"},"links":{"cited_paper":"/paper/2409.06299","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:30c16a4794c25b9aeeb65bf459636c8011c14bef196d46a4d1bee42b99584e0d","observation_id":"4ed2ed85-0e9d-4dc1-a83a-a32078302cf0","resolution":{"observed_at":"2026-08-06T04:49:37.562864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T04:49:37.643512Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.643512Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:6435a52a762e233a34f26993dd15f64244039cc136249371982055f25494a187","observation_id":"e691ea34-fc65-4152-ac4c-de2035cca43e","resolution":{"observed_at":"2026-08-06T04:49:37.643512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.943382Z","title":null,"venue":null,"work_id":"174dca4c-1341-4b67-9963-5d0cd2542025","year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.738710Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:8b723bb460095dfd12a09d8bf0c574baf934d9d39c30c0101d284b43b25b9354","observation_id":"a74b6568-0c14-4b40-bcfd-65d75c08ab60","resolution":{"observed_at":"2026-08-06T04:49:45.982958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.33934","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:44.589851Z","title":null,"venue":null,"work_id":"43eb24ea-a2d7-436a-babb-a83706a0ad13","year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.840755Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:8c0b48fd97ee2689b78109f70089d00b93c3140df13ea8b8cfcd7f21ac7dc241","observation_id":"59dd60d2-be20-446d-ac9c-a41ce768a327","resolution":{"observed_at":"2026-08-06T04:49:44.688355Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-06T04:49:37.951565Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:37.951565Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:5de3e169218de39db78dd0c66f1b1636c61712717986efbded8439785bd66e8b","observation_id":"d8855dac-cc08-4c80-8e64-ec425fe59203","resolution":{"observed_at":"2026-08-06T04:49:37.951565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T04:49:38.032079Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.032079Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:b217693c5e7e418a1295aff94af3d533d229f8b37fb08c42895ccde837f2f9e6","observation_id":"39f00fc1-9517-4c66-b420-af0ad379cf9d","resolution":{"observed_at":"2026-08-06T04:49:38.032079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:38.149590Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.149590Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:7cc344cce51739bdbdcc426575c5a33468ff97643c2c508b800ad2a3b14048b2","observation_id":"4c12f38d-35bd-4389-bdcc-01ab01d93e16","resolution":{"observed_at":"2026-08-06T04:49:38.149590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13250","last_updated":"2024-05-16T12:23:05Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-20T18:58:54Z","title":"Video ReCap: Recursive Captioning of Hour-Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13250","snapshot_observed_at":"2026-08-06T04:49:38.388595Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.388595Z"},"links":{"cited_paper":"/paper/2402.13250","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:d4c4228152e5c7fa2ee9a40471a3300bfe650e1c82b54e44b15f31808ecf82c9","observation_id":"c69bb0d7-baac-4ee6-80ee-9b06a3803f67","resolution":{"observed_at":"2026-08-06T04:49:38.388595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09590","last_updated":"2025-03-13T17:14:31Z","snapshot_observed_at":"2026-08-07T17:09:25.628961Z","submitted_at":"2025-03-12T17:57:32Z","title":"BIMBA: Selective-Scan Compression for Long-Range Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09590","snapshot_observed_at":"2026-08-06T04:49:38.487988Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.487988Z"},"links":{"cited_paper":"/paper/2503.09590","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:50448b475a67ed74aa84b44f8951b8d4c72ab6e7397b39c6e0ad9fa6ae6d002f","observation_id":"ada452eb-d963-4838-8da9-cf70e5235c73","resolution":{"observed_at":"2026-08-06T04:49:38.487988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.705339Z","title":null,"venue":null,"work_id":"303d7dd3-de01-4434-920e-d81bf90dc741","year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.592793Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:60c0b7a656b1c1ded76c36363143cc9701b7f530597132806c82aa83db8b0e49","observation_id":"f4bcf83e-1057-4518-8e37-70fa5b0f5f89","resolution":{"observed_at":"2026-08-06T04:49:45.734096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T04:49:38.715526Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.715526Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:a373e77c9656cc313712739e5405905b4cf1a5ada7e1c6dd9a05af493bf0fb07","observation_id":"3abd9c83-6526-4618-8dd2-b7e698badfed","resolution":{"observed_at":"2026-08-06T04:49:38.715526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:38.819208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.819208Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:519d6c3243d7cd477dda25dc01d66fb44652e35dd34a8fd55306f60fd1465db8","observation_id":"bb82cd92-7085-45ee-9194-c19c7c338fa8","resolution":{"observed_at":"2026-08-06T04:49:38.819208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:38.925919Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.925919Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:b2f3087c7e461775162585ede09b780b4fe5f7d3d94fda95c18b693ad1d2171f","observation_id":"a6aafc0f-31fb-4274-a25b-06f213b47ac4","resolution":{"observed_at":"2026-08-06T04:49:38.925919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-06T04:49:39.008817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.008817Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:2c590706f66172d8a22951411485a5518f50d52d84d4d613ba3de0fafedba03c","observation_id":"215cecf1-67bb-41ca-83fc-6a30a3038aa5","resolution":{"observed_at":"2026-08-06T04:49:39.008817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.612293Z","title":null,"venue":null,"work_id":"b2ebd96c-9dfa-4fe9-b876-93c1cbfca9ac","year":null},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.090836Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:8266cbc5f2d4ee4f775ec2662245a2e04a25cdff65659cfdad913507ff8cc209","observation_id":"880ab0e9-887c-47b5-bbbd-b542464beaca","resolution":{"observed_at":"2026-08-06T04:49:45.656764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05069","last_updated":"2025-03-25T03:46:09Z","snapshot_observed_at":"2026-07-06T20:18:35.429115Z","submitted_at":"2025-01-09T08:44:42Z","title":"Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning","version":2},"cited_work":{"arxiv_id":"2501.05069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.05069","snapshot_observed_at":"2026-08-06T04:49:44.150069Z","title":"Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning","venue":"cs.CV","work_id":"0aff2327-dcd4-4f83-bbf2-6585f49ac370","year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.256408Z"},"links":{"cited_paper":"/paper/2501.05069","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:8d53e248816e4cb3915cf15cc31da7f41e568eb1df4ee56460620d5103605a67","observation_id":"4be1116f-7d98-4a42-97ed-97c8dac97951","resolution":{"observed_at":"2026-08-06T04:49:44.268102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:39.355423Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.355423Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:373ac6ae005db9869986bfd5e2ed1a023c4d60cb46530a0dd89e04f14b839417","observation_id":"1fe38cbe-5629-477a-b57f-8a8f54bea77d","resolution":{"observed_at":"2026-08-06T04:49:39.355423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-72652-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:43.076970Z","title":null,"venue":null,"work_id":"5d6ffd91-f964-43db-b0c2-8addc19fce8c","year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.449214Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:91797b65402c925ffbd4f293da3d36d2346ead1c18b1e91784fb09d81d7b7134","observation_id":"43064c23-18b9-4948-b091-01583c16cbb1","resolution":{"observed_at":"2026-08-06T04:49:43.187724Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.475670Z","title":null,"venue":null,"work_id":"c93aa8b5-9eb2-47c8-8e54-236a085dc0ca","year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.548025Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:772f1b51be7f7f0646932dbfd6a554943e5ecbac53adf13be30071122b928fd2","observation_id":"d55e937b-66a2-44c1-97c4-9820b5cc216c","resolution":{"observed_at":"2026-08-06T04:49:45.517323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11107","last_updated":"2022-10-20T10:30:59Z","snapshot_observed_at":"2026-08-03T22:19:37.683430Z","submitted_at":"2021-05-24T06:06:32Z","title":"FineAction: A Fine-Grained Video Dataset for Temporal Action Localization","version":3},"cited_work":{"arxiv_id":"2105.11107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.11107","snapshot_observed_at":"2026-08-06T04:49:43.842641Z","title":"FineAction: A Fine-Grained Video Dataset for Temporal Action Localization","venue":"cs.CV","work_id":"eaf9324d-386d-48b5-923b-52a2ba11d422","year":2021},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.607583Z"},"links":{"cited_paper":"/paper/2105.11107","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:9fdf3fc1d6d911b2d1e897f7cf79aa9f5ca4dc707c470fb5b6dcd2fa0a50e429","observation_id":"f6d41882-8c87-4c39-8e1f-71d88ac17d0f","resolution":{"observed_at":"2026-08-06T04:49:43.956206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12846","last_updated":"2024-11-24T04:33:25Z","snapshot_observed_at":"2026-07-06T18:33:11.370375Z","submitted_at":"2024-06-18T17:59:03Z","title":"DrVideo: Document Retrieval Based Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12846","snapshot_observed_at":"2026-08-06T04:49:39.709238Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.709238Z"},"links":{"cited_paper":"/paper/2406.12846","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:c175a33138144fb46a4577a52608370f435fb2e5c0ea7cb1badc3a236a8b446b","observation_id":"c9ffc015-b9e8-4de1-b45f-f0574edc4c8a","resolution":{"observed_at":"2026-08-06T04:49:39.709238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:39.834064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.834064Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:ca40804c71b93a656d004d313bc04c4503008d2cf1b0fcaa7465da567d187789","observation_id":"4f84d07b-d150-4a22-a3e6-d5af65ef3d1d","resolution":{"observed_at":"2026-08-06T04:49:39.834064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-06T04:49:40.068720Z","title":"Rawat, and Thomas B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.068720Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:03c3b9c68dcee9eba8d40f64fcd6c070e1f71e3aabce7bc5948cc2fa89313218","observation_id":"085a55b7-2b21-43a7-8a36-80c70466fbb1","resolution":{"observed_at":"2026-08-06T04:49:40.068720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:40.186187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.186187Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:7f089bc81c8582cd2e8f5f597697a1f3efee749d609ccd1e16b8b9928e6f60fe","observation_id":"a6dd47bf-e0be-4ea9-9140-bfcfb4aac0f3","resolution":{"observed_at":"2026-08-06T04:49:40.186187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:39.952238Z","title":"InProceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (ACL 2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.952238Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:0d97de20bc5fefd28d37ceedce31ba265480e79af9f8752cdc9956e895890a80","observation_id":"58c488f5-236a-4915-8b1e-458f1a1cce65","resolution":{"observed_at":"2026-08-06T04:49:39.952238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:40.413518Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.413518Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:7960d0740dbf833b696d659bf5c96f0b707912fce64c32a69bedc37d9c885e9a","observation_id":"e049e15f-6f1d-43c2-b1ff-b5fc0c38de89","resolution":{"observed_at":"2026-08-06T04:49:40.413518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.381577Z","title":"Qasim, R","venue":null,"work_id":"b54b3ac8-4709-4ff6-8303-8c04bbced304","year":2021},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.562692Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:b263af6369fc050fd00315f8bc0a3143a9cf0ed0a49ab3a93bf083988e906586","observation_id":"48bf7a61-c99d-485a-a7e5-114d49c266a4","resolution":{"observed_at":"2026-08-06T04:49:45.411683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-06T04:49:40.297857Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.297857Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:0e6abea9bbbcbd7e21c728f05a1249f5097a52885b147404d8ecc16d1186a595","observation_id":"bfe8e4e3-9465-4421-9f4b-1e4d1c9e580b","resolution":{"observed_at":"2026-08-06T04:49:40.297857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19467","last_updated":"2024-10-10T15:25:14Z","snapshot_observed_at":"2026-08-07T12:01:01.681131Z","submitted_at":"2024-02-29T18:57:01Z","title":"TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning","version":4},"cited_work":{"arxiv_id":"2402.19467","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.19467","snapshot_observed_at":"2026-08-06T04:49:43.501714Z","title":"TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning","venue":"cs.CL","work_id":"3e8d06d7-7faf-4a59-a352-1f0392f4081c","year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.870463Z"},"links":{"cited_paper":"/paper/2402.19467","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:40808b6d986872072d8a54403ff419710f197d920bcb14bf7cd2cec0456fc877","observation_id":"0404bfd9-8da6-4e13-a968-9f43d86969a0","resolution":{"observed_at":"2026-08-06T04:49:43.602596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01753","last_updated":"2016-07-26T22:49:22Z","snapshot_observed_at":"2026-08-05T16:01:24.330553Z","submitted_at":"2016-04-06T19:56:04Z","title":"Hollywood in Homes: Crowdsourcing Data Collection for Activity Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01753","snapshot_observed_at":"2026-08-06T04:49:41.021647Z","title":"Sigurdsson, Gül Varol, Xiaolong Wang, Ali Farhadi, Ivan Laptev, and Abhinav Gupta","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.021647Z"},"links":{"cited_paper":"/paper/1604.01753","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:4de393987fed1517e00e39a14fd0afdb8beca8f2559122b6318c41cf4f162592","observation_id":"384eec76-6808-4fd5-8fea-1a8de3ccfbc5","resolution":{"observed_at":"2026-08-06T04:49:41.021647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:40.708535Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.708535Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:5597cd2ff955f2809089483b350e94d0fbf496e725f4028b849fce3d3c31dbfa","observation_id":"4d5c72c7-0faa-494f-b3f4-6453f13a14c2","resolution":{"observed_at":"2026-08-06T04:49:40.708535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.236313Z","title":null,"venue":null,"work_id":"61eec6df-fabc-4ad9-a475-304500a480b3","year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.240798Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:cd646985cf09631bc5fc67408c06cde629d3f963353c0ec084a21972f99b139c","observation_id":"eb9e33e5-fe94-4d8d-824e-90f52617c15d","resolution":{"observed_at":"2026-08-06T04:49:45.322353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T04:49:41.380659Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.380659Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:94b498422c64c0ff56736b48491d8172a65e7082a6e088a07cb9395a6a95ab59","observation_id":"cdb02b9b-67d9-4830-be24-be0b0b3b54f8","resolution":{"observed_at":"2026-08-06T04:49:41.380659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-06T04:49:41.124471Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.124471Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:fbf360f1e4d7234e4545273e5efc3bd1b1fc78e4c16fcf4226c76f910a248090","observation_id":"0dd44e4c-e53b-44f3-be17-484d8fd9ff9b","resolution":{"observed_at":"2026-08-06T04:49:41.124471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.134927Z","title":null,"venue":null,"work_id":"8955293a-770d-4880-bc5f-aa9a6364f54a","year":2021},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.636346Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:a3dd4ae06a012730b498c745ae189b16337e8f162c411196a43aead9f1c0291a","observation_id":"72be860a-0026-4722-bb6d-14242836a9c7","resolution":{"observed_at":"2026-08-06T04:49:45.166685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-06T04:49:41.776592Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.776592Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:f732a2c0718ddbb9d5e9ea8267e36185b35d388029b548b11aad49a5564dd247","observation_id":"28fd947c-bfe8-4d0b-8954-e19b2f9e491f","resolution":{"observed_at":"2026-08-06T04:49:41.776592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-06T04:49:41.523576Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.523576Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:53749a30057fedefa875ef50a5bc1b646530e1317eccaa5172c179d82726bccc","observation_id":"2ac3d27f-7c44-4e0a-be78-6d8ba40ee92e","resolution":{"observed_at":"2026-08-06T04:49:41.523576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-06T04:32:16.849942Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-06T04:49:42.003797Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.003797Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:c82a2c274fcd53dcf0d7542ee39ec00fc0df162dac181aeb72c877e61b27355a","observation_id":"20751638-ba9e-4f60-84aa-533399259549","resolution":{"observed_at":"2026-08-06T04:49:42.003797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-06T04:49:42.097293Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.097293Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:15bfe19a1b6a3caa0e580bb8dcd81335ca90463ad4a59ad5a2c45edea2ff3c90","observation_id":"7633f68b-5142-46fb-be42-0dcf7ba2cfcf","resolution":{"observed_at":"2026-08-06T04:49:42.097293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.059490Z","title":null,"venue":null,"work_id":"eab67c7a-82b3-45a9-a576-e502b6a05ffe","year":2022},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.911771Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:2b8c379dbe547f70883ebf39858a9abd7aa884ef205da0ab25f94dd48a006b8d","observation_id":"0f9d426d-bf5f-4d1d-a70a-ea7ea25b8dd6","resolution":{"observed_at":"2026-08-06T04:49:45.086855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17235","last_updated":"2024-10-10T05:17:00Z","snapshot_observed_at":"2026-07-06T17:09:24.271573Z","submitted_at":"2023-12-28T18:58:01Z","title":"A Simple LLM Framework for Long-Range Video Question-Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17235","snapshot_observed_at":"2026-08-06T04:49:42.312571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.312571Z"},"links":{"cited_paper":"/paper/2312.17235","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:a729d60cd9e39ca1cd36e42328456448134b84f6630116f600d63194ae68e768","observation_id":"34e11361-29a3-4833-90e7-58ddcf13c67e","resolution":{"observed_at":"2026-08-06T04:49:42.312571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T04:49:42.423364Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.423364Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:575dc0f44918b1c7e6e1c81ec7b5f99df799e0ff3815b910f6ee8a6f2cfa34c2","observation_id":"e28f971e-4ef0-4741-b281-96adc07bbee8","resolution":{"observed_at":"2026-08-06T04:49:42.423364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06988","last_updated":"2023-11-29T21:24:35Z","snapshot_observed_at":"2026-08-01T23:38:14.619200Z","submitted_at":"2023-05-11T17:23:00Z","title":"Self-Chained Image-Language Model for Video Localization and Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06988","snapshot_observed_at":"2026-08-06T04:49:42.185509Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.185509Z"},"links":{"cited_paper":"/paper/2305.06988","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:cb3b0418e7a5016c00b88b5aee8c23a3b46ac9b0609c95d87005886c075a8aee","observation_id":"0a16f30d-b100-4137-849c-bc3eb44ebdfa","resolution":{"observed_at":"2026-08-06T04:49:42.185509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.09374","last_updated":"2019-09-04T07:35:48Z","snapshot_observed_at":"2026-07-06T06:16:08.829992Z","submitted_at":"2017-12-26T19:09:11Z","title":"HACS: Human Action Clips and Segments Dataset for Recognition and Temporal Localization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.09374","snapshot_observed_at":"2026-08-06T04:49:42.667270Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.667270Z"},"links":{"cited_paper":"/paper/1712.09374","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:e30d0f996a44e0befdd5dc30fe0b3fa1189c106bfe0f5f274e2afb08335168e5","observation_id":"9efbab19-1769-48cb-9f6a-b522e115e48d","resolution":{"observed_at":"2026-08-06T04:49:42.667270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:42.770981Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.770981Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:a28c334c61cffac0e871df165631cb0dc0a45da766b1cbdbc4a60f2386d79daa","observation_id":"22477e2d-58ab-4c4a-bd9a-878b1ce5b9da","resolution":{"observed_at":"2026-08-06T04:49:42.770981Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:42.523814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.523814Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:ec046a78cb4b3f2e8f093e88e65dc2657aaf697f2e8f4a7dd8033a41cdc0a022","observation_id":"274ddc68-04d3-4e29-b61a-c2eefc215d8d","resolution":{"observed_at":"2026-08-06T04:49:42.523814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:44.929132Z","title":null,"venue":null,"work_id":"ff907073-4a9e-4bb6-bf71-c821205b87f8","year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:42.909084Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:4c7f89a0c93b4a501e96cd961ae66cb77e90d92e9029dedd346abab688262b57","observation_id":"bb1fe118-e6d6-4eb4-a643-551b0be153ba","resolution":{"observed_at":"2026-08-06T04:49:44.985780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:49:45.814303Z","title":"https://api.semanticscholar.org/CorpusID:1710722","venue":null,"work_id":"6b257484-fc84-456e-b22e-00b184487532","year":2015},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:38.295335Z"},"links":{"citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:78efa86e495cd209d78efddcdd51579051a3317b044ce26a5aee8d73e8a4f647","observation_id":"ea88ecab-50cd-4258-909f-1cbeec8dc364","resolution":{"observed_at":"2026-08-06T04:49:45.879225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-04T15:53:11.168523Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-06T04:49:39.159644Z","title":"https://api.semanticscholar.org/CorpusID: 270559556","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:39.159644Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:3a5dcff4c680904b003b261d4b8a4455848cda3aecdf2b2ae5874a74e76a9538","observation_id":"7d166b95-e89a-4822-9a73-8309863d4e2a","resolution":{"observed_at":"2026-08-06T04:49:39.159644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":44,"verified_exact":4,"verified_fuzzy":2},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2508.03039."}