{"as_of":"2026-08-15T10:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2b0206e9098392cff0f589d4de23457f7efdd7d0f244a839fddeed7adfcb0bc","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:51:17.742891Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:32:17.962997Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T23:32:18.789296Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"cited_work":{"arxiv_id":"2411.14901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14901","snapshot_observed_at":"2026-08-05T23:32:18.789296Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","venue":"cs.CV","work_id":"6bb1843a-d934-400d-9754-31a72c8c15e8","year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.962997Z"},"links":{"cited_paper":"/paper/2411.14901","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:0bf5ba80a1b771f6d6d49d3bdefd8c3b2e76aad2ea144ca3faa9b7f0e91bbc9d","observation_id":"fbe52eca-4221-4173-a058-749e81744064","resolution":{"observed_at":"2026-08-05T23:32:18.794543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14901/citation-record","integrity":"/paper/2411.14901/integrity","json":"/paper/2411.14901/citation-record.json","paper":"/paper/2411.14901"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.629203Z","title":"needle in a haystack","venue":null,"work_id":"b7940a77-2552-44d8-9b16-72c3b10ccc82","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.480428Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:96adf53d858951d8b105d24e71c011d764cbb723647b886a7be8d817b5fd2f08","observation_id":"f6de1641-e8d3-49f1-9180-66134e2807f3","resolution":{"observed_at":"2026-08-12T14:51:18.633581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.485527Z","title":"needle in a haystack","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.485527Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:d945f07abd427fdd817bc97362809a40b7bddf355d15f10f3498a0972932e2b9","observation_id":"14f8428d-d7b1-4c95-9845-40a18e4758a1","resolution":{"observed_at":"2026-08-12T14:51:17.485527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.617415Z","title":"https://sharegpt.com/","venue":null,"work_id":"15437662-b79a-41cf-b00e-e8940d2687de","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.489695Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:cf98b23b9a47b8cb1a8a64436b2bed6a19133b161b10553849126b1026f2d845","observation_id":"932cbd73-d287-489b-86e0-771313651af9","resolution":{"observed_at":"2026-08-12T14:51:18.621707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.606071Z","title":"https://github.com/gkamradt/LLMTest_ NeedleInAHaystack","venue":null,"work_id":"d3854378-d0ea-4981-8868-2ab8b2043307","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.493940Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:41f2d3e71c28a80991aa8164add1995d9a9d0304e50e0c2527e121f0d646ad70","observation_id":"2494fcf0-7316-44fd-8728-03845a06f407","resolution":{"observed_at":"2026-08-12T14:51:18.610355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.594189Z","title":"Lo- calizing moments in long video via multimodal guidance","venue":null,"work_id":"624cd2c2-5690-4725-9499-c62f8ba24d47","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.497775Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:d960d83137872c171c3395ca2204b12f241a4851b0c56ae9dfe3f7ada9b5d791","observation_id":"514194ae-6741-4e06-b166-858bb214e022","resolution":{"observed_at":"2026-08-12T14:51:18.598205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.582555Z","title":"Functional brain organization of preparatory attentional control in visual search","venue":null,"work_id":"66d6df9e-d294-4ca0-ba18-3d47368b3b75","year":2013},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.501746Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:bf7a2681a4069c202e6cef6c5e6440d508ec22752ca3c4407ebe788952f2341c","observation_id":"70c6f739-fbc3-4dfb-9a5b-18bf90ef7e20","resolution":{"observed_at":"2026-08-12T14:51:18.586723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.505724Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.505724Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:a3af36a7db12c13a00dd30f98f5c9ad919261d56346235e88a382fc67996439d","observation_id":"c3a58dae-6d8d-4df8-9152-0553858fa38f","resolution":{"observed_at":"2026-08-12T14:51:17.505724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-13T11:37:00.458654Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-12T14:51:17.509494Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.509494Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:eba85e218e829c274e6c6c6033f64d0ee73929887eac1b695f5b87206334d113","observation_id":"f6a37a7e-6852-4567-ba07-10d991286069","resolution":{"observed_at":"2026-08-12T14:51:17.509494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.563122Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"2e0d38ce-e7a2-4c27-bf7d-0bffdfbe9251","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.513431Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:8aa2717bc342436b10c94e3a167f16dc1eba0a8761f5d49e26452443483e0f49","observation_id":"b8ee4b52-d852-41af-b32a-ee00329f0aad","resolution":{"observed_at":"2026-08-12T14:51:18.567451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.551924Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding, 2019","venue":null,"work_id":"da14be62-14ae-48e4-a4d8-605a2daabeb8","year":2019},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.516640Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:9fb2b740792d3e260bc2b316d8533125cae113be88881b201462adad12ee1f47","observation_id":"8425f23a-9f25-42db-b812-904a74ca0259","resolution":{"observed_at":"2026-08-12T14:51:18.556051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.539363Z","title":"Uatvr: Uncertainty-adaptive text-video retrieval,","venue":null,"work_id":"b17d0fce-819e-4366-b301-73c1bba8fd30","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.519848Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:66b46d71b61bdb8a32321f07f0cf405fba438defca69156f59ec77c15d67cc97","observation_id":"7bfc6ce1-d9db-4510-b89a-3b9e40b894c4","resolution":{"observed_at":"2026-08-12T14:51:18.543891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.527883Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":"bcdfebfc-fc4c-4d5b-8e06-1ed75a0f7355","year":2020},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.523083Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:a3d83d947b7bf124a9f53374637939a8143ffb594f497bb6ac407c21ce18c14d","observation_id":"b54cee9a-901a-4e69-b862-fad754abe3e1","resolution":{"observed_at":"2026-08-12T14:51:18.531878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08640","last_updated":"2023-06-28T05:00:35Z","snapshot_observed_at":"2026-08-13T11:17:16.685240Z","submitted_at":"2023-06-14T17:12:56Z","title":"AssistGPT: A General Multi-modal Assistant that can Plan, Execute, Inspect, and Learn","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08640","snapshot_observed_at":"2026-08-12T14:51:17.526246Z","title":"Assistgpt: A gen- eral multi-modal assistant that can plan, execute, inspect, and learn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.526246Z"},"links":{"cited_paper":"/paper/2306.08640","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:899efae49eff9a20965695366f80fdfbfa27952f16d4c1327a23d9d47b1e5a09","observation_id":"d59df371-f9dc-4faf-9877-95bd9c219341","resolution":{"observed_at":"2026-08-12T14:51:17.526246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.516308Z","title":"X-pool: Cross-modal language-video attention for text- video retrieval, 2022","venue":null,"work_id":"16be3a6e-20e2-4e69-b204-2f9a3571b756","year":2022},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.529565Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:67c7af30b7de52176afe73bfdb017c76ee5434310b0c629a49fb85eda0efe726","observation_id":"c23fb26c-f5c4-464b-8e35-9534ba353132","resolution":{"observed_at":"2026-08-12T14:51:18.520335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06729","last_updated":"2024-07-13T10:21:14Z","snapshot_observed_at":"2026-08-15T06:44:07.356635Z","submitted_at":"2023-12-11T09:12:35Z","title":"RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos","version":3},"cited_work":{"arxiv_id":"2312.06729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06729","snapshot_observed_at":"2026-08-12T14:51:18.040109Z","title":"RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos","venue":"cs.CV","work_id":"a7f08b73-b248-4ee4-864e-cb30fdd1be1e","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.532531Z"},"links":{"cited_paper":"/paper/2312.06729","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:849dd37a9bc3a5b2578c8ee372182d35915f53459603424e674d7c8564950bc7","observation_id":"bc23c703-d543-4919-8f23-5065e7fcfed0","resolution":{"observed_at":"2026-08-12T14:51:18.046182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10918","last_updated":"2023-05-30T02:03:34Z","snapshot_observed_at":"2026-08-13T14:21:49.627870Z","submitted_at":"2022-09-22T10:58:42Z","title":"CONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10918","snapshot_observed_at":"2026-08-12T14:51:17.536220Z","title":"Cone: An efficient coarse-to-fine alignment frame- work for long video temporal grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.536220Z"},"links":{"cited_paper":"/paper/2209.10918","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:557dd2398bc114d8ae0f7de46c5b2859f18489c2a0fefbed434711d94e0ad58f","observation_id":"255d90f0-9d27-4813-ad21-2f1b032353c9","resolution":{"observed_at":"2026-08-12T14:51:17.536220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T14:51:17.539848Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.539848Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:2f6066efed4578740668b2caa9d16e4a3a131242924d595310776f58dc9b7988","observation_id":"4395324c-3dd4-4766-adfa-b8ea1ccf4037","resolution":{"observed_at":"2026-08-12T14:51:17.539848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.505435Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"22eeb375-7928-4549-bfe6-33d71b5ef869","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.543649Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:34004cb0aa334596a042e910d8140ff0f70173d9167bc2c892b7a6cf041d195a","observation_id":"857ffaaa-1626-4923-8342-37e56075e9d4","resolution":{"observed_at":"2026-08-12T14:51:18.509395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19046","last_updated":"2024-03-27T22:50:48Z","snapshot_observed_at":"2026-08-13T00:43:26.044820Z","submitted_at":"2024-03-27T22:50:48Z","title":"LITA: Language Instructed Temporal-Localization Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19046","snapshot_observed_at":"2026-08-12T14:51:17.547199Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.547199Z"},"links":{"cited_paper":"/paper/2403.19046","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:45bddd52f967a37fb5b0f71471b4f37728e121be0d20fd7637d339562580b00c","observation_id":"5760acec-746b-45f6-bfbc-d5a67ef8412f","resolution":{"observed_at":"2026-08-12T14:51:17.547199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.494481Z","title":"Audio- enhanced text-to-video retrieval using text-conditioned fea- ture alignment, 2023","venue":null,"work_id":"0ee068b3-ae3b-4ec3-b18e-5392b9a21021","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.551108Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:651fb48e0496d9c3f52d2f74bdec6522f64c26aeaeefeaecdaa9b08ec523925b","observation_id":"6e092eaf-b30b-4139-ac67-d61fcb73725d","resolution":{"observed_at":"2026-08-12T14:51:18.498330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.483570Z","title":"Efficient long- text understanding with short-text models","venue":null,"work_id":"ad01fc28-9e40-4281-862f-5692f39f5595","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.554425Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:35870c806c44dddc6fab180a461362cf43f5951fdeb00f4f7b6ff465450d4fa6","observation_id":"5fdfe32c-e0ae-4d09-97d9-3009ec7483f9","resolution":{"observed_at":"2026-08-12T14:51:18.487239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.472926Z","title":"Diffusionret: Generative text-video retrieval with diffusion model, 2023","venue":null,"work_id":"839e5762-84da-4904-baf6-4697bd55216f","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.557860Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:af81fd617a5ab6db21f54b1bf4e109fb6ac18bb96f7d11d078bbb328d2bdc042","observation_id":"859ddc87-c4f6-4c55-a492-ae3650642b4b","resolution":{"observed_at":"2026-08-12T14:51:18.476521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.561282Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.561282Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:0116015ecf70af756b01b70c59f46f6b22a2cc6746665532d2dd2a1aad6fe0bb","observation_id":"7e84c5c3-f984-47f6-8364-31ec71538ba3","resolution":{"observed_at":"2026-08-12T14:51:17.561282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08391","last_updated":"2025-08-17T19:28:05Z","snapshot_observed_at":"2026-08-13T07:15:24.765895Z","submitted_at":"2024-06-12T16:41:31Z","title":"Large Language Models Must Be Taught to Know What They Don't Know","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08391","snapshot_observed_at":"2026-08-12T14:51:17.565722Z","title":"Large language models must be taught to know what they don’t know","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.565722Z"},"links":{"cited_paper":"/paper/2406.08391","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:2985d57d64df1b249e3b1dd0ab6b724a581492fa836d372e941aba2f03cac8c1","observation_id":"f31af705-9116-4cde-8097-d2707e6b1939","resolution":{"observed_at":"2026-08-12T14:51:17.565722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14418","last_updated":"2024-02-24T12:30:40Z","snapshot_observed_at":"2026-08-14T06:00:08.214073Z","submitted_at":"2024-02-22T10:04:17Z","title":"Uncertainty-Aware Evaluation for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14418","snapshot_observed_at":"2026-08-12T14:51:17.569740Z","title":"Uncertainty-aware evaluation for vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.569740Z"},"links":{"cited_paper":"/paper/2402.14418","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:11b63bca13ec0afa1eee8131845cf8b78b42b229e1332e1a26e392814628ae6f","observation_id":"4f91482b-c689-4763-a06a-5d7a9054805b","resolution":{"observed_at":"2026-08-12T14:51:17.569740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.455107Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"383d3194-26a1-4734-bd9e-d0980af4e499","year":2021},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.574528Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:20a207cd09c48a93ac4ef750b6ae6f2d63284ce0eee8b3430355dc6e87442f59","observation_id":"1793bfdc-bdeb-44ae-980b-102e7a7189f6","resolution":{"observed_at":"2026-08-12T14:51:18.459089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.578279Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.578279Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:91958b38f9e641b5d498cbf43b0c1a620544a41f3e2ff33e308ffa2e88ca2ada","observation_id":"46ec3526-134e-46ce-bf8d-cdbd49dce8be","resolution":{"observed_at":"2026-08-12T14:51:17.578279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-12T14:51:17.582466Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.582466Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:511c84ac224464ecefea8248f9fba7c4e1f39d0e6e921ccfd7e80819f2021175","observation_id":"76d82182-d59a-49bd-8510-a33aeb440e24","resolution":{"observed_at":"2026-08-12T14:51:17.582466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.437541Z","title":"Ground- inggpt: Language enhanced multi-modal grounding model","venue":null,"work_id":"7de0f541-6b51-4cb8-a1a4-a54a28260987","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.586499Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:bd0ff6c41df8f32aff7db4ac5dd47b50b8319b036a7a679947d4ecba992c56d2","observation_id":"2eb60991-0dce-4779-9f93-9019603535f1","resolution":{"observed_at":"2026-08-12T14:51:18.441298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T14:51:17.590376Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.590376Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:69c4bd69503d373a65f7890a40cff2c4e73e10bd596636a3b2aa087414412e9d","observation_id":"cd4f3baa-467a-4ef6-bce8-b42ab4540ad7","resolution":{"observed_at":"2026-08-12T14:51:17.590376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.427054Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"bc9b5f9e-4294-498d-b7e9-f27d5db4cbec","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.594249Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:a4ffe6186d312065e8a5d70385ad2566d6834fe1b3b4fa1e8c917a639618a448","observation_id":"05cbee80-bb5a-4306-b1f2-fb7b8f0f0578","resolution":{"observed_at":"2026-08-12T14:51:18.430557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T14:51:17.597917Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.597917Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:74b9c40f9697bbd28a956b70c5b6a168c9e4c1beaccfa45646aae9a0ce0a8f5c","observation_id":"39bb5fd4-231b-40aa-a575-3eb309801b08","resolution":{"observed_at":"2026-08-12T14:51:17.597917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00383","last_updated":"2022-09-05T12:27:07Z","snapshot_observed_at":"2026-08-13T15:12:43.563300Z","submitted_at":"2022-07-01T12:48:35Z","title":"ReLER@ZJU-Alibaba Submission to the Ego4D Natural Language Queries Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00383","snapshot_observed_at":"2026-08-12T14:51:17.602209Z","title":"Reler@ zju-alibaba submission to the ego4d natural language queries challenge 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.602209Z"},"links":{"cited_paper":"/paper/2207.00383","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:979fb431e8deb4141fc640da80aabf7c0c5fb22fc545f263d2f3a55877fb1871","observation_id":"34c89be5-11c2-4918-a3c3-3aba6a6ddf88","resolution":{"observed_at":"2026-08-12T14:51:17.602209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-12T14:51:17.605648Z","title":"Lost in the middle: How language models use long contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.605648Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:cc45c7eaf10c2b0bc7763f6d5f47b55576dfd68c8ea9a3ce0fa127ef99b58043","observation_id":"96bdaf0f-68b8-4ce2-b281-74fd7486bc94","resolution":{"observed_at":"2026-08-12T14:51:17.605648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.416715Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"1402b925-525b-4ca2-9c7e-0c24235d86ec","year":2022},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.609270Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:572d75b5a1b769a80462c082804ba82d81521fd78f30f3c9e7d311defdad320c","observation_id":"353f11b3-9fc8-4847-b641-021352ca4cbd","resolution":{"observed_at":"2026-08-12T14:51:18.420410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.405244Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":"c0e6ab59-9f89-47a8-a82b-cea5aff89306","year":2019},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.612626Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:f188d69b1a3b91731e47339309b3d88677118cae179aed93c2ee37e4839ca709","observation_id":"ab253223-2440-4d2e-9dcf-5f41221f69d6","resolution":{"observed_at":"2026-08-12T14:51:18.409303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T14:51:17.615743Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.615743Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:29488089f01fc1af44a2d59ea973b48e36f72f791ceca6a59658be7aba24d2e9","observation_id":"37251822-9afd-464b-9f2f-b3981631e3be","resolution":{"observed_at":"2026-08-12T14:51:17.615743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.394004Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection","venue":null,"work_id":"118115b4-f833-4ae7-bcf4-4ed43c632061","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.618988Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:c381398c1590aeba4dfcecf26ec1960bc432df9771f97278160208983362c03b","observation_id":"19ff04d7-30bc-4f41-b283-d45d25fb7c41","resolution":{"observed_at":"2026-08-12T14:51:18.397946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.382973Z","title":"Snag: Scalable and accurate video grounding","venue":null,"work_id":"673e909f-f059-40f7-81e6-a5dba3dcac75","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.622614Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:cd940123aef22cd59da161e8618199ac0dc690f603d1cd7178b9a0fbf117c1d3","observation_id":"ebb83402-3994-44ec-9a7b-18b8f6713bf9","resolution":{"observed_at":"2026-08-12T14:51:18.386923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01723","last_updated":"2024-11-07T06:25:25Z","snapshot_observed_at":"2026-08-13T05:33:40.552198Z","submitted_at":"2023-11-03T05:41:25Z","title":"Towards Calibrated Robust Fine-Tuning of Vision-Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01723","snapshot_observed_at":"2026-08-12T14:51:17.626259Z","title":"To- wards calibrated robust fine-tuning of vision-language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.626259Z"},"links":{"cited_paper":"/paper/2311.01723","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:c2e77f983309b9bc7e200582ef824d0f5b6009fba47dc8775a1c4ccd4a36b30a","observation_id":"68f00f37-6ea9-412c-aede-02cffb35ab00","resolution":{"observed_at":"2026-08-12T14:51:17.626259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.371812Z","title":"Obtaining well calibrated probabilities using bayesian binning","venue":null,"work_id":"6e2e056d-47bc-47fe-9b2f-c739740c4598","year":2015},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.630348Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:eda0b23c5cd43a2c0351a6cb381ce50c85664f88ca52de374e8f7e0fd4272575","observation_id":"2d85814d-1246-4674-b31f-fe6f5d6d28f6","resolution":{"observed_at":"2026-08-12T14:51:18.375813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08345","last_updated":"2023-03-22T12:41:03Z","snapshot_observed_at":"2026-08-13T12:24:27.310694Z","submitted_at":"2023-03-15T03:54:43Z","title":"Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08345","snapshot_observed_at":"2026-08-12T14:51:17.634152Z","title":"Scanning only once: An end-to-end framework for fast temporal grounding in long videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.634152Z"},"links":{"cited_paper":"/paper/2303.08345","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:cef9680e7b4d41632d9fdd8f0024d270fab3526c9d8b709cfc4aaa2b3501a66f","observation_id":"8c9c6ddd-4e66-4dc0-bd29-dfb737e37993","resolution":{"observed_at":"2026-08-12T14:51:17.634152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.358974Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning, 2024","venue":null,"work_id":"73e6a416-19e3-4f12-a82f-ba7560a3f7b6","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.638044Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:236180cddc0bca178c378f5ba0a52a086aac5acb892f463369c44e73ce0e13ef","observation_id":"f894d7f6-1da3-4fff-8285-c0f3687dff1e","resolution":{"observed_at":"2026-08-12T14:51:18.363249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.347072Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":"8f2ba83d-2fbf-469a-8d0b-faf0dd466698","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.641966Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:b46788e67c0c05ddc6391c7d1d1b355577e4763fc27c5b5d9d61b1f999296093","observation_id":"385ffb20-aa04-4efe-9481-fc8712c9a1ea","resolution":{"observed_at":"2026-08-12T14:51:18.351289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.335141Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"25419fb6-a196-4bfc-865e-b19919a76064","year":2021},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.645735Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:24f660b72b978f5789c5471d42b14c55d8ca9b03f0a76953ffdf8951cbbef281","observation_id":"369d7e0f-0aba-4b96-8864-7d0504029881","resolution":{"observed_at":"2026-08-12T14:51:18.339416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.323397Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"cf979dc5-ad86-40b1-bbdf-1a5b016ee9a0","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.649213Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:3bf30188cd1fa4ef98ada5b3f1439823067accc4a8ddaa784ac0fa3cabe11344","observation_id":"bd3e9ee6-103f-49aa-92b8-11e2a1e79dad","resolution":{"observed_at":"2026-08-12T14:51:18.327828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.311392Z","title":"Vlg-net: Video-language graph matching network for video grounding","venue":null,"work_id":"a427d44e-86c9-4140-a111-66cb411a0fc0","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.652731Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:40648b966b111af2e9afff39531d1727900e677ea33fe0d63d4d95573da4ca32","observation_id":"fa1786fc-b54f-462c-9a64-d3e8d146a890","resolution":{"observed_at":"2026-08-12T14:51:18.315273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.656723Z","title":"Mad: A scalable dataset for language grounding in videos from movie audio descriptions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.656723Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:6ae92cc6579f1a1447821f3c1377f369a69b91384503e9e50c9bc9d0781675c9","observation_id":"3cb809b6-898d-4661-918b-d83729b0dc55","resolution":{"observed_at":"2026-08-12T14:51:17.656723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.660574Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.660574Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:5d5ab7299384687e1316b50c7ebeb4fef74167a13f24676645c28d63275a20f2","observation_id":"961da660-c1f6-4d3b-9626-7d6cb1786d99","resolution":{"observed_at":"2026-08-12T14:51:17.660574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.664377Z","title":"Avicuna: Audio-visual llm with interleaver and context- boundary alignment for temporal referential dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.664377Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:0e46e82675253e41ce5a1d964ec3deb162a00f8f82f0fa890dafeb5e447e68e3","observation_id":"e7322f6a-c423-4ba0-b032-eb1cf4246819","resolution":{"observed_at":"2026-08-12T14:51:17.664377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T14:51:17.667958Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.667958Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:b8abd6c3a447ec79630a35dd5298eb380de989e28cce076b00287cd05cfd0a34","observation_id":"ec48ea8d-2526-42e0-8254-dd4948a38cd6","resolution":{"observed_at":"2026-08-12T14:51:17.667958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-08-15T03:51:01.860241Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-12T14:51:17.672191Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understand- ing system","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.672191Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:2b5d704b941c381b776e1ed29a1d531204a535db2634e73d037eca1028a8f73d","observation_id":"65b3fd40-def7-460e-bfd8-1db356291c92","resolution":{"observed_at":"2026-08-12T14:51:17.672191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.675817Z","title":"Omnivid: A generative framework for universal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.675817Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:000c0cb364d9a490e803a8be617a26da2a984047c6602a5ac1a376c5d6885925","observation_id":"a4943ab4-0d48-4b0a-9490-36a41f56a9a5","resolution":{"observed_at":"2026-08-12T14:51:17.675817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.279055Z","title":"Text is mass: Modeling as stochastic embedding for text-video retrieval, 2024","venue":null,"work_id":"ce13296e-30ec-4c22-abc2-289778d83635","year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.679428Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:7820105e3b61cf3ac938db9821fc62fd5327b1f55320fcb8cbe6a569200a2d8d","observation_id":"f34862bb-cd24-414a-b9a5-ddde6d1215ee","resolution":{"observed_at":"2026-08-12T14:51:18.283505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-14T08:19:36.723497Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-12T14:51:17.683167Z","title":"Hawkeye: Training video- text llms for grounding text in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.683167Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:23336be109d9a2b04d199ee67cfe1bf656b4bb382625a6485c312623167a8bb3","observation_id":"09b2e3e7-88b7-464a-aabb-3bfc16f0a067","resolution":{"observed_at":"2026-08-12T14:51:17.683167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.266309Z","title":"Five factors that guide attention in visual search","venue":null,"work_id":"02800ff5-4e5b-47da-9746-106adc273f05","year":2017},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.687158Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:4d6541b0a55b390726535a074071ea93d6523efa49b031e8374607ca948c5bdc","observation_id":"b96e8328-abb2-4c62-89d9-c9ad92851365","resolution":{"observed_at":"2026-08-12T14:51:18.270664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.254275Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"7ca90fbb-be81-4cb0-98bf-1a92aef1be36","year":2016},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.690819Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:e2324a9a598b9fd527056a2eb3044e2d5925eefab5994d3837daca4c12feab12","observation_id":"33b0a0e2-eeea-45ab-ba58-bc38164d8fb1","resolution":{"observed_at":"2026-08-12T14:51:18.258309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T14:51:17.695172Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.695172Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:1e8848ccfec68afa1467f47511f8515a0043c26589b53f884ca72789f950ba01","observation_id":"1a570ca5-d499-4696-9f06-b73cd1f2e861","resolution":{"observed_at":"2026-08-12T14:51:17.695172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-13T07:57:16.456717Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-12T14:51:17.699205Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.699205Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:24b96c802b2f90124e13b3c809c242c466a65ac9709f040cdae682b20c402399","observation_id":"3d11ef86-3c09-4298-adee-355fb136229e","resolution":{"observed_at":"2026-08-12T14:51:17.699205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.243029Z","title":"Clip-vip: Adapting pre- trained image-text model to video-language representation alignment","venue":null,"work_id":"67e37e37-44dc-4ef4-b6f5-f8e118b3d970","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.703027Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:8798a7171297255f8e883f2da252e9bb6b1fd87febf00423c6733e28fa54c0bd","observation_id":"9e40798d-db98-4886-944f-82aedba8fb24","resolution":{"observed_at":"2026-08-12T14:51:18.247005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.231041Z","title":"Clip-vip: Adapting pre- trained image-text model to video-language representation alignment, 2023","venue":null,"work_id":"d1bc74d6-0634-467c-ab42-c6cb9360ec2a","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.706082Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:af2079bcd7b838f8b0e850e3b8c9e2fd38dbed21bf14f92e53b0714b7468e46c","observation_id":"6290a9e5-877f-4046-b121-d32a102f6e91","resolution":{"observed_at":"2026-08-12T14:51:18.235064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.219633Z","title":"Vidchapters-7m: Video chapters at scale,","venue":null,"work_id":"d3e0a5c7-881a-424c-9dbc-f4a7b9cd3760","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.709255Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:02850efdc0326e116b7b8341732d402c3bcdb382b8058a26e0315b33b28eb555","observation_id":"39f0e8a5-21c9-470e-b485-db4f92b1617e","resolution":{"observed_at":"2026-08-12T14:51:18.223591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.207665Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":"3d223593-8079-4230-b407-8ae5b5ce535c","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.712563Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:087afdc1a849b289e0b4964d47a36f30fa12acaebba27dadf690f09f03c2d901","observation_id":"c9001ed8-d3d1-4cf2-89d8-19583cb0605e","resolution":{"observed_at":"2026-08-12T14:51:18.212240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.715867Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.715867Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:f0dc80f88c6c7dc387a562b200f90056e8beadcb9a1d1a3374e8623ca4b726f5","observation_id":"fe54dfd1-c547-4831-b9f9-96fa5c24a3a1","resolution":{"observed_at":"2026-08-12T14:51:17.715867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.718994Z","title":"A joint se- quence fusion model for video question answering and re- trieval","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.718994Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:a84ce1d9f9bf611d7597e01a3ea7cfa06ba83fa250f4fd90a7d8af72048c7e1a","observation_id":"6dc5565c-50d5-4e59-9bab-48ea7cf2f19e","resolution":{"observed_at":"2026-08-12T14:51:17.718994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:17.722170Z","title":"A sim- ple llm framework for long-range video question-answering,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.722170Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:317e35f681fd14993e44933bf946e5ac14a4d8a1b94878c08295f02188143077","observation_id":"4db7b359-bc0c-425b-8507-1cbba8219f49","resolution":{"observed_at":"2026-08-12T14:51:17.722170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13931","last_updated":"2020-06-14T08:49:07Z","snapshot_observed_at":"2026-08-13T01:07:23.856467Z","submitted_at":"2020-04-29T02:47:04Z","title":"Span-based Localizing Network for Natural Language Video Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13931","snapshot_observed_at":"2026-08-12T14:51:17.726089Z","title":"Span-based localizing network for natural language video lo- calization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.726089Z"},"links":{"cited_paper":"/paper/2004.13931","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:decd796bdb47c784dd9e86ccdef4c7b24e52d68e81c0560f28ee5a42c5853b09","observation_id":"11d10cb2-8c7c-4929-a6b0-fef46608327a","resolution":{"observed_at":"2026-08-12T14:51:17.726089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T14:51:17.730863Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.730863Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:87901ac2a483fffb80f8d2b4c9908769b1761e00ec951ba4fab8a74387a5b466","observation_id":"b79c7ce4-cf4f-45e0-be7b-fba95f2d2af5","resolution":{"observed_at":"2026-08-12T14:51:17.730863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.175425Z","title":"Learning 2d temporal adjacent networks for moment local- ization with natural language","venue":null,"work_id":"80ad4a70-2352-4b97-8fe8-5397b557bb54","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.734969Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:da1c6fa176b9e83aedcc3d5430c47aab6acd1b1ebd0ef4ae1e6671940ab6cc37","observation_id":"ed8e90c1-123a-42a6-8552-8f642f137f6f","resolution":{"observed_at":"2026-08-12T14:51:18.179532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.163059Z","title":"Learning video representations from large lan- guage models","venue":null,"work_id":"a83dff67-fce2-4ca7-87c6-cc06ef708273","year":2023},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.739263Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:6e5a02d2ad80f57a95eb0ddc09860659006149f22f47cd958a71f01b0fed0d66","observation_id":"4458d16d-b41f-4419-8d00-ddaebcc8bdbc","resolution":{"observed_at":"2026-08-12T14:51:18.167474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:51:18.150572Z","title":"<video> Does the <event> happen in the video? Answer yes or no","venue":null,"work_id":"6918c94c-d9b7-4d91-a2e6-b5d65d036ae5","year":null},"citing_paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos","version":1},"reference_index":4096,"source":"pdf_text","source_observed_at":"2026-08-12T14:51:17.742891Z"},"links":{"citing_paper":"/paper/2411.14901"},"observation_digest":"sha256:7e01b1305924ec709631c95b50dd2b23fb0fc60277889eb027d9bcb9796f1efc","observation_id":"6de24dff-be19-4a52-86a4-6078f8679cf5","resolution":{"observed_at":"2026-08-12T14:51:18.154762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14901","last_updated":"2024-11-22T12:46:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T00:26:25.703997Z","submitted_at":"2024-11-22T12:46:50Z","title":"ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":37},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 1 inbound Pith citation observation for arXiv:2411.14901."}