{"as_of":"2026-08-14T18:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20ba0a78283b1af931fd808dd904f194a01bfc8b95d4489de225f0ec0bf2b713","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:13:21.347468Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08315/citation-record","integrity":"/paper/2608.08315/integrity","json":"/paper/2608.08315/citation-record.json","paper":"/paper/2608.08315"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.586017Z","title":"Qwen2.5- vl technical report, 2025","venue":null,"work_id":"147d293c-6444-42e1-97ec-4a9626e22eb0","year":2025},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.253804Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:9f5f23ac83a88edf42670a7c79085c38fe636f272d54c54fd13a61ef9db30dec","observation_id":"f4370455-d3a7-44e6-8ffb-555f24acd836","resolution":{"observed_at":"2026-08-12T00:13:21.589225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-08-12T14:25:01.260850Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-08-12T00:13:21.258076Z","title":"Timemarker: A versatile video-llm for long and short video understanding with supe- rior temporal localization ability.arXiv preprint arXiv:2411.18211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.258076Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:9ea7cd6c7f65aeabda6260be85e054f5c5a20280b1e669328d142b093396f2d4","observation_id":"146a1edd-ebc8-47b1-a4ea-c5942015e36f","resolution":{"observed_at":"2026-08-12T00:13:21.258076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-12T00:13:21.261525Z","title":"Expanding perfor- mance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.261525Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:5723d8c23ed24069f451c54c45c2923185965cbd23d423207bd9c8c0a508a257","observation_id":"4a9cfc4a-82d4-496a-98c0-3b559f30bb01","resolution":{"observed_at":"2026-08-12T00:13:21.261525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.578862Z","title":"Internvl: Scal- ing up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"6ffca95b-85cd-43d5-9316-4e548f9aafa3","year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.265158Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:08d5fd430d1bf9322832e1b2207f81e71abe4e050b39ffe5faecd47fefb5c04f","observation_id":"7c4f7b43-953f-41cb-b3d1-2fd87e90130e","resolution":{"observed_at":"2026-08-12T00:13:21.581225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.572438Z","title":"Boundary-aware temporal dy- namic pseudo-supervision pairs generation for zero- shot natural language video localization","venue":null,"work_id":"1901183b-46c9-49f6-b154-3c6fc3e3f405","year":2025},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.268591Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:b70904ae9538057a909937cab2c04fd8bfc97eab3d442654d4105496e5b5583f","observation_id":"8c9ad2b7-a9c9-4fa9-8386-d75a6fd866a8","resolution":{"observed_at":"2026-08-12T00:13:21.574994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14206","last_updated":"2024-09-12T02:57:07Z","snapshot_observed_at":"2026-08-14T09:06:23.960112Z","submitted_at":"2023-12-21T08:15:02Z","title":"LLM4VG: Large Language Models Evaluation for Video Grounding","version":3},"cited_work":{"arxiv_id":"2312.14206","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.14206","snapshot_observed_at":"2026-08-12T00:13:21.389445Z","title":"LLM4VG: Large Language Models Evaluation for Video Grounding","venue":"cs.CV","work_id":"ab030f07-ac9a-49ff-9431-5b4c4a0687e7","year":2023},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.271751Z"},"links":{"cited_paper":"/paper/2312.14206","citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:299544b1787d6c7315d6a1adef9b1de326697faa60e14e697b32cd3d2a58c607","observation_id":"25ff8519-019a-4240-b7d4-79f9b0359976","resolution":{"observed_at":"2026-08-12T00:13:21.393747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.566037Z","title":"Tall: Temporal activity localization via lan- guage query","venue":null,"work_id":"918ec7cf-515b-4886-8d59-e20a9beeac2f","year":2017},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.274688Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:96044fc68a3eb3b169de775b34efb404b012eb416b280e0bb6e195ee5a331614","observation_id":"3d808a60-3431-49c2-96cd-e5e1dc81cd1d","resolution":{"observed_at":"2026-08-12T00:13:21.568316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05643","last_updated":"2025-03-03T10:28:30Z","snapshot_observed_at":"2026-08-12T22:28:35.821384Z","submitted_at":"2024-10-08T02:46:30Z","title":"TRACE: Temporal Grounding Video LLM via Causal Event Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05643","snapshot_observed_at":"2026-08-12T00:13:21.276988Z","title":"Trace: Temporal grounding video llm via causal event modeling.arXiv preprint arXiv:2410.05643, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.276988Z"},"links":{"cited_paper":"/paper/2410.05643","citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:4c0944ac29d669dd65df8ac5a181eea02a51c215bccd8d1562d3126164a651f3","observation_id":"0f191f38-52b1-4434-b46c-e62bf6de952e","resolution":{"observed_at":"2026-08-12T00:13:21.276988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.557651Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video tempo- ral grounding","venue":null,"work_id":"f23aac16-97ad-45f4-9780-957c053a739e","year":2025},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.279537Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:c2309aa5475e081bff23b985019ab58a8d2ba122e0a7c9fa2d1a3b54120a2244","observation_id":"d5422887-5c32-4b3b-8138-2da02352894b","resolution":{"observed_at":"2026-08-12T00:13:21.559870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.550438Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"cf3dbf45-d165-4876-aedf-87b641d2b3c8","year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.281916Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:9339eeb7199c0411e6874c0c77ff6b5bf2855428c2f0a7c09dead35faabd9677","observation_id":"b8136e6d-ccd2-421c-9180-22b306431425","resolution":{"observed_at":"2026-08-12T00:13:21.552649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.542475Z","title":"Lita: Language instructed temporal- localization assistant","venue":null,"work_id":"5e4d31f1-9494-4e3c-afd6-bf2cb0c0cc1b","year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.284282Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:a3fe59d7d43675bddffde8395f1666ae9c288eb84866b0089d58613cec201355","observation_id":"e05c93c2-24b4-493e-a89a-b9ec01d698c6","resolution":{"observed_at":"2026-08-12T00:13:21.545557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.536272Z","title":"Granalign: Granularity-aware alignment framework for zero-shot video moment retrieval","venue":null,"work_id":"55e74bfc-658e-47ab-a60d-2cdd5f0ed4b7","year":2026},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.286692Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:553e0fcc671b06bb9a2926995b9f310b7cb0bbd3a55ebf05e0ea5b94a4cce3d3","observation_id":"b9058860-27a5-40de-84f5-1693d13c0303","resolution":{"observed_at":"2026-08-12T00:13:21.539170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.529625Z","title":"Dense-captioning events in videos","venue":null,"work_id":"006791f9-e40d-4ac7-acac-4e0d1820ce60","year":2017},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.289607Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:be4b84be54842a36bc0b3d131b94766c6d0f5df79ccdb64a0e4a7e35f23b0001","observation_id":"c1368278-c94c-4acb-91a6-878ca53e7f30","resolution":{"observed_at":"2026-08-12T00:13:21.531984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09664","snapshot_observed_at":"2026-08-12T00:13:21.291693Z","title":"Se- mantic uncertainty: Linguistic invariances for uncer- tainty estimation in natural language generation.arXiv preprint arXiv:2302.09664, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.291693Z"},"links":{"cited_paper":"/paper/2302.09664","citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:1828bd77635548ef8022fe2a30d95bd6528baa7a63132b81dabf03869f0f1d5c","observation_id":"174a74fd-7cd0-4e71-b284-ec27f283b44b","resolution":{"observed_at":"2026-08-12T00:13:21.291693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.523359Z","title":"Detecting moments and highlights in videos via natural language queries.Advances in Neural Information Processing Systems, 34:11846–11858, 2021","venue":null,"work_id":"5490023f-0d6f-448a-80b4-ae5655cba254","year":2021},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.294459Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:f58a1cf74b7ef9b0dbd4c0525b580fc1d87fafad551170698038ee3bfde826ca","observation_id":"7c462f85-4c67-4865-8d8a-f8b8a7f655ab","resolution":{"observed_at":"2026-08-12T00:13:21.525896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-12T00:13:21.297865Z","title":"Videochat-flash: Hi- erarchical compression for long-context video model- ing.arXiv preprint arXiv:2501.00574, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.297865Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:a9bf41a04870526914a5b7777ceea637311e96f674083a03886dc5a245904a1d","observation_id":"b8e0bcb6-93c9-40c2-8b3f-4bfb5f079b1c","resolution":{"observed_at":"2026-08-12T00:13:21.297865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.517308Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":"0d5add7b-63ba-4a48-b0c7-135f34418ba0","year":2023},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.301248Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:408f4b62b41b6066c4c5828f348e43394bc4e00c3f975097683afab207b1e2da","observation_id":"ec53043a-a89c-4557-88d9-a23810dec103","resolution":{"observed_at":"2026-08-12T00:13:21.519760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.509779Z","title":"Univer- sal video temporal grounding with generative multi- modal large language models.Advances in Neu- ral Information Processing Systems, 38:64426–64455,","venue":null,"work_id":"559c040f-785b-4c4a-8f9c-12fc4af2bd28","year":null},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.303852Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:fad1e9353576319b397bc73fa74d8f4234efc52007c2d042d29d39648622b711","observation_id":"c13c99db-45be-439b-9235-2d83cba45546","resolution":{"observed_at":"2026-08-12T00:13:21.512260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.503387Z","title":"Univtg: Towards unified video-language temporal grounding","venue":null,"work_id":"7e01e96d-756c-4e9d-99fe-ee6d6f66bacf","year":2023},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.307010Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:7d1f7bc84acefa10c85e1628155c69f7ed43aaa46275e4057386f85d49db4017","observation_id":"cceff855-71e5-4e6f-ba9a-1e0a21bb342e","resolution":{"observed_at":"2026-08-12T00:13:21.505691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.496296Z","title":"Enrich and detect: Video temporal ground- ing with multimodal llms","venue":null,"work_id":"1de93af4-85da-4854-a924-08bf34622a8f","year":2025},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.309691Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:16a6bb6d87cd664f77e04c23fdbbc96ae45e5738f2a75373635331bfa25336f1","observation_id":"c5d0fda9-42bf-4b91-8434-d9b5c817af67","resolution":{"observed_at":"2026-08-12T00:13:21.499354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-13T04:16:52.837049Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-12T00:13:21.312072Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning.arXiv preprint arXiv:2402.11435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.312072Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:1f833775402d423ba2730d60033f895e5f5c75cac9524b0c164ba5621742a213","observation_id":"1b6e6aad-a810-4233-808d-653eef6b5a3e","resolution":{"observed_at":"2026-08-12T00:13:21.312072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.489912Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":"c2339df9-ea67-4bbf-ba03-9579efa8d6b5","year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.315811Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:cd320235a69f1c53bfbb1be5317aa78768c9e781dcd9afccc6841dbc2fefa9cf","observation_id":"54dbf097-00f9-4d99-931e-a7969e1afc02","resolution":{"observed_at":"2026-08-12T00:13:21.492610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.483557Z","title":"Grounding action descriptions in videos","venue":null,"work_id":"efae5851-856c-4994-81be-4b04e03e0169","year":2013},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.318869Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:d59973d2ca520cd8ada528cf28ba3252934fa587f5cfca7f0f1d02fb209c5987","observation_id":"8887fdb5-cfa2-4fda-a68d-ecd742e93200","resolution":{"observed_at":"2026-08-12T00:13:21.486131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.475493Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"2ad54a32-2640-4c0e-b334-978196720e1f","year":null},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.321052Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:0f4e7231154bb33562436c6362f07a3e01298912721410941db3546b8f7267ad","observation_id":"1f43cfb5-22ef-4a9d-b78e-a86fdb398536","resolution":{"observed_at":"2026-08-12T00:13:21.478275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-14T08:19:36.723497Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-12T00:13:21.323847Z","title":"Hawkeye: Train- ing video-text llms for grounding text in videos.arXiv preprint arXiv:2403.10228, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.323847Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:c610fd75425f71aa9076299b6870ea9fc630195746b721c5cf1e899c040b1c48","observation_id":"2f283da1-a739-4f44-bc42-ef5ab8393b3d","resolution":{"observed_at":"2026-08-12T00:13:21.323847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.468823Z","title":"Time-r1: Post- training large vision language model for temporal video grounding.Advances in Neural Information Processing Systems, 38:83330–83364, 2026","venue":null,"work_id":"317b5898-7fcc-4516-9940-8c58d0937ba5","year":2026},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.327744Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:d23813c5c8a77eaae8f1f09ca796434813f1f7bf40d43442b27d54bddf041716","observation_id":"4db2ec45-81ae-4ab3-8a3e-da7b3f6d7a18","resolution":{"observed_at":"2026-08-12T00:13:21.471445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.459204Z","title":"Negative sample matters: A renais- sance of metric learning for temporal grounding","venue":null,"work_id":"4ffc39a5-6127-4ef3-928b-eab269ebd27b","year":2022},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.330603Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:8be6f1788f20c3ad8804809cdefd832b0d84bc8b3acff4efe0db29919d8759ad","observation_id":"424deaef-f576-41d1-a14b-3f8be6894ee3","resolution":{"observed_at":"2026-08-12T00:13:21.461997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.451800Z","title":"Zero-shot video moment retrieval via off-the-shelf multimodal large language models","venue":null,"work_id":"7015f0b4-cce2-4cd7-9e5e-5985cf3cf93a","year":2025},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.333073Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:c33598c660de645a52b80c5b2c4dc89f00869c92c96c81b475369e7e13cf274b","observation_id":"459ba1b0-6648-4086-b995-81b0cb4d3965","resolution":{"observed_at":"2026-08-12T00:13:21.455408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.443832Z","title":"mplug-owl3: Towards long image-sequence under- standing in multi-modal large language models","venue":null,"work_id":"3b46a5f5-10d9-4240-9d30-da9423b4fd7f","year":2025},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.337075Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:1cc8f3852a503bd491abeda005b29c9391dc97be93e9a48af3b803e5fe40e44d","observation_id":"d00a842c-ee51-438b-bfdf-71fdd08c529f","resolution":{"observed_at":"2026-08-12T00:13:21.446819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.435775Z","title":"Time- suite: Improving mllms for long video understanding via grounded tuning","venue":null,"work_id":"effadf6b-395b-4064-85a2-0abfdd4df83d","year":2025},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.339324Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:61a64fa063e9422fed363459fd3398a4891d1a52477a82996b08ae6cb8ba2eb3","observation_id":"f34c7a9e-e391-49f7-8284-507e939154c6","resolution":{"observed_at":"2026-08-12T00:13:21.439383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.428360Z","title":"Learning 2d temporal adjacent networks for moment localization with natural language","venue":null,"work_id":"19f4ad2f-064e-43f6-af69-f0d97084e57d","year":2020},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.342199Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:6414de37c6285a35ac1f9562e2b4b3b4cee63ebd1d84ac7a9bd797b029b25463","observation_id":"1b962534-b04a-4556-9197-c589b18447ef","resolution":{"observed_at":"2026-08-12T00:13:21.431453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.420070Z","title":"Llava-next: A strong zero-shot video under- standing model, 2024","venue":null,"work_id":"4eb6f622-a387-44c7-9188-0f47b0994436","year":2024},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.344662Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:0ce6c8de9390e735b2a9b161509f5c613b3fcee2b255a14037c1574481abed91","observation_id":"2a6ce923-819b-48ab-8fa0-aec4c9694cec","resolution":{"observed_at":"2026-08-12T00:13:21.423606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:13:21.409963Z","title":"Omnivtg: A large-scale dataset and training paradigm for open-world video tempo- ral grounding","venue":null,"work_id":"b8a3c21d-a7b9-4ef8-bc90-afb4cc26d736","year":2026},"citing_paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:13:21.347468Z"},"links":{"citing_paper":"/paper/2608.08315"},"observation_digest":"sha256:9216378b0708101570c80bb0974badf0158341dca39e29b74c776b0d89612ec5","observation_id":"e3804e84-edea-41ef-8d6e-478db517e334","resolution":{"observed_at":"2026-08-12T00:13:21.413332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.08315","last_updated":"2026-08-08T19:57:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T23:30:12.248979Z","submitted_at":"2026-08-08T19:57:47Z","title":"Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2608.08315."}