{"as_of":"2026-08-15T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d0afb241b42ec1e43f0c63d30b6bc024c607010d3331200474f4c9f2076a955","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:07:00.966961Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12951/citation-record","integrity":"/paper/2411.12951/integrity","json":"/paper/2411.12951/citation-record.json","paper":"/paper/2411.12951"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T17:07:00.665661Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.665661Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:84872c7b27bc5322a042506b1a086cd5fbdc33aed850f1e05870041778d755a0","observation_id":"08c990da-1e8e-4903-88b8-653ca79ca3cd","resolution":{"observed_at":"2026-08-12T17:07:00.665661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:00.670834Z","title":"The surprising effectiveness of multimodal large language models for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.670834Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:b53a4ecc772e7df9893224b643ba851b7b2c3966018c8f6e2c7fe74bf9731f66","observation_id":"b955f145-fd79-42bf-b5b4-2da3da0f60c4","resolution":{"observed_at":"2026-08-12T17:07:00.670834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.252627Z","title":"End- to-end object detection with transformers","venue":null,"work_id":"30b12b99-213a-46f3-96c2-cb43df995192","year":2020},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.675443Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:66bdd8c7c21516ef373128ce92be538d518b34b60c6ad7a4626f5c5417fd4214","observation_id":"b3c56589-7156-44e0-8e30-add47b684379","resolution":{"observed_at":"2026-08-12T17:07:02.257703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T17:07:00.680015Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.680015Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:f1fb80dc42205e2ae04162d2eaad1662e22f9961ed0ed61905edd7cc10d768ec","observation_id":"7f1de3a9-2cdc-4bca-ae3d-de878c1e28fa","resolution":{"observed_at":"2026-08-12T17:07:00.680015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.234702Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning, 2023","venue":null,"work_id":"0d5ce42a-eaf2-4143-8bf8-a15a2e975dae","year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.685381Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:00135c45a858d94d781e9cead4434a7ecdb48414f06158efc8f5cce4a74cc1ba","observation_id":"ad1d2f73-aa96-4fe9-a1c5-a424690178f3","resolution":{"observed_at":"2026-08-12T17:07:02.239855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.217127Z","title":"Measuring and improving consistency in pretrained language models","venue":null,"work_id":"1c444e6b-d9c7-4fff-aa2a-099cbcd71606","year":2021},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.690358Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:27850833c045a31c16b10b936cc4d3702dee4576c13714bdc2670b97bdfc3ead","observation_id":"6a659422-42fe-42db-b2f5-a86f256dd7a9","resolution":{"observed_at":"2026-08-12T17:07:02.222390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:00.695685Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.695685Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:2c28b06f6042585b0da6d0be9badf90347fe2a4ccba70b0db23f09f0251d0d8f","observation_id":"628ecb47-2ece-4484-bbbe-89b43659ec8e","resolution":{"observed_at":"2026-08-12T17:07:00.695685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13382","last_updated":"2025-02-01T03:55:30Z","snapshot_observed_at":"2026-08-14T13:26:34.246913Z","submitted_at":"2024-05-22T06:31:42Z","title":"VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13382","snapshot_observed_at":"2026-08-12T17:07:00.700588Z","title":"Vtg-llm: Integrating timestamp knowl- edge into video llms for enhanced video temporal grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.700588Z"},"links":{"cited_paper":"/paper/2405.13382","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:12f207b0c4177ba3cd5c4c27f93874069fdf2b0a42909f8d3aa1186f90f39557","observation_id":"d1c10303-a580-4b2c-85bb-671a12b0ab79","resolution":{"observed_at":"2026-08-12T17:07:00.700588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.186179Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"0135d4e8-fc24-4f8c-b190-96edfe91d64d","year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.705927Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:818501d3f723123df96e01326ac667eaf30ce87795b0f40c9308fc2110123228","observation_id":"c50191b1-4e91-419b-94f6-ceb545b407d0","resolution":{"observed_at":"2026-08-12T17:07:02.192540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19046","last_updated":"2024-03-27T22:50:48Z","snapshot_observed_at":"2026-08-13T00:43:26.044820Z","submitted_at":"2024-03-27T22:50:48Z","title":"LITA: Language Instructed Temporal-Localization Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19046","snapshot_observed_at":"2026-08-12T17:07:00.716282Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.716282Z"},"links":{"cited_paper":"/paper/2403.19046","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:4c7757c72f297daad462e23f367306023c8cde562dd1eadba9dc32d7fc1d87f2","observation_id":"83e26ae3-5819-42ba-a3f9-862648089c34","resolution":{"observed_at":"2026-08-12T17:07:00.716282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.167388Z","title":"Modal-specific pseudo query genera- tion for video corpus moment retrieval","venue":null,"work_id":"7f6959b0-3169-4e11-8b79-421753264a4d","year":2022},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.722101Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:7c8bf1d1389e6c25de304f88e39df49792dcea621ad3b19b7f070a3d169fae66","observation_id":"f0cca322-944d-419b-a950-650c1a0b051e","resolution":{"observed_at":"2026-08-12T17:07:02.173036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.150642Z","title":"Background-aware moment detection for video moment retrieval","venue":null,"work_id":"fc9bd4f2-a1b3-4b9c-abf9-fd61baf7516d","year":2025},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.726946Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:bc46f3d4e451e7c88d730fb3887409b9b84892b797bf35302248f6c21b5c695b","observation_id":"68388e89-0a61-4557-ba7c-0b2692f18aef","resolution":{"observed_at":"2026-08-12T17:07:02.156093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14622","last_updated":"2024-12-20T15:06:14Z","snapshot_observed_at":"2026-08-13T00:48:25.986138Z","submitted_at":"2024-03-21T17:59:35Z","title":"Language Repository for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14622","snapshot_observed_at":"2026-08-12T17:07:00.731830Z","title":"Language repository for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.731830Z"},"links":{"cited_paper":"/paper/2403.14622","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:a7db0d8773cc15ef113feed2a06384aa98d3e0ad30135d061e99fa6d33904583","observation_id":"129af2f7-9a6b-4b7e-bc82-8b43005c2458","resolution":{"observed_at":"2026-08-12T17:07:00.731830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.130407Z","title":"Dense-captioning events in videos","venue":null,"work_id":"53852733-69d6-4a29-9d4e-28c9dc2eb076","year":2017},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.737259Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:1bb3bb460c378dd650388572c5ce82a26b732963a4057de938ffa024b515a24b","observation_id":"a9a11936-c5ec-4787-9ec8-97e76b1767f8","resolution":{"observed_at":"2026-08-12T17:07:02.137308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.110184Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"d1a1204c-f508-4821-b762-3ebc6bdc8f4e","year":2021},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.742401Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:de04ea795398b187af79a1f73f0482c1c952c9f6437bf8b564872bbef97582a1","observation_id":"6ff56cb3-4f18-41ec-ae05-55a96c0bb826","resolution":{"observed_at":"2026-08-12T17:07:02.116551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-12T17:07:00.747917Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.747917Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:91c08137976467a57b560a46c8373b6bb752eb4be5d6f4c82a7f29f250f8980b","observation_id":"3b98d44e-4679-4ccc-9437-5f7e00f4ee6b","resolution":{"observed_at":"2026-08-12T17:07:00.747917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.088509Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"40dfc58f-025c-4b37-b852-25773ca40cad","year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.753337Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:4b9fde24a50946d629878edf12855e754c0877c9ad79d18297423593326363df","observation_id":"daf696bf-3bbd-4c77-a87b-b3a180fd56cd","resolution":{"observed_at":"2026-08-12T17:07:02.096278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17404","last_updated":"2024-09-21T14:59:07Z","snapshot_observed_at":"2026-08-13T05:14:47.302566Z","submitted_at":"2023-11-29T07:15:34Z","title":"VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17404","snapshot_observed_at":"2026-08-12T17:07:00.758146Z","title":"Vitatecs: A diagnostic dataset for temporal concept understanding of video-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.758146Z"},"links":{"cited_paper":"/paper/2311.17404","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:f0d6af42afe5e767f20d7b84f70380d3ee4bb67bac71598434c3f7dbe1a0038f","observation_id":"6eb5061f-cf7e-4ea8-b19a-63b639977b23","resolution":{"observed_at":"2026-08-12T17:07:00.758146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01846","last_updated":"2023-10-03T07:23:22Z","snapshot_observed_at":"2026-08-13T05:58:40.435354Z","submitted_at":"2023-10-03T07:23:22Z","title":"Benchmarking and Improving Generator-Validator Consistency of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01846","snapshot_observed_at":"2026-08-12T17:07:00.763059Z","title":"Benchmarking and improving generator-validator consistency of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.763059Z"},"links":{"cited_paper":"/paper/2310.01846","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:057756730016f94666664f2f43d3fa04324fdc4daf312ba11ddaa520388333c2","observation_id":"cb8b437f-aed0-497b-b36b-f42d083d8a54","resolution":{"observed_at":"2026-08-12T17:07:00.763059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T17:07:00.768085Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.768085Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:8926bacc13bff0be648393e7051c13dd5aa286551d1bf35ddf89b13815eeef60","observation_id":"a5ef0812-feb0-4a45-9f1d-dbc5e192265f","resolution":{"observed_at":"2026-08-12T17:07:00.768085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:00.773379Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.773379Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:1266a6f5be8f601ade864ce467e4d4bb822ba7946916cadb6ee9aedfac45ee8e","observation_id":"f8fe26f4-9732-427d-ab48-ac4823d85ce5","resolution":{"observed_at":"2026-08-12T17:07:00.773379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-12T17:07:00.778290Z","title":"Tempcom- pass: Do video llms really understand videos? arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.778290Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:75c10cf8e90e23193007e89adf45535f1ea71da0167add4bd85efd90a652e4ad","observation_id":"bcc114b1-bc9b-4935-b563-bf168f02d0ec","resolution":{"observed_at":"2026-08-12T17:07:00.778290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-13T11:18:51.693524Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-12T17:07:00.783631Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.783631Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:6fbf4ec27f87b5dcf620761081b4f09f1e367f10581ab48ef385518b954a8a99","observation_id":"6af2b771-a107-4a7a-a8d2-f466382770b7","resolution":{"observed_at":"2026-08-12T17:07:00.783631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.046567Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"6da086a9-0ba2-41ed-b028-1ee0db310dc6","year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.796312Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:2fb6d93acdb5ec389d5edf85efae9a6574b4ab1286f1ed3aa61403a19a4e6055","observation_id":"fd341e08-3ec7-49fb-a242-d8f604083cb9","resolution":{"observed_at":"2026-08-12T17:07:02.056181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.028333Z","title":"Query-dependent video representation for moment retrieval and highlight detection","venue":null,"work_id":"b0aef7f2-348c-4c48-ab94-7574f723c559","year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.800616Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:466ebc1b48fc2e913ed8626d4a5120f2e50144f6c402a941e13677f308e6c24e","observation_id":"cf2e423e-53b8-461c-a37a-a13460241155","resolution":{"observed_at":"2026-08-12T17:07:02.034221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:02.008321Z","title":"Local-global video-text interactions for temporal grounding","venue":null,"work_id":"ba5f0fde-4384-460a-bee1-f4c28a2e7c64","year":2020},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.805391Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:18c251cb4375b6797bad27e2d05062365fbe965d2ccde8efde779b9dd88caa92","observation_id":"f10669a0-866d-4530-b045-cb19b8ef92db","resolution":{"observed_at":"2026-08-12T17:07:02.013322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-13T05:16:05.220753Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-12T17:07:00.809662Z","title":"Video-bench: A comprehen- sive benchmark and toolkit for evaluating video-based large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.809662Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:26fa95c74c5aec24ff1006f91a6098b7db5f24380d5362430191b4e2ce2fceaa","observation_id":"081f7dd8-e3a6-4ac6-a1ad-3459c8ad70bb","resolution":{"observed_at":"2026-08-12T17:07:00.809662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.00325","last_updated":"2020-10-07T10:15:13Z","snapshot_observed_at":"2026-08-10T21:59:55.667529Z","submitted_at":"2020-09-01T10:07:23Z","title":"Uncovering Hidden Challenges in Query-Based Video Moment Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.00325","snapshot_observed_at":"2026-08-12T17:07:00.814437Z","title":"Uncovering hidden challenges in query-based video moment retrieval","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.814437Z"},"links":{"cited_paper":"/paper/2009.00325","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:6c3f21255ec4e89427b2e6e303c9d34755f0510726c4b61c90399d4f10fdab29","observation_id":"f32a4cb9-4c3a-4245-bf2f-05710e46e5d8","resolution":{"observed_at":"2026-08-12T17:07:00.814437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-13T04:16:52.837049Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-12T17:07:00.819490Z","title":"Momentor: Advancing video large language model with fine-grained tem- poral reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.819490Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:79545d0ce687f4014224f08ead8b0deb391670173a8692d18b547f86fea4016d","observation_id":"52ba0e91-0b05-483b-a6b9-dbba00470632","resolution":{"observed_at":"2026-08-12T17:07:00.819490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T17:07:00.824434Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.824434Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:3bb1f9ce186272eaaf985a70049fd9a1081c75f666bf21d2759dd18a55296265","observation_id":"d7fd9c77-a4ce-4769-99bc-27b13b521333","resolution":{"observed_at":"2026-08-12T17:07:00.824434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.990700Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"d82da5b3-a699-4973-8fd8-fa9e5e4d49d5","year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.829905Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:10173cce74d8afe9a9ca5d03abfa09ea0940ba7def1c83eb77801ce5f3a76f02","observation_id":"7525b355-3d6c-414c-b3e2-48a18b4b3b0f","resolution":{"observed_at":"2026-08-12T17:07:01.996307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-12T17:07:00.835798Z","title":"Self-consistency improves chain of thought reasoning in lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.835798Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:00531fce1df88d989c3c94610f9dc2dac1713005f59ffd961e6f7be34c231540","observation_id":"edd3e7d5-3664-4011-9117-43be9ee7776d","resolution":{"observed_at":"2026-08-12T17:07:00.835798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-14T08:19:36.723497Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-12T17:07:00.840663Z","title":"Hawkeye: Training video- text llms for grounding text in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.840663Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:9b26914daf1380de960b06a45e9f4b369d086abb76df9744d02b1c3dd13e033c","observation_id":"8ad9f57c-8738-44b4-9e96-6089277393f9","resolution":{"observed_at":"2026-08-12T17:07:00.840663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.973170Z","title":"Negative sample matters: A renaissance of metric learning for temporal grounding","venue":null,"work_id":"b6c006bb-b320-47fe-8df6-0aff53c9b867","year":2022},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.845487Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:17f7bc8ebb2c578a35c3c3d82516e8b977a9e2bdf39354b67dae55f02b872d04","observation_id":"3c426dd8-6ad6-4685-a14d-c9b05c6a5b37","resolution":{"observed_at":"2026-08-12T17:07:01.978865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.956038Z","title":"Chain-of- thought prompting elicits reasoning in large language models","venue":null,"work_id":"58222861-35dd-4882-9404-cf6461bbfc7f","year":2022},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.850430Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:3ea6ab242ca5c5eda55b2ecd6f2993712594947d908cc45f6025b7a3bcab31fe","observation_id":"c0706820-e09c-44c9-b3e5-afab73f553b6","resolution":{"observed_at":"2026-08-12T17:07:01.961610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04223","last_updated":"2025-06-14T12:40:12Z","snapshot_observed_at":"2026-08-13T14:06:27.664986Z","submitted_at":"2024-08-08T05:14:07Z","title":"VideoQA in the Era of LLMs: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04223","snapshot_observed_at":"2026-08-12T17:07:00.854915Z","title":"Videoqa in the era of llms: An empirical study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.854915Z"},"links":{"cited_paper":"/paper/2408.04223","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:422121062e733dbc233b7e66d1125683c8360cbb8967c36bb90a86597dd07010","observation_id":"97b95638-3e78-4d88-8d31-996da5028e42","resolution":{"observed_at":"2026-08-12T17:07:00.854915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.937019Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":"e8f7aefb-9a98-4805-9d27-74f3f10b249d","year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.860000Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:4b960b143198cab2f02fae87f5a97ed0e67fe059107193bac609ef9d64b38457","observation_id":"574da5c1-99cd-4299-8ab0-9072c58b7e7d","resolution":{"observed_at":"2026-08-12T17:07:01.943589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.919521Z","title":"A closer look at temporal sentence ground- ing in videos: Dataset and metric","venue":null,"work_id":"8f4d5724-168d-4b11-adda-9e3bc3dfc401","year":2021},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.864538Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:5a342964abf6e73732db94b75dfb7cf62725e6c9319075d2071480e6964fd878","observation_id":"f9ec1c82-fc35-44e0-b10d-bd132f8e91b3","resolution":{"observed_at":"2026-08-12T17:07:01.924923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.903202Z","title":"Sc-tune: Unleashing self-consistent referential compre- hension in large vision language models","venue":null,"work_id":"442f9820-4f8e-4fb4-b0a2-9d2e38f6f17d","year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.869110Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:9f88aa6b19f1e0475ac5049de5a5b0fb5ed512fdd30b0bc4263619dd7e70b8f2","observation_id":"7101815f-3ff4-4f8e-80eb-738370f61abe","resolution":{"observed_at":"2026-08-12T17:07:01.908456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13931","last_updated":"2020-06-14T08:49:07Z","snapshot_observed_at":"2026-08-13T01:07:23.856467Z","submitted_at":"2020-04-29T02:47:04Z","title":"Span-based Localizing Network for Natural Language Video Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13931","snapshot_observed_at":"2026-08-12T17:07:00.874181Z","title":"Span-based localizing network for natural language video localization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.874181Z"},"links":{"cited_paper":"/paper/2004.13931","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:24de6ec94612abe7b0776aa860af7ca0bcc2942f37247fb024f58176a694b8bd","observation_id":"5bdc71a0-763f-44ab-8f84-70530c3739b9","resolution":{"observed_at":"2026-08-12T17:07:00.874181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T17:07:00.879008Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.879008Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:5d56179a61f3bad22b4f6e899f9110ab2fd69ba725825f8c50f6dd371d88c42b","observation_id":"27c0a6f0-4963-4354-98a4-d5c6d0850ad0","resolution":{"observed_at":"2026-08-12T17:07:00.879008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:00.884824Z","title":"Learning 2d temporal adjacent networks for moment local- ization with natural language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.884824Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:7467b044f00b722db5cd047ae786fbe6f6472c052eeb8698f47754e33e5d5b88","observation_id":"6964b318-5963-4117-aa1a-4d7bd5816eca","resolution":{"observed_at":"2026-08-12T17:07:00.884824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14156","last_updated":"2024-10-06T09:51:25Z","snapshot_observed_at":"2026-08-13T00:01:00.777873Z","submitted_at":"2024-05-23T04:08:23Z","title":"Unveiling the Tapestry of Consistency in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14156","snapshot_observed_at":"2026-08-12T17:07:00.889826Z","title":"Unveiling the tapestry of con- sistency in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.889826Z"},"links":{"cited_paper":"/paper/2405.14156","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:cc10ba337ede7d6e56c0037f329a12f2a42dc6dbc59dbc0e3179f706cd1ea60b","observation_id":"5f458d21-c5b7-4dbf-a0ca-533ea3693a1b","resolution":{"observed_at":"2026-08-12T17:07:00.889826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00049","last_updated":"2022-12-27T03:59:51Z","snapshot_observed_at":"2026-08-13T15:53:01.774763Z","submitted_at":"2022-04-29T19:18:37Z","title":"Prompt Consistency for Zero-Shot Task Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00049","snapshot_observed_at":"2026-08-12T17:07:00.895247Z","title":"Prompt consis- tency for zero-shot task generalization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.895247Z"},"links":{"cited_paper":"/paper/2205.00049","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:d9f1096c99c93e52cc5adcd4086ecd957acbc51e02a71f9ca1b019a4e011057b","observation_id":"ab874dcf-3866-4f0b-80a6-0a7d39a40a66","resolution":{"observed_at":"2026-08-12T17:07:00.895247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:00.901267Z","title":"Towards auto- matic learning of procedures from web instructional videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.901267Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:3c8d0631aa3a41eaf95fc856ac092d4b8fe69da0ebfe52a10ac61e99b2f5705a","observation_id":"6af2e0c8-f895-43dd-854b-1d6da6277b2e","resolution":{"observed_at":"2026-08-12T17:07:00.901267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T17:07:00.905873Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.905873Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:41beb9679508cdca21bc4dfc849c01c94e7a7d770a7664a0b0db6b6c93af74e5","observation_id":"07b15573-2b1f-4fb0-b96f-1eb1ac93e7a7","resolution":{"observed_at":"2026-08-12T17:07:00.905873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.855217Z","title":"It shows a remarkable zero-shot audio understanding capability and also generates responses to the visual and audio information presented in the videos","venue":null,"work_id":"edca10e8-39d8-4ecc-a803-c3f60e90a302","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.910597Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:ffd88c6eec45f301a3da68de5c48ed31b651f36ac95fc20960d784a349fccb5d","observation_id":"fff885c0-7168-462e-bd0c-cd1a399c9171","resolution":{"observed_at":"2026-08-12T17:07:01.865606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.839096Z","title":"To do this, Video- LLaV A collects both image and video-text datasets and incorporates them in its instruction tuning","venue":null,"work_id":"4a2f2a6d-ee51-4c82-a2e2-db6e9e3a2321","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.915214Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:2f9f0725f5bffa18a518ed14619cc554eaa6e42b978c15cf34fce38e625ba741","observation_id":"b40b6262-0a19-4173-b722-e609557a1753","resolution":{"observed_at":"2026-08-12T17:07:01.843878Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.820813Z","title":"It introduces a new dataset for video instruction tuning, containing 100,000 high-quality video-instruction pairs","venue":null,"work_id":"3cb9dbf1-7102-4b34-9de5-5bc63c3be58e","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.919502Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:ac026677a72ede2dddfab00c53e4a888f5d4ce1c942d086e156c367d908a9476","observation_id":"a35b7f22-f46b-48f1-ae24-83cb385aaf2d","resolution":{"observed_at":"2026-08-12T17:07:01.827566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.802414Z","title":null,"venue":null,"work_id":"e093f3e9-6dce-46b2-a996-aa9857a0e907","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.924171Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:589442fe23c2c02ea56ce26abd95cb57bf142dcacfea6083162a3e7721f47b59","observation_id":"17f59f9c-44dc-49ae-827c-ec549a3eddba","resolution":{"observed_at":"2026-08-12T17:07:01.807893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.783539Z","title":"The format should be: ’start time - end seconds’","venue":null,"work_id":"8b859aa0-83fc-4fd8-add0-b6993a737a34","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.928772Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:78c15149d44fe7a422d8c74cd879b78cbaf659b863f770b2e72455f85b5b164d","observation_id":"3996aac8-ead6-49ad-879d-829a2fe2e155","resolution":{"observed_at":"2026-08-12T17:07:01.789263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.765586Z","title":"The output format should be: ’start - end seconds’","venue":null,"work_id":"d9f61b55-32a8-44df-b5dd-f0e41f37a183","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.932889Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:73d7acec2b408e43a2991b1cc6f2585dcff19724cdb84a12cd06738451b928c4","observation_id":"a304e0bb-3c63-451d-a8fa-d2311d2200bc","resolution":{"observed_at":"2026-08-12T17:07:01.771741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.747702Z","title":"Specifically, they aim to align vision and text in the first stage and then generate captions from various image-text pairs","venue":null,"work_id":"dff47800-fab1-4005-a12a-279e2784f5cb","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.937581Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:9cf4ad8ddc564eac0be77b08941aec9e8b66a9e8a367bb4bdea53a4059f57120","observation_id":"5cc8dc9c-75cd-4577-bfff-c5c5fa42642f","resolution":{"observed_at":"2026-08-12T17:07:01.753056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.725594Z","title":"They seamlessly integrate both visual and audio modalities in videos and propose STC connector to understand spatiotemporal video informa- tion","venue":null,"work_id":"d3f9dddb-11fc-4117-afb8-bbe04e990253","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.941979Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:cb7e590a8ee1beca0500fecc27529267a7fc656b5f03192a6ad9c2e9fbac3133","observation_id":"57a7ffd1-1db5-4dbe-bc4c-4e3989e145c7","resolution":{"observed_at":"2026-08-12T17:07:01.731635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.706780Z","title":null,"venue":null,"work_id":"ce07ffea-4887-477d-964d-0bc1d36fade9","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.946401Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:2b76234fbf2dda55bf874cdb01a7ff1426ff255533da145be130cc6bf36db905","observation_id":"3bb54507-8220-42f6-8272-5a8da55627ff","resolution":{"observed_at":"2026-08-12T17:07:01.711940Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.688321Z","title":null,"venue":null,"work_id":"32917852-1ad7-42c1-b3d2-2d875332c248","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.951178Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:76efce822106f57144fa8f66f6c9dfbce7c3861ba5de27064ef2ec4ff2bbf90d","observation_id":"46f06485-429f-4d83-8e75-e4127754a740","resolution":{"observed_at":"2026-08-12T17:07:01.694046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.669307Z","title":"I’m unable to find timestamps in the video","venue":null,"work_id":"6b0081f5-0537-4b12-99b0-18e48d5970ff","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.955768Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:4472085a6cebf0481635011651816cbbbda7df38b7c13239e843269297ebb59d","observation_id":"041bec98-5982-4e8c-8da6-4fb868e61657","resolution":{"observed_at":"2026-08-12T17:07:01.674919Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.651638Z","title":"Experiments on Charades-CON with TimeChat","venue":null,"work_id":"968eef80-4a40-4a17-ac11-0f60ef1d8a90","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.961927Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:ca960c930da54c71f4f2c1159fcd97434b9ff151971cd761d14e09828cdedd43","observation_id":"83407866-e070-4e37-98b1-af452de9d1ae","resolution":{"observed_at":"2026-08-12T17:07:01.657803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:07:01.630907Z","title":"16 Figure 11","venue":null,"work_id":"2a27d138-e4cc-415e-807e-9e96006b4cf9","year":null},"citing_paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:07:00.966961Z"},"links":{"citing_paper":"/paper/2411.12951"},"observation_digest":"sha256:7846f129a76bc1aef437c2d879a320188a59f7a36dabda2a20c7d8f83ddf7e58","observation_id":"64614f41-df1e-4010-a7fd-abc914e6d17b","resolution":{"observed_at":"2026-08-12T17:07:01.639697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12951","last_updated":"2025-03-17T02:21:38Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T18:26:22.658520Z","submitted_at":"2024-11-20T00:47:17Z","title":"On the Consistency of Video Large Language Models in Temporal Comprehension"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2411.12951."}