{"as_of":"2026-08-10T08:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1aeeaf99495d8ce813627372e410da75d81bba59d8b82daff8ce5d7d6f1b2974","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:32:57.059594Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08538/citation-record","integrity":"/paper/2509.08538/integrity","json":"/paper/2509.08538/citation-record.json","paper":"/paper/2509.08538"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.355191Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.355191Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:58fd10055dd414e3861b9e54eee2bf1e1d35ef2b1484e858a2e4e8a7e19ef7d9","observation_id":"1e356cbf-7a71-4122-b51a-a651befb776a","resolution":{"observed_at":"2026-08-04T20:32:56.355191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.362792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.362792Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d71105c26100b80ca9cba65e18a9610398eb8f6b6ca2074fe036d3f3af490cff","observation_id":"bc4d416f-196f-496d-ac35-4956244fe320","resolution":{"observed_at":"2026-08-04T20:32:56.362792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T20:32:56.368080Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.368080Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:73b80161374cf4d846fb3124cffd0786195aa121124a62d7cc3727edbdc8edcf","observation_id":"7bbc4ae2-2b48-449f-8b42-69a845ab6de4","resolution":{"observed_at":"2026-08-04T20:32:56.368080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.373710Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.373710Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:5590016946d6a6c7ab2253da9362d925d7ec73130c077e208ee467743706635f","observation_id":"506debf6-d33e-4759-ad25-68f24fa4c7d3","resolution":{"observed_at":"2026-08-04T20:32:56.373710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.385920Z","title":"2020.The visual story: Creating the visual structure of film, TV, and digital media","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.385920Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:fc25b3d7f8d6efec8c42b85e5c6c5a9029924c9d325f3cac0c6bf9e4caa7ecf9","observation_id":"e9e3d4af-39a4-47d7-803e-99950a1b1502","resolution":{"observed_at":"2026-08-04T20:32:56.385920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.393082Z","title":"2005.Figures traced in light: On cinematic staging","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.393082Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:696a2b9f243a9defbd1bcd910636bfaee09bfeb380ce3badc602651e4c26b41c","observation_id":"6c802f18-24d5-4edf-b6d1-356ca4c3cd7e","resolution":{"observed_at":"2026-08-04T20:32:56.393082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.399095Z","title":"Bordwell and K","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.399095Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f5026ae525d2f99d132debc0563b5bd75d40a403b8748070c292b8ee408dafc9","observation_id":"7c56042b-1401-4670-9243-4994f562161f","resolution":{"observed_at":"2026-08-04T20:32:56.399095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.405345Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.405345Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:694b83068ae4123e639392aeab921cb9b7eb6554655a882835453217108dfba6","observation_id":"48aedb5d-29d7-4710-be97-319161b2aa83","resolution":{"observed_at":"2026-08-04T20:32:56.405345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.413191Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.413191Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:b04778a1ad7fd310f63e5ca7b241e4bd9f07e621e84308f30ca063d5f8e10f63","observation_id":"cd5213d4-144f-4941-a1e6-c02f6c688d28","resolution":{"observed_at":"2026-08-04T20:32:56.413191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.424333Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.424333Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:07d4e129e3389c6fe109dfa2532fc84278d51c44439dd0dd1dddb2c73afb114d","observation_id":"b5c93435-f166-4389-9de1-3406a681970f","resolution":{"observed_at":"2026-08-04T20:32:56.424333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-04T20:32:56.418696Z","title":"arXiv:2403.17297 [cs.CL]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.418696Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:55ca8547eae2a3243c3d72c5ec7771606501140158b4e90e2852db57a50ea535","observation_id":"163f588a-820f-4e44-96dc-363e3f0a1951","resolution":{"observed_at":"2026-08-04T20:32:56.418696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.437988Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.437988Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:19d813fb14e057f322d5e03416d50e0af836a2910d7c8dcd3393394bface9b6e","observation_id":"a75f2100-c4ac-4857-8313-27be9a211d3a","resolution":{"observed_at":"2026-08-04T20:32:56.437988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-04T20:32:56.430841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.430841Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:81970b54eefed37bf4f46d1c16416cbe63ba3079a28d941e8814e519f2675ed9","observation_id":"89a7aa44-fea8-48ec-afbb-113bec72c9a3","resolution":{"observed_at":"2026-08-04T20:32:56.430841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.449752Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.449752Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:fe7b18ca7e6edcd73502652c85cb6a9318358af2eb4ab58980e06a886bdb9033","observation_id":"c689760a-0b09-4ad3-88ed-e4cb4f398809","resolution":{"observed_at":"2026-08-04T20:32:56.449752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-04T20:32:56.443650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.443650Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:c864b36b74e10978ed31250748f6b22e2dded901f2cbc17de2f01be904786e0e","observation_id":"129077e5-ac55-4b2d-8b39-f1a3bbc40f0a","resolution":{"observed_at":"2026-08-04T20:32:56.443650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.461933Z","title":"2013.Human information processing: Vision, memory, and attention.American Psychological Association","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.461933Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:6d50cb7779692f394531b53ea4f93d41df056bdda67cafc0984f88f7dfcbc6bc","observation_id":"55d36d7d-628d-4b31-8ccd-196bb6d8b1d3","resolution":{"observed_at":"2026-08-04T20:32:56.461933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16771","last_updated":"2026-04-23T13:21:19Z","snapshot_observed_at":"2026-08-02T03:20:43.405143Z","submitted_at":"2024-11-25T06:17:23Z","title":"VidHal: Benchmarking Temporal Hallucinations in Vision LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16771","snapshot_observed_at":"2026-08-04T20:32:56.455277Z","title":"Kankanhalli","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.455277Z"},"links":{"cited_paper":"/paper/2411.16771","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:7a094f8d018f368f314cc11179bdb998d16c3b07d5fc0fef7d41a45668322816","observation_id":"1ff7a2c9-2aae-46fc-a09c-759ecf7c37ab","resolution":{"observed_at":"2026-08-04T20:32:56.455277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.471710Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.471710Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:fc8e0b7ee8b0c1c7b494406d06f6fdb89845e4051b4b9996c194eaf4617eeaef","observation_id":"01e836b6-5343-49bf-8ddc-8e925eb88abb","resolution":{"observed_at":"2026-08-04T20:32:56.471710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.482556Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.482556Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:04ce2e844ef4791efcfb0888a78185daa499151bcf36d5e763235d458894d540","observation_id":"c3ba4ab5-7b46-4cf8-a28f-7f50626fb6bf","resolution":{"observed_at":"2026-08-04T20:32:56.482556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-05T14:33:12.627325Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-04T20:32:56.477678Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.477678Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f54172c157ff3e871608a5def82e4c29d24565b32ca1314bdda570d526e7fca1","observation_id":"0b62f425-e764-4385-a3c0-7c7e35137384","resolution":{"observed_at":"2026-08-04T20:32:56.477678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.493996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.493996Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:ad4c4f9a9ca9cae2a11443c16a8ad8803fbddc1b37092e991f43e989773f0a82","observation_id":"5a94453e-fb10-4388-a852-2c8bff38d7bd","resolution":{"observed_at":"2026-08-04T20:32:56.493996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T20:32:56.488472Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.488472Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:6462a58c654889b7d23cb7bf3aae54a8788e97a7fba80f5b0af1fdbba1aba656","observation_id":"9b19fdc3-d003-42a6-b2f2-2260e3534d61","resolution":{"observed_at":"2026-08-04T20:32:56.488472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.505747Z","title":"2002.Mise-en-scène: Film style and interpre- tation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.505747Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:9a082eaeed14148abef0ae3f4e6d911e8af070556cc30df1284873f267ec1c76","observation_id":"01668f78-84b6-4797-9512-062dda1e2696","resolution":{"observed_at":"2026-08-04T20:32:56.505747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-04T20:32:56.499149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.499149Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:ba45a358f5041a8121298e61cff26a07a031fc8182d198941bee5365c02296e3","observation_id":"bac15c89-d678-4e26-aca4-202fc2396257","resolution":{"observed_at":"2026-08-04T20:32:56.499149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-08-08T23:15:31.134799Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-04T20:32:56.516191Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.516191Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f91bdb52485989fd4e64daff2a77db58b7c32f42c009c5f7eeebe2e84741ba17","observation_id":"bdf5e9e9-13c3-476d-bb22-a90c3b2bf7e8","resolution":{"observed_at":"2026-08-04T20:32:56.516191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.523017Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.523017Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:ca37cb19f535bbd2953f7e1173bfd0414d4d95bbedd4f60241b8573485f2fd01","observation_id":"fde065e8-3b2e-42e2-93f2-e98e9cf51af7","resolution":{"observed_at":"2026-08-04T20:32:56.523017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T20:32:56.537462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.537462Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:2888316287556061ee4587e7ef3b4b9e65e2a2228263fc08b78728cfadd731e6","observation_id":"985e3870-8e8e-4c16-9e1b-8bf5a67d78e6","resolution":{"observed_at":"2026-08-04T20:32:56.537462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-04T20:32:56.532290Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.532290Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:bbbe2e7616f7918e22ebae09457e911e84dd8ca86a3e0185e282f1fccca504e0","observation_id":"379ccc35-1a65-4357-98b5-e12bd82b8bac","resolution":{"observed_at":"2026-08-04T20:32:56.532290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11150","last_updated":"2024-11-17T18:52:06Z","snapshot_observed_at":"2026-08-09T04:53:16.291432Z","submitted_at":"2024-11-17T18:52:06Z","title":"A Comprehensive Survey on Visual Question Answering Datasets and Algorithms","version":1},"cited_work":{"arxiv_id":"2411.11150","doi":"10.48550/arxiv.2411.11150","metadata_source":"pith","pith_arxiv_id":"2411.11150","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"A Comprehensive Survey on Visual Question Answering Datasets and Algorithms","venue":"cs.CV","work_id":"90985b12-5194-42ce-a23c-c1ca8ba4bfef","year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.548575Z"},"links":{"cited_paper":"/paper/2411.11150","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:895411722edf924ccc20fe36f41868ec30b8546ad97e59eb61fc9ab59eb6265f","observation_id":"87382e3c-6127-4ec1-a8b8-a85f99667977","resolution":{"observed_at":"2026-08-04T20:33:54.768847Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.543391Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.543391Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:de394d4e0cc220d465a96f7a41169841a19aa6420ba534a6b4a2df18fd6332b3","observation_id":"b7e168e3-710a-4620-8786-2f19419ce369","resolution":{"observed_at":"2026-08-04T20:32:56.543391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.563400Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.563400Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:7fbc5e480510c61841ee1af668b86bfb0c97e7198795c30b077bdaedf9672df6","observation_id":"26f2bd1a-148b-4313-acf8-1c91b77cd277","resolution":{"observed_at":"2026-08-04T20:32:56.563400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.554860Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.554860Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:80fc84610231fda138a9c9d2032728bf6ab1be2875968d68186b90f6d18d34e8","observation_id":"a6efcdce-56d0-46e0-ba0b-dbc53ae73aa1","resolution":{"observed_at":"2026-08-04T20:32:56.554860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T20:32:56.574322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.574322Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:4ff89ec390b802ae6a7fb5519f1c4db141eea86f1f4609009e1849a377725104","observation_id":"d8d35c71-7537-4e24-ad74-7058134d5267","resolution":{"observed_at":"2026-08-04T20:32:56.574322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.567981Z","title":"Berg, and Mohit Bansal","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.567981Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:3c8a680122f409df8a6c1cee0c02cc5f077cb56f32a97f1fc17a34e1b3c78994","observation_id":"0c100652-0ca4-4266-9173-dd453fb46011","resolution":{"observed_at":"2026-08-04T20:32:56.567981Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-04T20:32:56.586319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.586319Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:570328d3a6b9e2444bc59bb1153eb17b3cc1f280e1505511d31084660de7e83c","observation_id":"a133ce72-f350-4e46-b0ab-30c9f0976478","resolution":{"observed_at":"2026-08-04T20:32:56.586319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03735","last_updated":"2025-03-31T21:07:49Z","snapshot_observed_at":"2026-07-06T20:01:50.356653Z","submitted_at":"2024-12-04T22:03:19Z","title":"VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03735","snapshot_observed_at":"2026-08-04T20:32:56.580184Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.580184Z"},"links":{"cited_paper":"/paper/2412.03735","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:3cc6128dd14f9128678def33f7ed108d42c55d026e6276fe73bc33f6f1e698bf","observation_id":"6536a079-2501-4bae-aa6f-40347e8612a4","resolution":{"observed_at":"2026-08-04T20:32:56.580184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.597946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.597946Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:6f0440606c0388346041ad690b7b07626b2aac282fe3a246cb88b6faeee02722","observation_id":"e5f377ff-4841-4fa9-a423-5bb7e32e9fdc","resolution":{"observed_at":"2026-08-04T20:32:56.597946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.609106Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.609106Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:26732aa296d9e53605bfb8b7af9859ba4190f71b37c11c2e70ecd1f96231caef","observation_id":"46b695c2-4d8a-437a-b8c4-2b14d639210a","resolution":{"observed_at":"2026-08-04T20:32:56.609106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03246","last_updated":"2024-08-06T15:06:40Z","snapshot_observed_at":"2026-07-06T18:57:31.323769Z","submitted_at":"2024-08-06T15:06:40Z","title":"Making Long-Context Language Models Better Multi-Hop Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03246","snapshot_observed_at":"2026-08-04T20:32:56.603444Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.603444Z"},"links":{"cited_paper":"/paper/2408.03246","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:bdcab2781b0e4da19c8a3f5f414946f905b8f388f9f189959ae8f697ec003e73","observation_id":"ad4666fc-3b11-4d3a-9e02-7d8192d1a559","resolution":{"observed_at":"2026-08-04T20:32:56.603444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-04T20:32:56.622377Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.622377Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a72cd38331c52dc1339d35bbd299552ecc2675f226377e3873f86a1d83636aa6","observation_id":"1354d313-04a2-4e86-a48a-d63ce58b7a6e","resolution":{"observed_at":"2026-08-04T20:32:56.622377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.615854Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.615854Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:3b6c42269a124ca36711befd5763fd32ff6657b7529a0a41588294f01d2e7179","observation_id":"bb973a2c-59d6-40c4-ace3-c32c41566e5f","resolution":{"observed_at":"2026-08-04T20:32:56.615854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.638414Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.638414Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:88ea387f8f0c3bc8a0fa3ee61066bd882b2a8a65ffff105359257f770ade2dc2","observation_id":"d376f94d-7f43-4ee1-ae00-3a6a48c7a26b","resolution":{"observed_at":"2026-08-04T20:32:56.638414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19773","last_updated":"2023-10-30T17:44:09Z","snapshot_observed_at":"2026-07-06T16:40:39.567420Z","submitted_at":"2023-10-30T17:44:09Z","title":"MM-VID: Advancing Video Understanding with GPT-4V(ision)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19773","snapshot_observed_at":"2026-08-04T20:32:56.628654Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.628654Z"},"links":{"cited_paper":"/paper/2310.19773","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f60634eed196618f9ba40fd71a92fd00c55829f08e0da020322f8dc7277cf498","observation_id":"495627fe-3d36-4200-a04e-5b3679e4326d","resolution":{"observed_at":"2026-08-04T20:32:56.628654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-04T20:32:56.656822Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.656822Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:15d5b0edad6171a9a763f8e834f09f1b635ccf074360ea1b162b9741b1d600ab","observation_id":"06da0f1b-aa4f-42fb-8eea-179b37a4ad6f","resolution":{"observed_at":"2026-08-04T20:32:56.656822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.649625Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.649625Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:859af82089b3b1015957e4fff2e7247ea6871b69927dcb9854dc950b29cb20dc","observation_id":"f6b3f7e5-12bb-4488-a772-6471d83c52a9","resolution":{"observed_at":"2026-08-04T20:32:56.649625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.670143Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.670143Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:0f3775798b941f8dfb6bde1debac89373d521075872d970004c36f43414c61d2","observation_id":"97bd2deb-23c0-4f14-9651-fec031ddc604","resolution":{"observed_at":"2026-08-04T20:32:56.670143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11116","last_updated":"2025-04-14T12:11:51Z","snapshot_observed_at":"2026-08-03T16:32:32.602866Z","submitted_at":"2024-03-17T06:53:44Z","title":"PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11116","snapshot_observed_at":"2026-08-04T20:32:56.662679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.662679Z"},"links":{"cited_paper":"/paper/2403.11116","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:b5adb776b2532388fb332f0a5f61f57af8906919bc917e1ed3a3bf3631430dc6","observation_id":"8bf8dc53-b87c-4285-bdcf-5ad10395a3ea","resolution":{"observed_at":"2026-08-04T20:32:56.662679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.689614Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.689614Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:8c86bd5ccea4225f6119a2d41ab2ad8a18948033092d221bc764bbb4e6fd201d","observation_id":"58f373fb-7795-410a-b6db-af1f1b950951","resolution":{"observed_at":"2026-08-04T20:32:56.689614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.676255Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.676255Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:eef9c48b1540d768703077f03d2e5c7b8fe86871760c677aeb0b92abe78c784f","observation_id":"fd07ad05-d3d8-4c9c-8428-c674b264f753","resolution":{"observed_at":"2026-08-04T20:32:56.676255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-04T20:32:56.684255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.684255Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d9e45a0fba92af4b5c6a81e7a6c83ae5abbe43add2a8ba132355b5bb57dde8ab","observation_id":"8291684d-8999-4361-96c2-dda099eae3b5","resolution":{"observed_at":"2026-08-04T20:32:56.684255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.708218Z","title":"O’Connor","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.708218Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:22eea33ab62213b108dd25bf2ed2a6768455f7a409d885d06ae4326696aca869","observation_id":"25003f71-9556-4097-860a-2ba84db3ad0d","resolution":{"observed_at":"2026-08-04T20:32:56.708218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-04T20:32:56.695590Z","title":"Rawat, and Thomas B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.695590Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:56ba1c4d2223b1fed17a56ec9df1390a421ca33867dbbd96293ff98170dedaf4","observation_id":"0ee60542-d7c1-4097-af91-440d060e6b87","resolution":{"observed_at":"2026-08-04T20:32:56.695590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.701856Z","title":"2016.From Human Attention to Computational Attention","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.701856Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:fb3188476c1ba8ccc7099ab53bc34e195217a70945c097ab3ca654a8e891ac55","observation_id":"2f6e6c7d-485e-4426-acb8-9bdb093bfc71","resolution":{"observed_at":"2026-08-04T20:32:56.701856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findin","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:33:54.361944Z","title":null,"venue":null,"work_id":"59f89d5c-d165-40e9-b62d-4e0165827ed3","year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.726333Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:5b3670e4e4b843b5c480efa478918dcd607495e5d4174c861477e7d1c29c7343","observation_id":"18ffc1c8-dede-49d3-9eb5-78e45b38b78a","resolution":{"observed_at":"2026-08-04T20:33:54.420702Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.714924Z","title":"1999.Foundations of statistical natural language processing","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.714924Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:81ccc7c3d907622c46e366e4c4e33371e074c06c51bd0a525830cc09973e2646","observation_id":"a9428a4c-7806-414d-af13-5fe53049cac8","resolution":{"observed_at":"2026-08-04T20:32:56.714924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-04T20:32:56.719979Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.719979Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:64bd6fb2158073e22626ba88cc693665e913c456a64e5ed9f52709b2aa695af6","observation_id":"0caae250-134e-44c9-b60d-100de4137922","resolution":{"observed_at":"2026-08-04T20:32:56.719979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.753734Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.753734Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:dadb5180ac9b76cdd3136cc9657e532977483fccb8515cb2f137589c1b305d47","observation_id":"3e437a63-3153-4989-8783-835832e93c72","resolution":{"observed_at":"2026-08-04T20:32:56.753734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-04T20:32:56.736581Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.736581Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:fcd610f98034b6c0eff11aabe7f292bf4c198e0c937444913a7022ff5b979f82","observation_id":"21a2c4cd-3046-4363-94bf-87e42334fa85","resolution":{"observed_at":"2026-08-04T20:32:56.736581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T20:32:56.744472Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.744472Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:17bf1d77adc57f0ba2e58d48e3f1bc253f5210561a17040815c7a6f8e5596cfd","observation_id":"cf239a5f-b4c5-488b-84dd-7fca0def9139","resolution":{"observed_at":"2026-08-04T20:32:56.744472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.787102Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.787102Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:ea0cc2bab825bf3ba68a3763e6b8fe572beee8745b6eb2c37fda70b89e713df8","observation_id":"4fad3c1e-f926-404a-96d2-75968684131d","resolution":{"observed_at":"2026-08-04T20:32:56.787102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.761348Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.761348Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:42d235b32ead663495689e982472a007edffb21771f48fd297e24f9894d55400","observation_id":"d2e64a15-bf18-4644-86c8-68f0a76d935e","resolution":{"observed_at":"2026-08-04T20:32:56.761348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.771366Z","title":"Girshick, and Ali Farhadi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.771366Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:94a0de4b4a53ba0375410c35332b0f1994aff004170f3eee10ba8edc52b9cbf3","observation_id":"52cab061-e964-47fb-af3e-dff4cd902496","resolution":{"observed_at":"2026-08-04T20:32:56.771366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10889","last_updated":"2025-03-30T14:07:22Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T10:42:21Z","title":"VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment","version":2},"cited_work":{"arxiv_id":"2406.10889","doi":"10.48550/arxiv.2406.10889","metadata_source":"pith","pith_arxiv_id":"2406.10889","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment","venue":"cs.CV","work_id":"d985b995-702b-44d9-9455-68e82e976ac1","year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.811561Z"},"links":{"cited_paper":"/paper/2406.10889","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:34588e1f5a2f85e2e8e472f4ad7d14827f6bfad00a38be02d4f9ca5c5df3af13","observation_id":"48ab59c9-9d8a-4f19-843d-204ab322525c","resolution":{"observed_at":"2026-08-04T20:33:54.254429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-04T20:32:56.818052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.818052Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:c95cd3885cb1ab2e3f0b70e9656b3d8bd36bc22e0597e4d3e8305c3bb51981f5","observation_id":"b7efc35b-e33d-4610-9fea-8e2297ab618c","resolution":{"observed_at":"2026-08-04T20:32:56.818052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.791245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.791245Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:4740636f0d82b3b6049b8bd8a95250b3ea007e58377029dcc5a1d5927f61970d","observation_id":"8502143b-8ff9-4926-ac1c-d057501e47a2","resolution":{"observed_at":"2026-08-04T20:32:56.791245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09589","last_updated":"2024-10-03T09:00:35Z","snapshot_observed_at":"2026-07-06T18:14:54.506051Z","submitted_at":"2024-05-15T10:16:25Z","title":"A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09589","snapshot_observed_at":"2026-08-04T20:32:56.800975Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.800975Z"},"links":{"cited_paper":"/paper/2405.09589","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:b1a524bbd11d11686992cf01d3833653f1ed5502b9ffddbaf37fb01d165224f2","observation_id":"cd7a7a2f-5127-4713-9ec0-14b0dc18d603","resolution":{"observed_at":"2026-08-04T20:32:56.800975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.860424Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.860424Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:6db8abc343d04cba0ae67b9d85631e671cef0fb51b533b1e2fe0058ee6181301","observation_id":"ba898d62-0a29-4e56-8bf4-2fa5ddf24e8e","resolution":{"observed_at":"2026-08-04T20:32:56.860424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.881841Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.881841Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:25e7162adb6371e6faf77cde6467a5cf012cd493da8c44e83fb1a12b7cbb18b6","observation_id":"2a774b62-1def-48a4-8bf3-6a5b37fdb8cb","resolution":{"observed_at":"2026-08-04T20:32:56.881841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-04T20:32:56.838540Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.838540Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:416f81b5c47946e5a30a4bbe8317be5e7175f66943c67a849631c07de128c0c5","observation_id":"fd36a8e4-b0fc-46e9-98bf-99b284787fc0","resolution":{"observed_at":"2026-08-04T20:32:56.838540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T20:32:56.919983Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.919983Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a6a2d415010f0f633dc87c8c78041953795ee2d711e8bbed878cc54fc68dd7c3","observation_id":"18729337-7b79-43b7-ae5b-c8c879c8914c","resolution":{"observed_at":"2026-08-04T20:32:56.919983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.929596Z","title":"2013.The Oxford handbook of sound and image in digital media","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.929596Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:47003bae6fb7922ccfe6a2d308c6b490a648a6c449b2e7f305c3c8b07ab5c70d","observation_id":"a0306755-04af-44b5-b69f-1995e547ec4a","resolution":{"observed_at":"2026-08-04T20:32:56.929596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T20:32:56.938002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.938002Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:e1a45824b157e4c021b7d352e8d5c4e8473be36604037ed7708cf948d62270ed","observation_id":"a0173072-d145-4abc-903e-ca8a286a69e4","resolution":{"observed_at":"2026-08-04T20:32:56.938002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T20:32:56.907053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.907053Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:03394545b120d1c3461b7f57a9b87de154cb881b312d46703a61761852f44131","observation_id":"0c613ce5-c7c3-4050-9a71-e8656ada9263","resolution":{"observed_at":"2026-08-04T20:32:56.907053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.914794Z","title":"2009.Multimodal Sig- nal Processing: Theory and applications for human-computer interaction","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.914794Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:3b101c7475e6968605678840127126395dfbe8de1f9cbeebe5ec2c576b23fb09","observation_id":"fd98d0cf-6b39-4998-a054-ef3e5fcfe619","resolution":{"observed_at":"2026-08-04T20:32:56.914794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09613","last_updated":"2024-12-12T18:59:40Z","snapshot_observed_at":"2026-08-01T15:11:43.922290Z","submitted_at":"2024-12-12T18:59:40Z","title":"PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09613","snapshot_observed_at":"2026-08-04T20:32:56.967932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.967932Z"},"links":{"cited_paper":"/paper/2412.09613","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:6886df8246f912856bfc6a1d39526fcdf91e3bbd0a1b56775accc642988124ab","observation_id":"a55a2557-5730-4d44-8d43-a7dfa88ea0b1","resolution":{"observed_at":"2026-08-04T20:32:56.967932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06040","last_updated":"2024-10-25T06:32:09Z","snapshot_observed_at":"2026-07-06T18:27:58.433967Z","submitted_at":"2024-06-10T06:17:55Z","title":"Vript: A Video Is Worth Thousands of Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06040","snapshot_observed_at":"2026-08-04T20:32:56.975944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.975944Z"},"links":{"cited_paper":"/paper/2406.06040","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a79dc6e501d09e81e32c74873af1da3b438056348b76bb42754591217cbbd110","observation_id":"a1cf3dde-b5ac-47fb-af1c-7cd6dcf65ebe","resolution":{"observed_at":"2026-08-04T20:32:56.975944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-04T20:32:56.981480Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.981480Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:5e9592c4a6edb719601458325737551660900cf851f971cfde503978c31da725","observation_id":"b4a199f5-70ff-4355-8060-0d6ce4e43a0d","resolution":{"observed_at":"2026-08-04T20:32:56.981480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.945883Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.945883Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:9e45d7afbedc7d7441197470e79546fdf234f2a02f743e332af89af2a2bfbef1","observation_id":"fbe2bbd1-7f04-4423-aaf0-1df9d433dd98","resolution":{"observed_at":"2026-08-04T20:32:56.945883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-06T20:31:18.439488Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-04T20:32:56.952259Z","title":"arXiv:2406.16338 doi:10","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.952259Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:b9966cf4884450049f021aae1f53476236a432e5a0abdbf318e9453b09bc9369","observation_id":"14760259-ed39-4b68-b20a-974d045ae3cb","resolution":{"observed_at":"2026-08-04T20:32:56.952259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-04T20:32:56.960144Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.960144Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:aaa358875a79c9e4f0c59b66b09d2bfbced2f618a54b8d640283d04db913f817","observation_id":"13186908-81bf-4add-9d15-bf2d0dd2677d","resolution":{"observed_at":"2026-08-04T20:32:56.960144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-04T20:32:57.016518Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.016518Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:28cb8572eb410edb4abb5f94a3888f2dd382549d06a0eb7e2df906bb9582b247","observation_id":"cc89babc-b975-4d58-9f7b-b9b38196ef01","resolution":{"observed_at":"2026-08-04T20:32:57.016518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18659","last_updated":"2025-07-31T07:54:00Z","snapshot_observed_at":"2026-08-09T17:18:55.016840Z","submitted_at":"2024-11-27T09:43:09Z","title":"DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18659","snapshot_observed_at":"2026-08-04T20:32:57.027292Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.027292Z"},"links":{"cited_paper":"/paper/2411.18659","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:e93cfe969cbff2265ad4d11d0b56c6fc9410457ce937b55485a7c942ee89b697","observation_id":"96c2936d-b272-44d5-a83f-ba6c9623791d","resolution":{"observed_at":"2026-08-04T20:32:57.027292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-04T20:32:57.038704Z","title":"A man wearing long-sleeved collared pink button-up shirt with pockets and not wearing glasses appears in the video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.038704Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:fd3c048933488cc0ce2f71fea185eb75a42c93f77253f09bb9af7e6da449714e","observation_id":"9f0fd19d-6798-437b-a629-a7d532ad0a5c","resolution":{"observed_at":"2026-08-04T20:32:57.038704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.987009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.987009Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a15f58e8234278830a5713c7155ccd1f1c03a97b4e6ec9d4e06d3c8f5ee22c32","observation_id":"288f0ac9-7ebe-4473-9e8d-6d6f16129ce4","resolution":{"observed_at":"2026-08-04T20:32:56.987009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.994039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.994039Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:43df743e7e4eff7c19ffe2834cf3aed9287c3d33e4ad30bc3659da5d63bc3cb4","observation_id":"25887e44-7304-4c90-8082-a4d8b91cef5f","resolution":{"observed_at":"2026-08-04T20:32:56.994039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:57.000075Z","title":"arXiv:2409.16597 doi:10.48550/ARXIV.2409.16597","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.000075Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:1138f77fb7fdd912687b120277261b5a8e6f10f1c271dacd508b710a6cc38976","observation_id":"3b0cb272-5819-462f-a3d7-d55ee8d43571","resolution":{"observed_at":"2026-08-04T20:32:57.000075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:57.007950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.007950Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:641334b2bfe15852580c60ec09244278e8c47354f99c20189f49f36787c2dd8c","observation_id":"78f725de-5138-4e5d-8427-d6f0628d5ddb","resolution":{"observed_at":"2026-08-04T20:32:57.007950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:57.050146Z","title":null,"venue":null,"work_id":null,"year":1939},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.050146Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:567d73bfac7f8c843e8bad63699cd938569db02f5e98a1a839647bb8f2e8ab77","observation_id":"2999ef6d-299e-4698-8d5e-77d45e0f5f99","resolution":{"observed_at":"2026-08-04T20:32:57.050146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:57.059594Z","title":"(00:38 – 00:46) (CIV) Q: Which individual was the one who spoke in the video? Options: A: A man in a white vest was speaking in the video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.059594Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:2da32182102e7264b22670b67ed91bbd91b90f8a3d25868cd83f4129023d6c06","observation_id":"fea97aaa-4d6d-47aa-b7ce-35c4e290a4f6","resolution":{"observed_at":"2026-08-04T20:32:57.059594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.778550Z","title":"In2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016, Las Vegas, NV, USA, June 27-30, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.778550Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:7262c73c1ef34972e065a5ee7ca927dc9c7e412bba1832ab258a59dc2ddb58c4","observation_id":"7303eb7a-f8ea-4545-a508-6cda5b5daacb","resolution":{"observed_at":"2026-08-04T20:32:56.778550Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.895347Z","title":"arXiv:2312.17432 doi:10.48550/ARXIV.2312.17432","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.895347Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:7cdc1e815504021a1ae19742a424952488ad881222ed5464136a42e4f3d9d639","observation_id":"7c1dc52b-a6f6-401a-90ea-ad035364cf8f","resolution":{"observed_at":"2026-08-04T20:32:56.895347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.379260Z","title":"In IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2024, Seattle, W A, USA, June 16-22, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.379260Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f964d8b2c6fe72cf68d48a96b26bf0f5cb60358fc2df2d5331d28a12ad091fc5","observation_id":"1f7800d9-7adc-415d-b298-9ecdd297d6bf","resolution":{"observed_at":"2026-08-04T20:32:56.379260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":87,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 0 inbound Pith citation observations for arXiv:2509.08538."}