{"as_of":"2026-08-10T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4cc06b997855ad4ca83d040090852deb6125b1aaafd6567740fd8b2e6a153174","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:24:55.008240Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06361/citation-record","integrity":"/paper/2608.06361/integrity","json":"/paper/2608.06361/citation-record.json","paper":"/paper/2608.06361"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23673","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:55.991517Z","title":"L.; Panda, S.; Meghwani, H.; Singh, J.; Dua, K.; Li, P.; Sheng, T.; Ravi, S.; and Roth, D","venue":null,"work_id":"7d1c0d58-dc3c-4cf2-99f6-c35b01a77dd5","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.144137Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:d952a4f629bc524d87f318e0e7cce70e2d0518390d1112848c74dbc126621000","observation_id":"d7c84f27-de22-4830-958c-c31c17eba640","resolution":{"observed_at":"2026-08-07T04:24:56.000894Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-07T04:24:52.231517Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.231517Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:923165cf574d85c0499dd19816f77464618b948ea2b36d01891682803e9e735d","observation_id":"07944c51-e15a-4a6c-a568-eb97ff54b32d","resolution":{"observed_at":"2026-08-07T04:24:52.231517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05523","last_updated":"2025-06-05T19:12:45Z","snapshot_observed_at":"2026-08-07T22:11:58.027730Z","submitted_at":"2025-06-05T19:12:45Z","title":"MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05523","snapshot_observed_at":"2026-08-07T04:24:52.386597Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.386597Z"},"links":{"cited_paper":"/paper/2506.05523","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:54291cb1799f1225223f088d00b5d4c4645e5cc21c3017a9cc6fe94b53449ed9","observation_id":"8c0f946c-1274-42ff-8e08-c1fa16448b78","resolution":{"observed_at":"2026-08-07T04:24:52.386597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.685730Z","title":"M.; Kota, T.; He, J.; Eyzaguirre, C.; Durante, Z.; Li, M.; Wu, J.; and Fei-Fei, L","venue":null,"work_id":"b7b00303-fa0f-4f09-b50e-54270d4fc472","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.488003Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:3355e6679808df4ed9f8125ffe4b6cf4a01128af9bc59e12034e39d4fdb62e62","observation_id":"599d86f9-2b43-4dd5-94d9-a12d01fc3ef8","resolution":{"observed_at":"2026-08-07T04:24:56.691178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T04:24:52.643870Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.643870Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:d417cf8c299115f5990a016bb055cb699ccc7dab79daaf6e76517310302de514","observation_id":"671a9d24-71dd-4040-a285-22661e74e1c7","resolution":{"observed_at":"2026-08-07T04:24:52.643870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.667794Z","title":"P.; Li, W.; and Gong, S","venue":null,"work_id":"dfbfba22-a0f0-4818-8b12-375808d8371d","year":2026},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.734869Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:f853295cdada5656a78258b9b0efb3f00d834765453be73e49902c32b7fa2f6d","observation_id":"0805b9db-5acd-4cf9-8d63-735f9a1322c1","resolution":{"observed_at":"2026-08-07T04:24:56.672317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.651591Z","title":null,"venue":null,"work_id":"cd80b78e-8e60-4a64-82d7-f439356d9422","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.830178Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:fcd90601a9251f8ae8cb9cd8b54f0ef3b485efc46adbbe037c9fac4b0710b955","observation_id":"07139ee8-aa73-416a-984a-5340b765adc4","resolution":{"observed_at":"2026-08-07T04:24:56.655945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-08-07T04:24:52.914333Z","title":"S.; Salehi, M.; Tripathi, R.; Lee, S.; Ren, Z.; Kim, C","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:52.914333Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:e64329fbc49b516c3c95e0787dd2967332de6d2894415bc411afcf3ae0040a32","observation_id":"cfcddce4-ae72-4b94-b290-f290aef5a431","resolution":{"observed_at":"2026-08-07T04:24:52.914333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.634624Z","title":null,"venue":null,"work_id":"41a17906-5ad2-4d33-bdcb-fd201beac256","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.012924Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:92dd4a1e70d39b2253a9241f38db71c10fff8600e1ec2b3ac14dfd107dd2284f","observation_id":"823347c9-3cd6-4b20-86b5-a49d03ba5008","resolution":{"observed_at":"2026-08-07T04:24:56.639322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.614834Z","title":null,"venue":null,"work_id":"9ea698a5-aca6-4473-8d9b-8ebbdd887b9d","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.214323Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:3e54c65bd86ade2d3f5fcc0e88c6e40eff80e28ecf24507ba4dd5e27f707739c","observation_id":"92ed64fa-c936-432c-a326-d779fce80713","resolution":{"observed_at":"2026-08-07T04:24:56.620228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T04:24:53.296769Z","title":"A.; Ma, W.-C.; and Krishna, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.296769Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:19fefdba3dfb8bc689ea7aeca28c9c5955e2287e534aec1c43c9e09c18cf4260","observation_id":"2f4fecf4-dedb-4797-aab3-cfc5ecd2ec38","resolution":{"observed_at":"2026-08-07T04:24:53.296769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.595407Z","title":"W.; Li, L.; Yang, Z.; Wang, L.; and Cheng, Y","venue":null,"work_id":"0d3b691a-76ae-4b19-bb7f-2bc92164c3c6","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.418701Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:74bbdb1691dbbc00cf0aaf0ab6ea2653452d878bcc0dcdb0dfc8dd53f7fdb542","observation_id":"30ee07bf-454e-4f99-823a-6742c436921c","resolution":{"observed_at":"2026-08-07T04:24:56.602422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.572948Z","title":"L.; and Girshick, R","venue":null,"work_id":"3dff3ca5-439e-477b-bdea-05eb0aa8267d","year":2017},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.726452Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:0bf5ed4db2e5cd5ed38747e2a8c879cc9b5e1ff25a0828f254836f18a58b167a","observation_id":"5a226575-a1be-4601-b9d0-1b1f8ab7ca45","resolution":{"observed_at":"2026-08-07T04:24:56.578561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09105","last_updated":"2025-07-01T03:47:15Z","snapshot_observed_at":"2026-07-06T19:50:05.918060Z","submitted_at":"2024-11-14T00:26:26Z","title":"VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09105","snapshot_observed_at":"2026-08-07T04:24:53.867176Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.867176Z"},"links":{"cited_paper":"/paper/2411.09105","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:85f2259c4a3d71c8c5cfdade87ac35b224890a235c5487e43c47003553c92087","observation_id":"81537453-421d-4dd5-add1-b1ca663a9126","resolution":{"observed_at":"2026-08-07T04:24:53.867176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-07T04:24:54.025621Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.025621Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:69ae0e4a1c496b3fae8104b3b70b7f03ea009dc8268a735dd59fb93820fb1fa2","observation_id":"d91c9d61-57eb-42aa-9c96-71709166d49e","resolution":{"observed_at":"2026-08-07T04:24:54.025621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.553503Z","title":null,"venue":null,"work_id":"8bbc0411-d052-4385-8dda-756358f7e01c","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.245785Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:f45973d2ca427959bb0500d72e10a3b82860a522707e07bf5d5ab7ee7b28366c","observation_id":"7677c8b8-5d86-44cb-9938-e5aa4cda0546","resolution":{"observed_at":"2026-08-07T04:24:56.559694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.535366Z","title":null,"venue":null,"work_id":"64bc7dc9-056a-4705-abb4-59a83fbef628","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.384918Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:9782bd59bf160e8372c60748dd21f1f8657db77caa9a51c367f23eb1bfb76c35","observation_id":"5d1fd752-2a2d-4fd6-905c-cd9935f0481b","resolution":{"observed_at":"2026-08-07T04:24:56.540311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T04:24:54.511970Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.511970Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:580d5609df3e3cc300e0e971610860a0e14b913fe72f4a0bbacf35e50e967bfe","observation_id":"6ebfd26c-e9d8-4278-9bdb-640d56553c47","resolution":{"observed_at":"2026-08-07T04:24:54.511970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.519201Z","title":null,"venue":null,"work_id":"0f792ec3-ed9e-4f64-98fc-d4c7d8f5aee0","year":2023},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.664409Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:a91248b4c815331f931181bfb632ffdb6b047fcf840cd64047f0670f336016cf","observation_id":"17e824f4-ed54-4ee8-8f78-5cd733c5cd47","resolution":{"observed_at":"2026-08-07T04:24:56.524376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06941","last_updated":"2025-11-20T00:19:24Z","snapshot_observed_at":"2026-08-09T21:19:24.140229Z","submitted_at":"2025-06-07T22:42:29Z","title":"The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06941","snapshot_observed_at":"2026-08-07T04:24:54.749022Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.749022Z"},"links":{"cited_paper":"/paper/2506.06941","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:aa25b3282f7c614dbcbdbf4cc64f75c22f575f9d92d100217440a4e2fc91f1fa","observation_id":"db54f330-9e3e-4d4c-ac75-3c597c212482","resolution":{"observed_at":"2026-08-07T04:24:54.749022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-07T16:00:45.565705Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14693","snapshot_observed_at":"2026-08-07T04:24:54.755039Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.755039Z"},"links":{"cited_paper":"/paper/2504.14693","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:c2d41223b0905548c4b478c22884b45583365c00bec14e6d739f439b8adbad32","observation_id":"62aba644-7176-4f22-b1ed-11b45250e50a","resolution":{"observed_at":"2026-08-07T04:24:54.755039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18880","last_updated":"2025-06-23T17:51:40Z","snapshot_observed_at":"2026-08-06T23:12:46.021492Z","submitted_at":"2025-06-23T17:51:40Z","title":"OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18880","snapshot_observed_at":"2026-08-07T04:24:54.759751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.759751Z"},"links":{"cited_paper":"/paper/2506.18880","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:38111629bf422e031fe3b45e0d501a89cdb9d6bc3b8d7866c90c3af8141dba3d","observation_id":"bb9418fb-fd26-484e-91b6-02a8fea9c261","resolution":{"observed_at":"2026-08-07T04:24:54.759751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.764865Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.764865Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:8c41a9f6192cdf9c946a518cc8fabce1933c6e2faebe8a65ae6308d3f174bac1","observation_id":"bf8a1780-e20e-43be-a311-3ad12ba35cb3","resolution":{"observed_at":"2026-08-07T04:24:54.764865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-07-06T17:14:32.455890Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-08-07T04:24:54.770078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.770078Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:f900dc0a97d24b5085b34a0def3f09a8befd28dd66fb06e94874ed2085de8741","observation_id":"8e51ee67-2932-4e6c-a1ff-4b3e0843eb3e","resolution":{"observed_at":"2026-08-07T04:24:54.770078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-07T04:24:54.777262Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.777262Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:68247e610b1efa051a4ead327c3b7b30586747e5f0a5f627d3a16b17bb8ae5cb","observation_id":"37f66cc9-eb61-476a-bf83-4e07eab41068","resolution":{"observed_at":"2026-08-07T04:24:54.777262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.500705Z","title":null,"venue":null,"work_id":"eabe7992-d278-4bfe-a841-2cdf8a466eea","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.788332Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:c74ae338ca2b682b160679d29165d86a1b6ea8e943fef24d730d0a1fc095c8d5","observation_id":"9a10bc43-c406-4344-ad18-d58920138353","resolution":{"observed_at":"2026-08-07T04:24:56.505970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-07T04:24:54.793516Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.793516Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:ab2774899fcba2926a64c0cd13ab21392b79b62e869aa648f673d29b7dd85511","observation_id":"abc2a3de-42ec-41a4-9a5c-bffa94bcc04d","resolution":{"observed_at":"2026-08-07T04:24:54.793516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.799125Z","title":"J.; Huang, Y.; Liu, Z.; Qu, P.; He, J.; Chen, J.; Yuan, Y.-J.; Han, J.; Xu, H.; Li, H.; Sachan, M.; and Liang, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.799125Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:e367ec9ed0ac45064f6054b77bda2ae8809225bfa3f79cce719699190bc17eb1","observation_id":"cb2382fa-fb81-4374-8239-61807de95740","resolution":{"observed_at":"2026-08-07T04:24:54.799125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-07T04:24:54.809548Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.809548Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:827576c43fa14b169593fafeb99fbd9be1df5a70eec3023907b2e56930576bfa","observation_id":"19cbbeb2-51d4-4e30-8d45-ca82d8efd493","resolution":{"observed_at":"2026-08-07T04:24:54.809548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.815382Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.815382Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:a979f6601e1c589d7f6d1f99988c3a55ab903e79aabd7b2115c7689b0a7b3230","observation_id":"5f0f0fda-46cf-4be4-b234-0ebd0af11645","resolution":{"observed_at":"2026-08-07T04:24:54.815382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.468267Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":"2c8bd4e3-8394-4522-a02e-37dfcfefc2bb","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.821197Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:21193235f136cf6becbe7d32841081827789df715555e5829074806e772e4635","observation_id":"5a27b7c3-fa34-427b-bced-52db97aefa1a","resolution":{"observed_at":"2026-08-07T04:24:56.474953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.448642Z","title":"T emp C ompass: Do Video LLM s Really Understand Videos?","venue":null,"work_id":"c64bf8fe-363e-4903-bcbd-d805a3c2fce5","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.826419Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:eb35000bef71df8a59c55f0325b72c76a4f906910a914222f9f6f024452dceac","observation_id":"1b8f7891-dae9-4ca9-8a64-7008f05e4b0a","resolution":{"observed_at":"2026-08-07T04:24:56.453882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.430733Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , pages =","venue":null,"work_id":"47e1983d-26fc-4c59-b611-62f77e623e24","year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.831264Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:e6dc9f399e396db49a633c453484b8906a1613c0b60dfceef0fc11ea31074220","observation_id":"fd09c947-e957-4f7e-a9c0-a0ae21b9e44c","resolution":{"observed_at":"2026-08-07T04:24:56.435710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.413564Z","title":"and Kota, Taran and He, Jimming and Eyzaguirre, Cristobal and Durante, Zane and Li, Manling and Wu, Jiajun and Fei-Fei, Li , booktitle =","venue":null,"work_id":"3ec911c5-0aa1-40b0-aa1a-6cef691dd415","year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.836116Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:8b5973c7d46d5aac041a0402117c7232100966453cd796efb75050a56081eedc","observation_id":"7f2dcae5-0272-4da8-9aad-5be1c79680d3","resolution":{"observed_at":"2026-08-07T04:24:56.418861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/075280-2004","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding , volume =","venue":null,"work_id":"5da15062-56aa-4aa6-ae92-42190d53b69c","year":2004},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.842447Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:28c1a1db1e171014b016c499877f8cd62e593c6722847096f84193e70427f099","observation_id":"c3b7d9a1-f192-4f65-9048-b2c86a063eeb","resolution":{"observed_at":"2026-08-07T04:24:55.067902Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.394696Z","title":"2024 , eprint=","venue":null,"work_id":"d1ea205a-4e0c-472f-8806-e8c2942bc1e8","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.848233Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:83fcc73dcadcd9c6c0c546e3fbb2a4e48900bf95fd28e39b77bc1a55d2566cf6","observation_id":"8f5df2b8-86b4-45ec-be73-207a60f414fc","resolution":{"observed_at":"2026-08-07T04:24:56.401075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.376404Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":"414630e9-a435-46c8-affe-0c21119ceeed","year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.853320Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:eb6ed7db546b8614e73175992f65bd7e0e013123400429be4d7bf648a705ec4e","observation_id":"ace52e79-d713-41aa-9ddc-050d36c33230","resolution":{"observed_at":"2026-08-07T04:24:56.381945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.359176Z","title":"2025 , eprint=","venue":null,"work_id":"63f267f8-6bab-43f4-a786-312a308bf492","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.858091Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:1c1279f0e1c29fdfc5262b0fa3a5ed1bc5823d14fc573ad7493f4d6da5ecc868","observation_id":"15810289-8cee-4a45-9f3b-74ca14ececa6","resolution":{"observed_at":"2026-08-07T04:24:56.363864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-07T16:00:09.967849Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T04:24:54.863248Z","title":"arXiv preprint arXiv:2504.16074 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.863248Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:c27e72c04f83b8f8d0a21c39f5e9f3a186ac489b9e25b6124c6eb4112aaaefb5","observation_id":"6db93d44-64d1-43b9-b14c-0093100b1754","resolution":{"observed_at":"2026-08-07T04:24:54.863248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.868214Z","title":"arXiv preprint arXiv:2512.05091 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.868214Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:632deb984669b80db89e145952ce483e7862258e40c16bc114fe29259ea84e39","observation_id":"4ccd3904-b946-4a70-a5d7-9cfbd058001f","resolution":{"observed_at":"2026-08-07T04:24:54.868214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.873262Z","title":"arXiv preprint arXiv:2505.23359 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.873262Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:833fe1f8dffa6416c652ee83ab87b5e8c1e5e244074416f07fb0766ba45656c8","observation_id":"679bf50f-250d-406c-b904-95b71e93cf43","resolution":{"observed_at":"2026-08-07T04:24:54.873262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.341591Z","title":"2025 , eprint=","venue":null,"work_id":"89257845-42bc-47dd-b7fa-d05599f94dd9","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.878051Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:c279e6ae5e657a7914d86a0ea23897b4a0b0602b929f7614c814ceadfecce8fe","observation_id":"b2341d0e-c233-400c-8f1b-1e587130ecf7","resolution":{"observed_at":"2026-08-07T04:24:56.346770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.324881Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs , volume =","venue":null,"work_id":"b3734256-352b-401f-9eb2-6b6fcea0528d","year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.883261Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:bf32532f020339ed70fd4cd8f161ac480be252922a56439e7a38a557e9f5ded6","observation_id":"fa2ed78d-82ba-4cda-bd07-c3d25ac51509","resolution":{"observed_at":"2026-08-07T04:24:56.330599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.304434Z","title":"2024 , eprint=","venue":null,"work_id":"e659adc0-f3c4-484e-9b7a-a35f6e1e85e2","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.887607Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:96d8062bacb5898a8fc6daaa18e2b94b230e9f7ddaa7a5194a604ff48974f4be","observation_id":"5788ee92-2d80-4450-8b1d-78067fbe5342","resolution":{"observed_at":"2026-08-07T04:24:56.310306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01018","last_updated":"2022-04-03T07:50:18Z","snapshot_observed_at":"2026-08-10T07:58:54.143158Z","submitted_at":"2022-04-03T07:50:18Z","title":"TransRAC: Encoding Multi-scale Temporal Correlation with Transformers for Repetitive Action Counting","version":1},"cited_work":{"arxiv_id":"2204.01018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.01018","snapshot_observed_at":"2026-08-07T04:24:55.788573Z","title":"TransRAC: Encoding Multi-scale Temporal Correlation with Transformers for Repetitive Action Counting","venue":"cs.CV","work_id":"c3117cc2-8dde-4ed2-a997-8cab5822f78d","year":2022},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.891710Z"},"links":{"cited_paper":"/paper/2204.01018","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:d5d651a7b22eae3e298dea60f18d893d3a0e07834adec3ee56453170d7653f7b","observation_id":"aa320b76-db6a-4cf0-82d2-21f43de77622","resolution":{"observed_at":"2026-08-07T04:24:55.795302Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.895820Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.895820Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:82789127f7e212825c93a79272832d07b9b12d76208e58cbeeaa5df9c38b020d","observation_id":"d5e61dbc-7926-43b7-8d8c-e253a4975770","resolution":{"observed_at":"2026-08-07T04:24:54.895820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.900531Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.900531Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:4c7531ea45c5260c66254487ffc17a92b230e33208270a09ad5977bdde2fae5a","observation_id":"4dce49a0-883c-435e-8dcb-31d07b9cface","resolution":{"observed_at":"2026-08-07T04:24:54.900531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.904905Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.904905Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:40361ae26a3b1ea643a5cb5c29d4177591655bd0713364bd9117e89a3deb3ba8","observation_id":"e964b1e2-40c0-4100-bca9-cc1c452ce07f","resolution":{"observed_at":"2026-08-07T04:24:54.904905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.909336Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.909336Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:10b626723130a84f762937b55f1e1983e9a084100c04df499c8aa6ffb1bc5278","observation_id":"5e58298e-02f4-4315-aaad-bb7d062ea2b8","resolution":{"observed_at":"2026-08-07T04:24:54.909336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.236214Z","title":"Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences","venue":null,"work_id":"bc732eb4-522a-4ea5-9a19-3a55438b1806","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.913877Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:541dc0894c9981922896682cbf28f1e40ea327dbfd7af6e6257767b56dad3a9a","observation_id":"22ba40ce-b387-4a60-892b-8dcfff417bf8","resolution":{"observed_at":"2026-08-07T04:24:56.242939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.218129Z","title":"2025 , eprint=","venue":null,"work_id":"085e33ef-8c74-4c2f-990c-10681f0989bd","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.918039Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:4855c3a769ae3b10c8b758982566d86bd66082ceebae55988bf30448ea33be21","observation_id":"4290319c-0200-434a-b1a4-ef745eae8798","resolution":{"observed_at":"2026-08-07T04:24:56.223694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.922152Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.922152Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:c123f5fc9401666a93fb8968302a41d1d31cf2e150cf305f3bdcbf63b854b972","observation_id":"fe6093ce-4615-4fca-a0e7-e9bed56f58aa","resolution":{"observed_at":"2026-08-07T04:24:54.922152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.926274Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.926274Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:8858e980feb77103446f8aa8e2a70645caca491accc13bfb47e7d3b3622ad269","observation_id":"95aa17f3-0196-46c6-b638-0ca70215d7d3","resolution":{"observed_at":"2026-08-07T04:24:54.926274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.174811Z","title":"2024 , eprint=","venue":null,"work_id":"2465f180-6777-4047-bb0b-cbb37e0e6905","year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.931250Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:cea6201051e59e8a8404a942a6066bc4d19f7232920bd69e3b453f88e92d3418","observation_id":"42bea15d-cbf8-483c-b6a9-f9a4b53578d6","resolution":{"observed_at":"2026-08-07T04:24:56.179831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.935746Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.935746Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:f3dc77fe2cc0f9065556585fa75119cf0c5ed3150141384fa92cf3556dcd6888","observation_id":"15e4ae1a-fc2e-4373-9667-8bfd1a58c922","resolution":{"observed_at":"2026-08-07T04:24:54.935746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.939825Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.939825Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:44f458a8dc08a3854f8c19133fc9f34756a8883de19c86551b0e8ebda6af00e8","observation_id":"9aeaa774-301f-46f9-ab75-6440462d76a2","resolution":{"observed_at":"2026-08-07T04:24:54.939825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.128454Z","title":"Proceedings of the 42nd International Conference on Machine Learning (ICML 2025) , year =","venue":null,"work_id":"b1fc9ac4-ad02-4e4d-bb9f-ae78a7d5a926","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.944352Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:23f6727341a6f17703b5ae5869a856d3371aeedaec0e1cdae00fd278099c7f04","observation_id":"a6797bd3-346a-4119-82f5-e3ecdddf8424","resolution":{"observed_at":"2026-08-07T04:24:56.133964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.107995Z","title":"2025 , eprint=","venue":null,"work_id":"5998cb40-2f28-4959-af76-2e7fe938c4a1","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.949338Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:707627aa57312cab5f44b4572e99de719ce9f653df74f61b10d5bd16afd0a604","observation_id":"8e7c17d2-d4e7-448a-9acf-e130fe5d8cea","resolution":{"observed_at":"2026-08-07T04:24:56.114458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T04:24:54.955160Z","title":"arXiv preprint arXiv:2203.11171 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.955160Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:70e996cc008ebda49bdf1e4622a1de18397a1587393acaef484b7b3234d95f6d","observation_id":"779460ca-fa69-4b33-b59a-c3a0e5d7bffa","resolution":{"observed_at":"2026-08-07T04:24:54.955160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.960617Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.960617Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:71f38e75994c90c6733656516743b1ab26ecb4d4871e35f7bb59f616d369557d","observation_id":"2283cd70-da8b-488a-a33d-4d1eaa6eec6e","resolution":{"observed_at":"2026-08-07T04:24:54.960617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.965931Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.965931Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:eac3b969293f00705e73f8cea50c3c9eef9330a26066e6bb192223ba6ee1eb2a","observation_id":"bcea1e89-b1a5-452d-9e38-2ce30b87d4b6","resolution":{"observed_at":"2026-08-07T04:24:54.965931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.970881Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.970881Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:7b1827ef557df9372769e1be215b3ad921b87d7f1c1f57fa1b16287d4bc3263b","observation_id":"95794f40-93bf-49ef-8cf6-3c44bd445f98","resolution":{"observed_at":"2026-08-07T04:24:54.970881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.048677Z","title":"2025 , eprint=","venue":null,"work_id":"72e543a9-30f7-4c00-8db1-5f5297cb2608","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.975540Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:3834e25bf501e8532a2e36b129730d84bd30d1c1070ec6b487bcde80fff3756a","observation_id":"cbe1aa48-295d-4d78-82f9-45ef25c57e8e","resolution":{"observed_at":"2026-08-07T04:24:56.054314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-04T15:53:11.168523Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-07T04:24:54.981358Z","title":"arXiv preprint arXiv:2406.11303 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.981358Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:bbccb64d39b0dff1b820df1c042f626c84ef103894131887bd7482a9ff906f7b","observation_id":"e059e240-3680-4a48-8baa-dbd830e98b72","resolution":{"observed_at":"2026-08-07T04:24:54.981358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-07T17:42:30.374808Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T04:24:54.985958Z","title":"arXiv preprint arXiv:2405.08813 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.985958Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:c4fc7ef9dff664526aa182f9f558cab01af4da17617edfb475fb352c4046049c","observation_id":"44b4a782-ef62-4217-b57a-179974c28124","resolution":{"observed_at":"2026-08-07T04:24:54.985958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-07T04:24:54.991413Z","title":"arXiv preprint arXiv:2501.13826 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.991413Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:486a54d2617b3df800313d90aaa8102ef8e950a2147a22ecf8aaca0ab41a603c","observation_id":"4e648f65-6112-46d9-9f6a-e5484246083f","resolution":{"observed_at":"2026-08-07T04:24:54.991413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.032349Z","title":null,"venue":null,"work_id":"d6400481-2c4a-4d66-80c0-30f66dee23f6","year":2025},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:54.996689Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:ef582e73e7fb5234010df28316744f558d690d97f155ccf941ce6212897d57e3","observation_id":"6472183e-2c3b-4b5c-9936-59eaf987834c","resolution":{"observed_at":"2026-08-07T04:24:56.036757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14321","last_updated":"2025-05-20T13:07:55Z","snapshot_observed_at":"2026-08-07T23:44:06.171904Z","submitted_at":"2025-05-20T13:07:55Z","title":"Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14321","snapshot_observed_at":"2026-08-07T04:24:55.001360Z","title":"arXiv preprint arXiv:2505.14321 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:55.001360Z"},"links":{"cited_paper":"/paper/2505.14321","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:15763174371fca4d2c81399cd58ff717777e0eaaa8f67d125fc8cddea05ddcc2","observation_id":"cd04825c-b05d-4ba5-9fad-add7deb39880","resolution":{"observed_at":"2026-08-07T04:24:55.001360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:56.013621Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings , year=","venue":null,"work_id":"8d4ae19b-fe26-40d3-833e-0cc6908a32d3","year":null},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:55.008240Z"},"links":{"citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:8120b050751025755187453c397ba9bfef593f5277358960505387f2cb912c56","observation_id":"529b2d0c-38a0-4bd4-8414-23b60bbb4008","resolution":{"observed_at":"2026-08-07T04:24:56.018883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T23:13:31.191909Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":45,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2608.06361."}