{"as_of":"2026-08-19T07:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5892526940ff7d747723393de01d6954611edb6e07cbbc5fc2713d27786a82f2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:40:23.724449Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:34:22.143661Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-12T14:40:23.724449Z","title":"Tempme: Video temporal token merging for efficient text-video retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-19T01:50:35.848234Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.724449Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:e46bd1f06faad9e1f690fe38ac10c33437770f90de17a10080d8bea20adab9b0","observation_id":"3b10fefc-2f69-4e0c-ab17-c914a975ecb5","resolution":{"observed_at":"2026-08-12T14:40:23.724449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-12T12:25:18.526987Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17261","last_updated":"2025-05-30T15:15:51Z","snapshot_observed_at":"2026-08-17T17:53:57.129761Z","submitted_at":"2024-11-26T09:37:59Z","title":"HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:18.526987Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2411.17261"},"observation_digest":"sha256:6bf5f2eb8d882c785bcd741892838360da8f757d256053b7fdac9b233970c9ea","observation_id":"e0aeff09-969a-4cb3-bafb-926f1a79b5b7","resolution":{"observed_at":"2026-08-12T12:25:18.526987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-11T20:54:16.416990Z","title":"Tempme: Video temporal token merging for efficient text-video re- trieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05185","last_updated":"2024-12-11T14:43:02Z","snapshot_observed_at":"2026-08-15T18:10:10.082702Z","submitted_at":"2024-12-06T17:04:42Z","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T20:54:16.416990Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2412.05185"},"observation_digest":"sha256:b868c92cbfa6f3018f5802028ead48e0fbab49c6847cc75c7423af15c10d7334","observation_id":"c22e7847-d52e-41c7-b0c7-009d22ecfc0f","resolution":{"observed_at":"2026-08-11T20:54:16.416990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-07T14:08:09.248749Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-15T00:34:08.333930Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.248749Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:2f92b5ecd888f1d03ec9569ccfab2dab49bf411eed98592598a56da064b517d9","observation_id":"52f69615-1a5e-44bc-b7fc-b0b73babfd78","resolution":{"observed_at":"2026-08-07T14:08:09.248749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-07T05:04:38.599960Z","title":"Tempme: Video temporal token merging for efficient text-video re- trieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.599960Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:6663f013b830e2e79a0790d74f297c6b871361e036799050674cf1fbad52c5da","observation_id":"20943e42-6839-4b62-ad48-600cbe32f003","resolution":{"observed_at":"2026-08-07T05:04:38.599960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-06T22:24:31.751666Z","title":"Tempme: Video temporal token merging for efficient text-video retrieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-13T09:08:08.645501Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:31.751666Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:253e6609a722b55a9addb32cce168244bc55f1651d34ea1cef3ae391f329d61c","observation_id":"c1ba48df-e473-4e59-bdf4-1306f72d7a79","resolution":{"observed_at":"2026-08-06T22:24:31.751666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2509.02560","last_updated":"2025-11-09T15:12:33Z","snapshot_observed_at":"2026-08-14T20:43:48.309995Z","submitted_at":"2025-09-02T17:54:21Z","title":"FastVGGT: Training-Free Acceleration of Visual Geometry Transformer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T23:36:06.870759Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2509.02560"},"observation_digest":"sha256:2bf3ceaa2ba728398dc90c0daa89505f0f387cf478189075318dbbf0cb140d4c","observation_id":"86d26e7a-4e49-4ef1-8d1a-ee965f131884","resolution":{"observed_at":"2026-05-15T23:36:06.973826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-04T10:22:45.895680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-18T23:15:42.396844Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.895680Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:be1fbe6c7ad291c668c3c4bbe3f33c0e51bdd778e0d214cf6a4aaeff79074d70","observation_id":"7ed984dd-c281-4f1b-bf8f-54d493bc3784","resolution":{"observed_at":"2026-08-04T10:22:45.895680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2602.20913","last_updated":"2026-04-15T16:09:22Z","snapshot_observed_at":"2026-08-11T11:51:37.712014Z","submitted_at":"2026-02-24T13:49:47Z","title":"LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T20:01:31.129959Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2602.20913"},"observation_digest":"sha256:86e6ea45abc5c8da88ba72a4c16e62142b8b5a06483f3847e6e7a071b2b7065b","observation_id":"98511968-0902-473b-a2c6-0aeff1f6d256","resolution":{"observed_at":"2026-05-15T20:01:33.518670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-12T17:05:28.993798Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:e463faad9a20a79c3a198d49ee9ce52e507cb99739a219ab06fcd1d8eb026e1e","observation_id":"e6373ec4-0774-4ee1-8c9a-40bb5e22f222","resolution":{"observed_at":"2026-05-15T18:26:27.050959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2605.00826","last_updated":"2026-03-07T12:28:35Z","snapshot_observed_at":"2026-08-12T23:25:55.007979Z","submitted_at":"2026-03-07T12:28:35Z","title":"Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T15:05:37.964883Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2605.00826"},"observation_digest":"sha256:7da31f6519bcc5f49198ef644b7d8f7087fcbb97f4d7b5b2ff7fed48f5fe46cc","observation_id":"4d8556ba-eb10-4551-832a-2fafc5d97a49","resolution":{"observed_at":"2026-05-15T15:06:09.663380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-09T14:30:01.064746Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:8517cc32ed50a95647134f685320a31aa45423b868d91daaf4cc36460f32cb01","observation_id":"405e9bd1-0db9-4bfc-8bf8-6a6e5c2d1341","resolution":{"observed_at":"2026-06-30T07:34:22.145236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2409.01156 (2024) STAC 19","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:1d2466f86f067347ec3d25553acb45a66f282f270e7191c848ebd01f33b3cfd8","observation_id":"54e0cb18-43af-407f-b79f-dc31dac84aca","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-07-31T23:59:17.042425Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-15T21:35:01.894426Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:59:17.042425Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:cd923694d99ff7b9e615fbfc08676a46ec246ad2da462336aca164dc4ef47fc2","observation_id":"fe4e68f3-7808-4951-9552-1dcae442deca","resolution":{"observed_at":"2026-07-31T23:59:17.042425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-04T04:01:48.573191Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-15T21:35:01.894426Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.573191Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:645bd697aa85dd7dafe00928489d06efa779aca8e4c99b054cab37dd039231f5","observation_id":"bd2233ae-0764-4622-ba01-0bc71e99655c","resolution":{"observed_at":"2026-08-04T04:01:48.573191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.01156/citation-record","integrity":"/paper/2409.01156/integrity","json":"/paper/2409.01156/citation-record.json","paper":"/paper/2409.01156"},"outbound":[],"paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:22:06.841610Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2409.01156."}