{"as_of":"2026-08-10T03:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea2eb717416ed61ca5e2d7ea71aa166875f97e74ad76f94b2ee216343f01f2d0","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:41:15.586140Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T17:05:52.493660Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T17:08:00.954550Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"cited_work":{"arxiv_id":"2508.21044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21044","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmg-vid: Maxi- mizing marginal gains at segment-level and token-level for efficient video llms","venue":null,"work_id":"b7fd4ad9-ea98-4087-810b-822ebaf383ad","year":2025},"citing_paper":{"arxiv_id":"2604.04055","last_updated":"2026-04-05T10:59:48Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T10:59:48Z","title":"DINO-VO: Learning Where to Focus for Enhanced State Estimation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T17:05:52.493660Z"},"links":{"cited_paper":"/paper/2508.21044","citing_paper":"/paper/2604.04055"},"observation_digest":"sha256:02034485542e12308ec16a88cb1ab0d1344462d2fd40af1bfe36b340096356db","observation_id":"29f1ba24-1c86-4ce9-8209-8e21e967bea8","resolution":{"observed_at":"2026-05-13T17:08:00.956426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"cited_work":{"arxiv_id":"2508.21044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21044","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmg-vid: Maxi- mizing marginal gains at segment-level and token-level for efficient video llms","venue":null,"work_id":"b7fd4ad9-ea98-4087-810b-822ebaf383ad","year":2025},"citing_paper":{"arxiv_id":"2604.20937","last_updated":"2026-06-19T12:00:35Z","snapshot_observed_at":"2026-08-02T23:37:34.955988Z","submitted_at":"2026-04-22T13:28:53Z","title":"Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T00:43:44.921189Z"},"links":{"cited_paper":"/paper/2508.21044","citing_paper":"/paper/2604.20937"},"observation_digest":"sha256:1cd446fb80b4bd6469480d9ac43d426a4d9245be42702ebccbe573e47c7a672a","observation_id":"d356d0ca-6110-45a7-ab72-1ed6e6e22b76","resolution":{"observed_at":"2026-05-10T00:49:48.956060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.21044/citation-record","integrity":"/paper/2508.21044/integrity","json":"/paper/2508.21044/citation-record.json","paper":"/paper/2508.21044"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16117","last_updated":"2024-12-20T18:01:58Z","snapshot_observed_at":"2026-08-10T02:13:56.094339Z","submitted_at":"2024-12-20T18:01:58Z","title":"PruneVid: Visual Token Pruning for Efficient Video Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16117","snapshot_observed_at":"2026-08-05T14:41:15.535604Z","title":"Li, B.; Zhang, Y .; Guo, D.; Zhang, R.; Li, F.; Zhang, H.; Zhang, K.; Zhang, P.; Li, Y .; Liu, Z.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.535604Z"},"links":{"cited_paper":"/paper/2412.16117","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:d85341e5b0779c9b1dd43226f5b14e34f168f9f8b4bcd9266f79324470d8e574","observation_id":"f29c4805-84c0-4a34-92c7-6508dc49d3ec","resolution":{"observed_at":"2026-08-05T14:41:15.535604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:41:15.541099Z","title":"In European Conference on Computer Vision, 323–340","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.541099Z"},"links":{"citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:c6a53d1d598e0333c87667840cc4dd2543be3dccaa8272dafcce4bcc1f7f14c9","observation_id":"ce4e96b2-8cef-4572-8cf7-50b4b1ef4c25","resolution":{"observed_at":"2026-08-05T14:41:15.541099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:41:15.547335Z","title":"arXiv preprint arXiv:2403.15388","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.547335Z"},"links":{"citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:a3f18549843eccdade7994de9aabcf6e5412eef07c8f83e6777bd93960e3ce60","observation_id":"cbfd5e3d-863a-4930-afec-362e3a42d90c","resolution":{"observed_at":"2026-08-05T14:41:15.547335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:41:15.552875Z","title":"arXiv preprint arXiv:2505.21334","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.552875Z"},"links":{"citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:fc4fe77e7045ebcb1d65d5fa6c63f2803c0ec3d4fe0aca18ba151d407e0e3208","observation_id":"1fb9ee88-8002-412b-98db-60ff0724ad84","resolution":{"observed_at":"2026-08-05T14:41:15.552875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:41:15.559338Z","title":"arXiv preprint arXiv:2503.11187","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.559338Z"},"links":{"citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:bda92a44e060ec0194f0d64a9f91cb0e6cc367cd990691d301ad1e23f51b2d2a","observation_id":"e844714e-1986-46ad-abc5-1084ac886157","resolution":{"observed_at":"2026-08-05T14:41:15.559338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-09T10:29:21.701927Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21862","snapshot_observed_at":"2026-08-05T14:41:15.565494Z","title":"arXiv preprint arXiv:2506.21862","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.565494Z"},"links":{"cited_paper":"/paper/2506.21862","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:a4f9c2017fcf35de70b25fc1b153e905e02c497c347cb61c7b60e03cfda461ee","observation_id":"6e288fbc-89bf-4447-b45b-1edfde484ffc","resolution":{"observed_at":"2026-08-05T14:41:15.565494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T14:41:15.570938Z","title":"arXiv preprint arXiv:2409.12191","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.570938Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:93959953f8a0b253667205349fb94086d13a13b13969e3267bdec43f096f8b7d","observation_id":"ea89fa3a-6c78-4761-b489-6d1bd969cae8","resolution":{"observed_at":"2026-08-05T14:41:15.570938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-05T14:41:15.575985Z","title":"arXiv preprint arXiv:2410.17247","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.575985Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:57c053900dc90616bd2ef92d123fca8bcd491aee5ef9564d39ee28106f4eb3d0","observation_id":"e26d286f-8408-4b14-bce5-80b80213c53a","resolution":{"observed_at":"2026-08-05T14:41:15.575985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T14:41:15.580800Z","title":"In Proceedings of the Computer Vision and Pattern Recognition Conference, 29836–29846","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.580800Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:04668e0052a2e0dafdc62cdb37ce08a2cf71eec3eefc21c89480c21a12b56343","observation_id":"f5871a72-838b-4606-a26c-86655c41fd12","resolution":{"observed_at":"2026-08-05T14:41:15.580800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-05T14:41:15.586140Z","title":"arXiv preprint arXiv:2406.04264","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.586140Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:27d1d8a08774eb2313f00a8d73f28b733cb50bc3be9aeaaac7ebf45514bc7c0e","observation_id":"3852654f-126a-4d63-bc82-d74c946be87f","resolution":{"observed_at":"2026-08-05T14:41:15.586140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:41:15.530096Z","title":"arXiv preprint arXiv:2411.17686","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.530096Z"},"links":{"citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:4fe7269f4d5dbbee7594a7df6c74f07cf39593d5dd0a46c1a9b8b1c4fde24e69","observation_id":"5901147d-987a-471d-a87d-180b646201cc","resolution":{"observed_at":"2026-08-05T14:41:15.530096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-05T14:41:15.525180Z","title":"In Proceedings of the Computer Vision and Pattern Recognition Conference, 9392–9401","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.525180Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:33c7f33f3b0f3f6e7526a847b66ff2d99cdc61ca32f0c80fb7d82b4c572959c7","observation_id":"09ded1e6-3c85-45f7-881a-d26649f03049","resolution":{"observed_at":"2026-08-05T14:41:15.525180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T09:10:28.827366Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 2 inbound Pith citation observations for arXiv:2508.21044."}