{"as_of":"2026-08-09T23:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c66ef9f6e98a1b283519fcdc41ac4ca24c76bc4426c21cd2ceae74bd67586d53","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T00:16:43.190961Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06856/citation-record","integrity":"/paper/2607.06856/integrity","json":"/paper/2607.06856/citation-record.json","paper":"/paper/2607.06856"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:1de2e9fb73fb7af44e817b0d76c4397e0673173df5a16b797fd457fed5cf9b6b","observation_id":"4226e5dd-79a6-49e8-90fb-2d5b018c1d64","resolution":{"observed_at":"2026-07-10T00:26:39.626831Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:f499d4b1da6719e3f9c5f536d21594e2d76c9ab84d44c7e15222225ca3fa303e","observation_id":"05d12c6b-149e-43d2-8139-2d3df8eb2573","resolution":{"observed_at":"2026-07-10T00:26:39.650395Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8922.2021","doi":"10.1109/iccv48922.2021","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Walk in the cloud: Learning curves for point clouds shape analysis, pp","venue":null,"work_id":"3820f598-11b0-45c3-8c99-0079181ac0a7","year":2021},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:baa9d09463d775d5fc434f499f0a952e01b5fec2bb99181e4d47d3aa5d302f89","observation_id":"afb13ef3-a1bd-48c4-9abc-a824187c2672","resolution":{"observed_at":"2026-07-10T00:26:39.079490Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15212","last_updated":"2025-07-09T16:58:07Z","snapshot_observed_at":"2026-08-06T10:25:48.518948Z","submitted_at":"2024-12-19T18:59:51Z","title":"Scaling 4D Representations","version":2},"cited_work":{"arxiv_id":"2412.15212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.15212","snapshot_observed_at":"2026-07-10T00:26:39.628379Z","title":"Scaling 4d representations","venue":"cs.CV","work_id":"d708ea1a-01d4-401d-ada6-b36a346e7bf9","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2412.15212","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:91a3a58a44b1e68fb868582810a23c1607ef1d2fb42c643d601eeb186cf35285","observation_id":"a3458577-a4a7-4f4c-a660-a63981166db6","resolution":{"observed_at":"2026-07-10T00:26:39.630147Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:2241ef8026481b6069f575bbd9deae5d8138a2808e6e380c4a6db431c17b7f43","observation_id":"9620d0e2-5efe-4e86-8c78-32f82fb9e2fa","resolution":{"observed_at":"2026-07-10T00:26:39.647632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/s0140525x12000477","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Whatever next? Predictive brains, situated agents, and the future of cognitive science , volume =","venue":"Behavioral and Brain Sciences","work_id":"ec83b012-c6d1-4ab3-a254-4d8b9dfed604","year":2013},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:18b6454b79c37e1a8d3aeb4b231bff1ec3ed1725468c96f443523da324dd0e77","observation_id":"fe557c13-b1d6-4c7e-8957-92ac7a91ba7f","resolution":{"observed_at":"2026-07-10T00:26:39.075687Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:50.717071+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:50.717071+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.254845Z","title":"Accessed: 2026-04-17","venue":null,"work_id":"a3ffc7c2-fde9-4a4d-9a0d-3d5e459d14ad","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:29144a070049d76447ce6ba55288779fc51a28fc6f5dd713ff4d658371d0b549","observation_id":"21174190-d36d-49e8-842e-c936c346c4fc","resolution":{"observed_at":"2026-07-10T00:26:40.255962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:a5c3dfee608514976445f3e352ad63e8f8528df35bcf30b879022a20fa8d7de7","observation_id":"ae41bede-a22c-4637-8305-daca36e05b63","resolution":{"observed_at":"2026-07-10T00:26:39.641686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-08744-2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:39.071787Z","title":"doi: 10.1038/s41586-025-08744-2","venue":"Nature","work_id":"88a709ea-10ab-4236-8f0d-6105f750a696","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:590bb2adff1ae09d3147c6e8854d66bfb77c5f00b9ed372c225d809c4320c149","observation_id":"476340bb-1b15-4b50-8511-7afbd7835261","resolution":{"observed_at":"2026-07-10T00:26:39.073411Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.881844+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.881844+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:0802ce1535758fdda8f54e6d790f370946ebbb8b559698b93783315dacd0d736","observation_id":"9485af90-32a1-488e-815d-c0a10451c24f","resolution":{"observed_at":"2026-07-10T00:26:39.644945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-06T07:23:27.418432Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":"2603.14482","doi":"10.48550/arxiv.2603.14482","metadata_source":"pith","pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2.1: Unlocking dense features in video self-supervised learning","venue":"cs.CV","work_id":"3da7cd7a-c3f3-4e48-9704-4320e54aec60","year":2026},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:f9ba4327f5bcbca22a9be686e8e21ee8b9a2f107ca22cc1fdd9d635684137ade","observation_id":"54b15358-3c4a-47c0-b59b-da5c8b931c46","resolution":{"observed_at":"2026-07-10T00:26:39.658479Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.252988Z","title":"A simple recipe for contrastively pre-training video-first encoders beyond 16 frames.2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 14386–14397,","venue":null,"work_id":"094f1b1f-7cbb-4819-82f2-2158ca860c30","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:f36c81638192d3a8a0c9862cf81d9647c5bb74b1b5f9c400c1f6735b8c33342d","observation_id":"1b609cff-0a19-4121-9a35-6161312c2e27","resolution":{"observed_at":"2026-07-10T00:26:40.254281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8922.2021","doi":"10.1109/iccv48922.2021","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Walk in the cloud: Learning curves for point clouds shape analysis, pp","venue":null,"work_id":"3820f598-11b0-45c3-8c99-0079181ac0a7","year":2021},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:87b81ed8ab82860d45d3871b865a0537dc1afcc17ef2792e7def1a31a4b52df1","observation_id":"c9737ae7-86b5-4b4c-bbf7-8795e08d310c","resolution":{"observed_at":"2026-07-10T00:26:39.075356Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":"2412.03555","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-07-10T13:27:05.580089Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","venue":"cs.CV","work_id":"dc984d60-8996-44cb-8163-88e7526073b7","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:c9447d9693af381c598a3315a2a3d318edd599ccf065550461d99596625c8151","observation_id":"2247903f-0719-48cc-8eaf-f2e9a1063933","resolution":{"observed_at":"2026-07-10T00:26:39.653175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:9cc3b47faf18ae864b8eb145475fee616d28cd6a05dd5cabd32cd61cc56ba872","observation_id":"9e8f8999-e3ee-43a3-a8ea-35e4c9ddc3c3","resolution":{"observed_at":"2026-07-10T00:26:39.655810Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:cc202ec4a8fb67148fc26eaec4b761bd7565c25d95fa32b349e3f075f16052d0","observation_id":"911d4e0d-d8a7-461d-8af8-46884e9f7242","resolution":{"observed_at":"2026-07-10T00:26:39.636319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:4d4b395dd75dce7a8f4b92b277515191510bc467e5f6f68d94995958324c9322","observation_id":"12928339-f65f-4e6a-8c5c-3913658eeaa3","resolution":{"observed_at":"2026-07-10T00:26:39.633409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73013-9_23","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://doi.org/10.1007/978-3-031-73013-9_23","venue":"Lecture notes in computer science","work_id":"455df6f5-f5ce-4bd6-81e3-dc86f6b57a2a","year":null},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:3912f2e0f47bdf3ec110ffea0ea4d95d8fd3000a822295c0c05cbd01dbed8793","observation_id":"7846d0c7-704a-4678-bac8-79df2639d526","resolution":{"observed_at":"2026-07-10T00:26:39.072377Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:2e61c50c2f4c03304cdb33812b3c324e6bff0dff767e3f2e230203f96c109f97","observation_id":"aa4ea3b1-c690-484e-a86f-6a14c1f70746","resolution":{"observed_at":"2026-07-10T00:26:39.639035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.249776Z","title":"14 A Mutualk-NN alignment metric We describe the Mutual k-Nearest Neighbours (MkNN) alignment metric used throughout the paper, following [Huh et al., 2024, Zhu et al., 2026]","venue":null,"work_id":"802eecce-fb25-43ad-887c-e2472219dc9b","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:5c8833905630cf59439c5fef914365b643acc3616db91fe2e8cb183dae7f4c91","observation_id":"2362a645-e376-416c-bbee-df51a3d874a0","resolution":{"observed_at":"2026-07-10T00:26:40.250928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.251449Z","title":"Best Single block","venue":null,"work_id":"568db4dc-f0be-4f59-a5ab-4b9c8fefc582","year":2017},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:3c2713b5f0a7425a2588a1c35045373bcd767f4df8e0483592c96b3b3c1f5a73","observation_id":"bf9563af-9efb-409e-87a2-e19edb9fec02","resolution":{"observed_at":"2026-07-10T00:26:40.252441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.247919Z","title":"The linear decoder presents frames that are sharper, but temporally misaligned with the ground truth, as compared to the attention head","venue":null,"work_id":"525d0f32-185b-489e-b26b-accd9ac8c746","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:c53e48585efa77c6e110532ad0458630c26af97698226fb033e4525ff0eab653","observation_id":"249aafaa-771b-43ac-bd02-f4bc5a525261","resolution":{"observed_at":"2026-07-10T00:26:40.249176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.245684Z","title":"It plateaus after 10k steps so that the LLM is still updated very slowly to avoid catastrophic forgetting","venue":null,"work_id":"e8ef9c3c-9e6b-4829-8d8f-b85cd0c9d33d","year":2014},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:5b112b087244f81083aa376181038fb80f3308e7eefcba2c2068547ca2ad9648","observation_id":"f55dd9ea-e6cd-4d07-a874-21a46d25f479","resolution":{"observed_at":"2026-07-10T00:26:40.247348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":6},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.06856."}