{"as_of":"2026-08-08T21:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d30166897158e7c3e1510b31ae7e0be44290e87c8b0ed3f9b3b02954bce5198a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:24:46.358407Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:50:24.280970Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-08T15:24:46.358407Z","title":"LastName, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":324,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.358407Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:74482d98d3cbb1e7c65d0d925cf677ecc3a0e7563f9e7dfdb7f8f5db21fcb23d","observation_id":"0bec555d-1264-4718-b863-d5dba6560ffc","resolution":{"observed_at":"2026-08-08T15:24:46.358407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":"2412.09604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding","venue":null,"work_id":"31375364-66fe-4498-ab9f-41e27c349bd2","year":2024},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:72495b0f8525556cee10b56a79d987a67de702974951e30c7fd880f44722177b","observation_id":"d7bfb031-8595-4721-b910-a1f59cedd831","resolution":{"observed_at":"2026-05-15T16:24:27.644062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-07T12:53:23.378411Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding.CoRR, abs/2412.09604, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.378411Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:f4df0f9f778823e61af1f32098fbedcab50ca039db03833e3bce94c4231d31ca","observation_id":"d4fa1d2f-af8a-4a60-aea4-08ba69542773","resolution":{"observed_at":"2026-08-07T12:53:23.378411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-07T12:44:14.957297Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding.arXiv preprint arXiv:2412.09604, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-07T12:38:06.235637Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.957297Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:8857f707ada3b66b40d1263560f62524ba35f20c5fc1fcdb544e00f5f5cb7196","observation_id":"e06dda0f-75f6-4bd1-8c8d-770a35ed0620","resolution":{"observed_at":"2026-08-07T12:44:14.957297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":"2412.09604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding","venue":null,"work_id":"31375364-66fe-4498-ab9f-41e27c349bd2","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:a07ee2332509cb4c133858991263cf2532bd5a1eb984737147b44b899f3deed8","observation_id":"5c8e9261-e7f5-452b-b842-2ef5ab478aef","resolution":{"observed_at":"2026-05-12T18:51:15.918479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-06T16:49:57.751825Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.751825Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:9afab051b10c54511f687bd947ddd843cb5bfd600175f78b0ad2f8ea41bbf97d","observation_id":"718b4b77-42d6-4f16-baa8-b702afb4b3c8","resolution":{"observed_at":"2026-08-06T16:49:57.751825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":"2412.09604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding","venue":null,"work_id":"31375364-66fe-4498-ab9f-41e27c349bd2","year":2024},"citing_paper":{"arxiv_id":"2605.14853","last_updated":"2026-05-21T23:48:52Z","snapshot_observed_at":"2026-08-01T12:51:06.128938Z","submitted_at":"2026-05-14T13:59:29Z","title":"Discrimination Is Generation: Unifying Ranking and Retrieval from a Tokenizer Perspective","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T05:47:36.536059Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2605.14853"},"observation_digest":"sha256:ec0eae501371c5d21836766286e4730837cad11638e7f0d59d3ec9b91eb50958","observation_id":"1547e029-5114-4d1b-8b0e-5954bf0be3ca","resolution":{"observed_at":"2026-05-25T05:50:24.283929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.09604/citation-record","integrity":"/paper/2412.09604/integrity","json":"/paper/2412.09604/citation-record.json","paper":"/paper/2412.09604"},"outbound":[],"paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2412.09604."}