{"as_of":"2026-08-14T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a2afe923a95fa214acf77af98f02718376e78f6272f163940bafadb7ed14881","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:02:07.964380Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:28:32.362554Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T13:02:18.322222Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2501.00289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, and Kaiming He","venue":null,"work_id":"f715d350-c578-4da5-8286-f5537c893442","year":2024},"citing_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T08:14:52.890145Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2501.17811"},"observation_digest":"sha256:a0f3eef2934d663f11f423ba47edafcdc8761f4b6752acc71f4f8884a1b43f66","observation_id":"eb9db4b8-1c2d-402f-870d-5a2b59dde72d","resolution":{"observed_at":"2026-05-11T08:14:53.136264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2501.00289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, and Kaiming He","venue":null,"work_id":"f715d350-c578-4da5-8286-f5537c893442","year":2024},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-12T12:45:39.253587Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:588e0cc170678fe70c8b8bcf85237bd9a25e3fd9a4cb837859f8d48bc117c9aa","observation_id":"49bb7643-8ddb-44c6-a10d-9aacbc2e1f4c","resolution":{"observed_at":"2026-05-15T16:24:27.656162Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2501.00289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, and Kaiming He","venue":null,"work_id":"f715d350-c578-4da5-8286-f5537c893442","year":2024},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-12T22:02:52.918587Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:0cdb33dfe99f739527d8e4456117c9d04fea7247aad004c4ecaae4d03e652cc4","observation_id":"0563063a-900d-40b3-9637-a4bb099a7ec9","resolution":{"observed_at":"2026-05-17T07:24:04.880861Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2501.00289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, and Kaiming He","venue":null,"work_id":"f715d350-c578-4da5-8286-f5537c893442","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:3a265645f43b35edcd1b55dc7ee5fec3c90ba76becc6f307d3626bf92e3d1f72","observation_id":"b40dcffc-9bae-4483-bd3b-485d13ea5e07","resolution":{"observed_at":"2026-05-17T03:46:06.166172Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-07T14:28:32.362554Z","title":"Dual diffusion for unified image generation and understanding.arXiv preprint arXiv:2501.00289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-08T15:52:44.818177Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.362554Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:ae222fcdad9d1abf9eadbd3ad10806c98acc9e9c6fa10712a7330cb055ce6a3e","observation_id":"ed0f780d-9212-47a9-96ab-f8b587539ce6","resolution":{"observed_at":"2026-08-07T14:28:32.362554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-07T14:25:22.394934Z","title":"Dual diffusion for unified image generation and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-12T13:37:21.795569Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:22.394934Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:a167277bdb1fb566e7338ce52d34f82aa06d3d649b94efaf6340120e648a83c6","observation_id":"ba11db8f-ae42-4811-9e68-11470bdeffb9","resolution":{"observed_at":"2026-08-07T14:25:22.394934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-07T14:04:56.901976Z","title":"Dual diffusion for unified image generation and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.901976Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:8796bdd8495d644ef9108a2413c647814f38633a14b4bd91f0c1c64539d0fca7","observation_id":"45345e19-f584-4399-ae16-ff1d85fe254c","resolution":{"observed_at":"2026-08-07T14:04:56.901976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2501.00289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, and Kaiming He","venue":null,"work_id":"f715d350-c578-4da5-8286-f5537c893442","year":2024},"citing_paper":{"arxiv_id":"2505.23606","last_updated":"2026-04-13T07:14:16Z","snapshot_observed_at":"2026-08-13T04:58:18.304861Z","submitted_at":"2025-05-29T16:15:48Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T12:59:31.454155Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.23606"},"observation_digest":"sha256:0203c64041b4612ac5ea30b00aea1b813329c2a4fac65bb86723614e554b00ba","observation_id":"00e001e7-be36-48f5-adc0-f3ca80abc84f","resolution":{"observed_at":"2026-05-19T13:02:18.324887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-07T12:19:22.862697Z","title":"Dual diffusion for unified image generation and understanding.arXiv preprint arXiv:2501.00289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:22.862697Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:e81088052cf80e5ea2748111940990a76288a579b2d7c917a93011e57eb637fb","observation_id":"e2932b53-4de1-4e27-9e66-765eb64805cf","resolution":{"observed_at":"2026-08-07T12:19:22.862697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-07T05:30:27.042171Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07963","last_updated":"2025-09-08T14:31:08Z","snapshot_observed_at":"2026-08-07T20:38:55.415021Z","submitted_at":"2025-06-09T17:38:45Z","title":"SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:27.042171Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2506.07963"},"observation_digest":"sha256:52f72081d210b193c2fa1822fcb49317017d01d1e055e6bd769c33fdbf289562","observation_id":"b74913d7-a687-49da-bcfd-170f68407a83","resolution":{"observed_at":"2026-08-07T05:30:27.042171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2501.00289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, and Kaiming He","venue":null,"work_id":"f715d350-c578-4da5-8286-f5537c893442","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:8690cdca0e3693e295a803d5b0dfbb7217f0bec69bc5695c7f8665f58e2ff26e","observation_id":"0ac33dff-0e29-4430-b42d-934d3e4af888","resolution":{"observed_at":"2026-05-12T18:51:15.997772Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00289/citation-record","integrity":"/paper/2501.00289/integrity","json":"/paper/2501.00289/citation-record.json","paper":"/paper/2501.00289"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T23:02:07.535461Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.535461Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:57277f8a437afb648fdeb800508a23d77aad6fd6ba2b944af191832825254d56","observation_id":"12614b94-8db3-4552-9103-3fcda37994f4","resolution":{"observed_at":"2026-08-10T23:02:07.535461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.541244Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.541244Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:03fc759e3601b216a5945abf00e25ee37fd4ed72b50ad90c236969b9f981dd83","observation_id":"4f830245-6bd7-45d8-b696-4ff51a1c28c3","resolution":{"observed_at":"2026-08-10T23:02:07.541244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.546269Z","title":"Reverse-time diffusion equation mod- els","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.546269Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:eeea9cf87126d3166a5fc5a683220a2946436a6353cdfbaa7084bf52595347ad","observation_id":"ad0f78d8-c3f1-4973-973d-25b316d7e2ff","resolution":{"observed_at":"2026-08-10T23:02:07.546269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.551047Z","title":"Structured denoising dif- fusion models in discrete state-spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.551047Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:2b8775f9693678d83bd74a09378182f7d2d6ee8dfecb6e1b5f4426ef3b9f1471","observation_id":"ca9ba559-4f16-4a77-b559-01469055e3e7","resolution":{"observed_at":"2026-08-10T23:02:07.551047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.556093Z","title":"Openflamingo: An open-source frame- work for training large autoregressive vision-language mod- els, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.556093Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:119304cb659bd50fa01cfe2ef34bc94ab136518f5803a683f1db0c2048381d51","observation_id":"56943249-3212-46e4-9730-4315a4b6d84b","resolution":{"observed_at":"2026-08-10T23:02:07.556093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.561312Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.561312Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:3daf5ee8b562f9a2bde3756f69fc8878699bbfce0a4760a8f40077ce8b3abea0","observation_id":"c1965964-ac7f-4f26-9c84-5c1b953a397b","resolution":{"observed_at":"2026-08-10T23:02:07.561312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.566136Z","title":"One transformer fits all distributions in multi-modal diffu- sion at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.566136Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:4e0ccdd0e0acb90e2f470cff6c67af4fad23936df34701eb9d5bb9a01345c12d","observation_id":"bd605e9f-67f2-4df8-bbc1-2ab7cac49b69","resolution":{"observed_at":"2026-08-10T23:02:07.566136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.571001Z","title":"Vizwiz: nearly real-time answers to visual questions","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.571001Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:2e30da23c95128e7e5d13395965e33c64e94f03bae2b2dc61217a055b8f39592","observation_id":"09d5f859-714c-4b32-a2ea-a9a90571c2ac","resolution":{"observed_at":"2026-08-10T23:02:07.571001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T23:02:07.576429Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.576429Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:509bfb94581c2eb86b9b29ec3c0704fcf07cc25ecc21dda29213ca270efd992f","observation_id":"cd54cb74-3fc5-49fb-ad6a-79fb2f58ec0a","resolution":{"observed_at":"2026-08-10T23:02:07.576429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.581347Z","title":"Pixart-α: Fast training of dif- fusion transformer for photorealistic text-to-image synthesis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.581347Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:3c7d2488b41d7850230cc52c6953ae444f755373f4db384997cd01cff52d6c46","observation_id":"7aee87cd-613b-4e54-9fcc-4bd4d9b978bd","resolution":{"observed_at":"2026-08-10T23:02:07.581347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-10T23:02:07.586294Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.586294Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:796023aa2170ed47e6d3123a6a81941e91870ed420d4a7644ff5466c6b7f6cc6","observation_id":"59817b7a-a16f-4ccd-9710-f1310c4e2075","resolution":{"observed_at":"2026-08-10T23:02:07.586294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-13T14:48:56.811001Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-10T23:02:07.591748Z","title":"Analog bits: Generating discrete data using diffusion models with self-conditioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.591748Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:f2d63fd34983b9f7fbfdabb64e02bd42ff04e261ee6f64a17d7045a47611082d","observation_id":"7203fae7-e095-4923-9c80-a057ab80e1cd","resolution":{"observed_at":"2026-08-10T23:02:07.591748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.596687Z","title":"Ex- panding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.596687Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:f50846fdecfdb647af46d06d7cd2aa4a8c5cc98ba12434cee541faf9bdd17329","observation_id":"2faa5857-6ba0-4b48-ad13-9d3c01f7b4fc","resolution":{"observed_at":"2026-08-10T23:02:07.596687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.601154Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.601154Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:213db27201e180613d046128245abab0aaad44ee06846df9a69786927ccaee88","observation_id":"de9daf0c-0f99-488d-b378-75d101d30b85","resolution":{"observed_at":"2026-08-10T23:02:07.601154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.606056Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.606056Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:eaa901093e87499445d27fc044e7d7beb6de168d0c6479bf401781e6b3cdfa60","observation_id":"090fbbe5-ba13-48da-a809-22bfe8708d5c","resolution":{"observed_at":"2026-08-10T23:02:07.606056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15089","last_updated":"2022-12-15T14:27:19Z","snapshot_observed_at":"2026-08-07T07:03:02.158312Z","submitted_at":"2022-11-28T06:08:54Z","title":"Continuous diffusion for categorical data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15089","snapshot_observed_at":"2026-08-10T23:02:07.610619Z","title":"Continuous diffusion for categorical data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.610619Z"},"links":{"cited_paper":"/paper/2211.15089","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:c7761717143b04c75e886b7820d1e5aa6473642c6e9a2b979750272eba180e4c","observation_id":"26b5011a-6190-45d1-95a2-7f294344c698","resolution":{"observed_at":"2026-08-10T23:02:07.610619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.615721Z","title":"DreamLLM: Synergistic multimodal com- prehension and creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.615721Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:0d1ce00e0baa6a854acaee56079dd185ebcc99fc41cce0ce1096cde63b19c4c8","observation_id":"d0df6326-2066-45a5-ab1e-fcf6cf96f285","resolution":{"observed_at":"2026-08-10T23:02:07.615721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T23:02:07.620267Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.620267Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:bb562eb53f0a826e478ca6540a72525b58c51715fe3082695c1766fde724fe5e","observation_id":"cd51f741-1ab5-49f0-946c-b8753c1bee38","resolution":{"observed_at":"2026-08-10T23:02:07.620267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.625688Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.625688Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:df8530624cc6960be1f4cddba78574c09122fec694478838f8f72d528386d5cc","observation_id":"ebce373a-e02e-4d81-b674-7c46aac7f1d7","resolution":{"observed_at":"2026-08-10T23:02:07.625688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:09.135838Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"988dee5c-5344-495c-a0be-8028bc327438","year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.630405Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:7378474ec860eeed6a06c3c1eed08af0578a7932bf391083498da4dbf5b2f6af","observation_id":"930f4408-39f7-43c5-82a4-c79502c14177","resolution":{"observed_at":"2026-08-10T23:02:09.140942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T23:02:07.635023Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.635023Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:9c30032eb91ee1380132d4faf42af140aede3fd92df366a38a1721ba13b1d876","observation_id":"a4d15cd5-6240-4594-ae61-5553ae042622","resolution":{"observed_at":"2026-08-10T23:02:07.635023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:09.119829Z","title":"Datacomp: In search of the next generation of multimodal datasets, 2023","venue":null,"work_id":"35322734-ac45-4f17-a1e3-4ac7b410a3c4","year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.639730Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:06c8488d4e0827f885cf57f3fc585f300d93ea7cfadd661e4cb1ef25dbc4edf0","observation_id":"78465120-2039-486d-8f58-0bce3a27cb57","resolution":{"observed_at":"2026-08-10T23:02:09.124939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-13T00:10:49.002216Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-10T23:02:07.643640Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.643640Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:88b547e1985a2af57acdaccff4f61b09291402abd68d87cde2f242ff38893068","observation_id":"70ca07cd-d460-41aa-aafc-a56c2210b7c7","resolution":{"observed_at":"2026-08-10T23:02:07.643640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15595","last_updated":"2024-11-05T10:02:42Z","snapshot_observed_at":"2026-08-14T09:45:11.873511Z","submitted_at":"2024-07-22T12:33:27Z","title":"Discrete Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15595","snapshot_observed_at":"2026-08-10T23:02:07.647704Z","title":"Discrete flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.647704Z"},"links":{"cited_paper":"/paper/2407.15595","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:18dba3033e3b98a0868fcbb88809d896070da35ef815243c2b11c2119b68775f","observation_id":"c3f792e5-a7e0-47b7-a4e7-37dc30453433","resolution":{"observed_at":"2026-08-10T23:02:07.647704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08041","last_updated":"2023-08-12T04:42:29Z","snapshot_observed_at":"2026-08-13T10:54:43.866365Z","submitted_at":"2023-07-16T13:41:39Z","title":"Planting a SEED of Vision in Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08041","snapshot_observed_at":"2026-08-10T23:02:07.652832Z","title":"Planting a seed of vision in large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.652832Z"},"links":{"cited_paper":"/paper/2307.08041","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:3b9590cead6cb988d4ac048689cb034062582e895b01b53e043421ecfe765d86","observation_id":"1cf65f1b-7790-4aa7-8ee8-aa3128b26611","resolution":{"observed_at":"2026-08-10T23:02:07.652832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.656919Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.656919Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:84c76b0ccc6dc3cef2dbcce936b3f95db0176d8e5282d4c0680f44d0ab43c47e","observation_id":"19b6c957-0c07-4a83-a829-506788e29008","resolution":{"observed_at":"2026-08-10T23:02:07.656919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:09.091336Z","title":"Making the V in VQA matter: Ele- vating the role of image understanding in Visual Question Answering","venue":null,"work_id":"35b324f7-a68f-4bca-8707-0ef65caefd9f","year":2017},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.660973Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:ea5989acd72d00dfbd991d2cfd2f7a365b14591a00df94e880b80cabb26885a5","observation_id":"4de7c55c-9195-4211-8e07-c22878fc2d6e","resolution":{"observed_at":"2026-08-10T23:02:09.096918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:09.073350Z","title":"Likelihood- based diffusion language models","venue":null,"work_id":"a1694610-45a5-4cdc-a471-96ce198d9414","year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.664995Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:bf4b26cb289e3312cb09198837b7cdec103b12b514d2e4db8668eeca7597c3c8","observation_id":"4cb9e3ad-bcfc-4183-be5f-ffe778fe1486","resolution":{"observed_at":"2026-08-10T23:02:09.079956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T23:02:07.669512Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.669512Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:4986962302dd08be0cd2fe41b95ae6f03967433700278ab40b47be9339ce57b9","observation_id":"9e65b7ce-101b-4ed8-8b00-b0d12639ba9f","resolution":{"observed_at":"2026-08-10T23:02:07.669512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:09.057935Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"e12d46f3-884f-417b-9057-948a14c2d980","year":2020},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.674312Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:e31a52375c4ff6f7b8183d58bc451d525ca7fe799a3cac14befa1feafb6d276a","observation_id":"849ff9ac-7ad1-4e6c-9deb-4d0c1c8f1937","resolution":{"observed_at":"2026-08-10T23:02:09.062955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:09.039980Z","title":"T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion","venue":null,"work_id":"83b95675-1657-4c67-8b33-28ecd8ed8b6f","year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.678758Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:a2798a3ba2dcb1881d2f6690e617b0fa6b2b7c5a8c5312b65797ec26e70b9583","observation_id":"3c038f1c-7be4-44df-8f1d-10a7c2728172","resolution":{"observed_at":"2026-08-10T23:02:09.046610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.683123Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.683123Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:6c8048497037a09f977b3d44d970abfd7802975108f6ddead0ff62fd5e0da00e","observation_id":"339486c2-7de3-4ebc-89db-faf2eb3fcdf9","resolution":{"observed_at":"2026-08-10T23:02:07.683123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-10T23:02:07.687815Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.687815Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:8a68ece12e20a6c9efb039e293966bd9fa1d65f922327ee9cc8c375e30506826","observation_id":"17cfd9b0-443e-4cd4-bbd1-3db1ba19e0df","resolution":{"observed_at":"2026-08-10T23:02:07.687815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00364","last_updated":"2022-10-11T13:20:30Z","snapshot_observed_at":"2026-07-06T13:16:16.926712Z","submitted_at":"2022-06-01T10:03:24Z","title":"Elucidating the Design Space of Diffusion-Based Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00364","snapshot_observed_at":"2026-08-10T23:02:07.692404Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.692404Z"},"links":{"cited_paper":"/paper/2206.00364","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:f4fd080313e090eee6ceba1c293e216c440a34d77b505966793b3378705d900d","observation_id":"aff5a9fe-a7dc-4ae5-94ea-5f27130a97b6","resolution":{"observed_at":"2026-08-10T23:02:07.692404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:09.013625Z","title":"Variational diffusion models","venue":null,"work_id":"40f8c6f2-2996-4bd3-a781-14ffacb124ca","year":2021},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.697148Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:76408042bc1d0f731fba05950463cbbec27de602d01d110a7f640d60a40cb558","observation_id":"532711f8-ed2a-4204-bd54-9568dc147d8f","resolution":{"observed_at":"2026-08-10T23:02:09.017992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T23:02:07.701668Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.701668Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:816674aa167e3dfb94ee271dccd5362c490c4b0271e63b50f6a8e1430bc3a98d","observation_id":"3922031b-bf94-46f9-8381-46ca209261f4","resolution":{"observed_at":"2026-08-10T23:02:07.701668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.706461Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.706461Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:2c37ba12de00054a99d43e1ebb5c23b0817ba7afc9aff3e6efb3c37023001344","observation_id":"6dfc06ce-04d2-4071-852d-491caa67c15e","resolution":{"observed_at":"2026-08-10T23:02:07.706461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.711246Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.711246Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:a84eff1e61aa7b99091ff3bb1c1000fb7fc250b6e405ee1b964511f47d2b7627","observation_id":"8bea8a73-09bd-4243-86d2-3e5ee57e83d3","resolution":{"observed_at":"2026-08-10T23:02:07.711246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-10T23:02:07.715985Z","title":"Playground v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.715985Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:97f6e4f1cea4ed4d8df086198f88fca166fc342b013f7261c004e15db6cf6d60","observation_id":"15968370-18d9-4465-bb75-559a4d0ddd94","resolution":{"observed_at":"2026-08-10T23:02:07.715985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.979076Z","title":"Likelihood train- ing of cascaded diffusion models via hierarchical volume- preserving maps","venue":null,"work_id":"22fc65df-f6fe-444e-a9a4-a2b9ec501dcd","year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.720826Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:058443dee7711609865d0ebf5151501e57b145f8308983b28d76fe38a9e7536c","observation_id":"7d208d2e-32fd-4b93-b2a4-6b727ecee7b4","resolution":{"observed_at":"2026-08-10T23:02:08.983628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.725598Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.725598Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:54dc084eaed31de211881e7ce5f695f386e74058fa685785a71e5475cf46cd67","observation_id":"20515266-7ab0-4758-b556-20ccb6555b9b","resolution":{"observed_at":"2026-08-10T23:02:07.725598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-14T09:04:40.967071Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-10T23:02:07.730197Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.730197Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:3da8f7772d6f2583671ba85ac7b7ebc751dcf0cd26ba0bb642f30f7008ffe668","observation_id":"97be30ac-5b86-452a-bebb-329aa00c7287","resolution":{"observed_at":"2026-08-10T23:02:07.730197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.954319Z","title":"Diffusion-lm improves control- lable text generation","venue":null,"work_id":"1e1b89e5-85bf-4539-bf89-51b3478854d2","year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.734889Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:7017a4c3af72ad0b58dca30598e7370193e7cbf0a584583284f57b965decea32","observation_id":"f64cbffb-6e9c-4e02-b47d-a5808e2e5de0","resolution":{"observed_at":"2026-08-10T23:02:08.959255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.739365Z","title":"Diffusion-lm improves control- lable text generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.739365Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:06d24741005074244491ecf4f23226a0626aa3412d5ba4b957dfd8a72af5ec09","observation_id":"104eaeb3-cee6-4a01-ba8e-7d73a36759c7","resolution":{"observed_at":"2026-08-10T23:02:07.739365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-08-12T23:44:16.304434Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-10T23:02:07.743838Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.743838Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:40be5b3ea3b262abaeadd8f381bc1248731d3f6c3eaeb5fd3b75ca1c649f51c9","observation_id":"c19cb48d-4b04-4567-aa31-da0a91370c34","resolution":{"observed_at":"2026-08-10T23:02:07.743838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.927959Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"6e8d05ef-4dd4-40a9-bc89-84c53817ef1d","year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.748528Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:050fa26f8d7a3db2fd64b68f13b08332214a7d1dbdb7ddeab51b49744b166f4b","observation_id":"4c961acc-18f1-44db-8fd7-ee2acfd6ec59","resolution":{"observed_at":"2026-08-10T23:02:08.933495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.752756Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.752756Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:a24ccbfee7905f5cd55ddf1ee694e636adc8439e69d2f9aff3f203f8f7ffe781","observation_id":"cf28e946-5e85-473b-a009-df6110367d9d","resolution":{"observed_at":"2026-08-10T23:02:07.752756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-10T23:02:07.757149Z","title":"Flow matching for generative mod- eling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.757149Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:807e897f2c08f0f270907ce24a595a5a8a48ced1ef6100b4e2dd0fa322781f14","observation_id":"97384505-e0a4-4802-aa41-59ab308a0144","resolution":{"observed_at":"2026-08-10T23:02:07.757149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.762283Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.762283Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:087a1c44b24b09b23a53dcb9a2d18d23a60b91359664fc3f798f65ee6e9d0566","observation_id":"cd9f8e1a-d532-4776-a7bd-1c0c12cf4239","resolution":{"observed_at":"2026-08-10T23:02:07.762283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.890943Z","title":"Visual instruction tuning","venue":null,"work_id":"441c7003-bb74-4927-ad21-a6e8a729bbd9","year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.766506Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:e87889de6be792d754ad7512321d3f88bfa2ab858ed701492d5544533c2c820c","observation_id":"11c76f7b-f8aa-4da4-9d17-5fa2ca516084","resolution":{"observed_at":"2026-08-10T23:02:08.896134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.875396Z","title":"World model on million-length video and language with blockwise ringattention, 2024","venue":null,"work_id":"2213dd16-3288-4259-922e-cbc7b549c1c7","year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.770647Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:bb1ea43a370a6eed825fadd73c6ab90dfc0e4bc0eee70997c3c1917765af3a56","observation_id":"526a1bdb-27f3-4409-a0c3-67a857194a3b","resolution":{"observed_at":"2026-08-10T23:02:08.880360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-10T23:02:07.774842Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.774842Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:3541e0204d8a68dbb52d0d620da2bb1bcbe2b016bf32d7671bad93fbb8d58172","observation_id":"bae71810-f060-4f91-ab9b-8b4ce1c5aa4b","resolution":{"observed_at":"2026-08-10T23:02:07.774842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.779204Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.779204Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:4ab5fc2f64095fb4431299ca3a3a9050355b4ac14a406cb62802eedb5b7ab636","observation_id":"c8aac922-88d2-4efc-a815-2823e36b8326","resolution":{"observed_at":"2026-08-10T23:02:07.779204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-10T23:02:07.783211Z","title":"Discrete diffusion language modeling by estimating the ratios of the data distribution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.783211Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:c6b04a634c2a24797632f91b661f67f44359473fee63ecf07ce10550bca050c5","observation_id":"c71bd467-dcdd-46b6-94df-917dc4bb56ac","resolution":{"observed_at":"2026-08-10T23:02:07.783211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.850094Z","title":"Latent diffusion for language generation","venue":null,"work_id":"e5785549-d135-48e2-952a-b807edc6e36c","year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.787945Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:4c8f4b9a77f70df2384a39ecfbd924d0fa8abc359d6c2adfcda09d1e5bc494f4","observation_id":"5b4b32d0-1100-457d-8898-d59f75a540e3","resolution":{"observed_at":"2026-08-10T23:02:08.855152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.792083Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.792083Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:fd5e6ce109552595fb91c5150c0b12274baf5d29d0e6f935fbddbe06ef27b886","observation_id":"2ebabc2a-7cc5-46b4-8fc2-fa2d594ed6cf","resolution":{"observed_at":"2026-08-10T23:02:07.792083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.823901Z","title":"Concrete score matching: Generalized score matching for discrete data","venue":null,"work_id":"f7049c3e-e20f-454e-a8f2-cf1dfe79c815","year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.796738Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:45bc19fedb8d1322c8f865bd173dd0bbbf3203aae1968d7928ccab5eb50e89f6","observation_id":"e08a9967-99b0-421c-86ce-53545f525c9c","resolution":{"observed_at":"2026-08-10T23:02:08.829639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.801299Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.801299Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:6896d43e5bfac9029ea771ffc2a9b12fbf9d552ab4c3e5ca2e820bedb151450f","observation_id":"2d0eafc0-37c1-4a2a-8b4a-d4fd2131db73","resolution":{"observed_at":"2026-08-10T23:02:07.801299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.805758Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.805758Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:0abf5b5e4a33d58babe86f2ecdbcbb8d2d19deab50190c35d880c203fd8a69e9","observation_id":"3428c539-73a8-4fe9-a21c-a568fc103fb3","resolution":{"observed_at":"2026-08-10T23:02:07.805758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-10T23:02:07.812547Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.812547Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:acacbe8bc7eecf9fe1d1d4d14b2d98672835a610ffabbe1aac382a57335d7e80","observation_id":"a3344b70-868b-40d7-8a1b-7eba5905ce38","resolution":{"observed_at":"2026-08-10T23:02:07.812547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.788618Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"2ad745e3-0d65-49c5-938f-53b6cda593fe","year":2018},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.818164Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:6611dd122c0bdc794a804d4364060c3f2f797cb8e154bb45dcc2f25d3ed6613e","observation_id":"ecad3bcf-0eff-44c1-9b2d-f9f8166f9037","resolution":{"observed_at":"2026-08-10T23:02:08.793632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.822762Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.822762Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:40a8ba405db57bcd6a059651b378e70b9572bf92f747a36fce1d039ed7079816","observation_id":"8fc8d875-4d0e-4d33-852a-cd441fbb3441","resolution":{"observed_at":"2026-08-10T23:02:07.822762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.762548Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"854505f7-4f5b-40bb-bc32-7d4243f95b92","year":2021},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.827412Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:55971a7158561eb13ca165cf84270b45a6839d285acca15e307cd7729c89aa42","observation_id":"4782ba2c-048e-4375-a8ee-a82646ce6121","resolution":{"observed_at":"2026-08-10T23:02:08.767699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.833069Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.833069Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:eb879c405dfd1818963656d7f5d10a05a378364930a8abef0d85bbf6db99356f","observation_id":"6318971a-872a-4f1e-aac3-58850c1bc3d5","resolution":{"observed_at":"2026-08-10T23:02:07.833069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-10T23:02:07.837870Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.837870Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:37d64118a74d23aea3f1f22e131324b7ff4aa32565d1dfdacbd92baba8bc2216","observation_id":"e59f7b03-a240-4b35-bbca-59ea593e955a","resolution":{"observed_at":"2026-08-10T23:02:07.837870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.842619Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.842619Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:54ce9ee25a6820a8c0fdc29db9da46395b46816865eb844e753e2d5f915d2d14","observation_id":"f2535679-94ca-49e0-9e45-5118b9863964","resolution":{"observed_at":"2026-08-10T23:02:07.842619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.725516Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"61650eb7-1b01-4b31-9257-515221ab1584","year":2022},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.847157Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:706ab4c6d7aef00f680c37ce9490d4efe580bf53b04298b1323fb4312329054d","observation_id":"b6ca8d73-2488-44ef-8329-5b8461d41994","resolution":{"observed_at":"2026-08-10T23:02:08.730758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07524","last_updated":"2024-11-10T20:34:34Z","snapshot_observed_at":"2026-08-12T23:45:16.671232Z","submitted_at":"2024-06-11T17:51:40Z","title":"Simple and Effective Masked Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07524","snapshot_observed_at":"2026-08-10T23:02:07.851664Z","title":"Simple and effective masked dif- fusion language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.851664Z"},"links":{"cited_paper":"/paper/2406.07524","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:f1aba2f884dd5030f092b2f9603585dacef0f49334451d20148570794df65f08","observation_id":"f69cd402-92ef-4d14-9658-0d9c7d1c8b49","resolution":{"observed_at":"2026-08-10T23:02:07.851664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.710619Z","title":null,"venue":null,"work_id":"f4e57203-868a-4b68-8566-3a2afc42742d","year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.856391Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:aff8dab728c7c4d2edd30dab05df09597365f4d2b3d989740e4e3ba0b31d0caa","observation_id":"9b150719-b58e-4344-a8e8-2ea6f480e9f6","resolution":{"observed_at":"2026-08-10T23:02:08.715296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.693671Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"d74699b2-cd0f-4735-8ef1-47a8d64af7c8","year":2015},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.860406Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:87edc3658abcbe51b58fdebc4648ac7fdbba8e03fcc522a0b6f2088ec45982c1","observation_id":"9d1ca3b6-2f14-4707-a057-10c6f6454802","resolution":{"observed_at":"2026-08-10T23:02:08.699612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-10T23:02:07.864348Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.864348Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:9dc9d5a583292cac0fe6a4d01a918ff2236ec17d5047eecd534112149b30cb06","observation_id":"f9163c04-2049-4aac-8b53-22507e1425d3","resolution":{"observed_at":"2026-08-10T23:02:07.864348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.677103Z","title":"Maximum likelihood training of score-based diffusion mod- els","venue":null,"work_id":"491ec00f-cc4b-4b3b-8b4b-601c537e3b9a","year":2021},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.868491Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:161730314bb7e43ca4e24eb9cae65fb00ec2e989255ef29737d6f7b77690d0c8","observation_id":"6652dbdd-6f6f-4f01-a86b-98a2ff2e03c0","resolution":{"observed_at":"2026-08-10T23:02:08.682194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-10T23:02:07.872745Z","title":"Generative pretraining in multi- modality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.872745Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:c8243cd361008a78210ea2decf43236610a8031c6c91a3a449afeb1fdf9e943e","observation_id":"ccf16b99-5962-467b-8070-713973b7da2f","resolution":{"observed_at":"2026-08-10T23:02:07.872745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.662585Z","title":"Any-to-any generation via composable diffu- sion","venue":null,"work_id":"1ba0284e-12fa-42a8-865f-b3f7dc8f26b7","year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.876852Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:fb06ebfb2d9066484b983276afcedcfe6a5483933060d1548c988514dc8cd685","observation_id":"4fc79b0a-0f60-4fd0-8c0d-667845e8388b","resolution":{"observed_at":"2026-08-10T23:02:08.667185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-10T23:02:07.880690Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.880690Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:bc7bfda80077d7cb0b7ae375cab4a3e186002b0ffe2a33aeb01a13ba93c85852","observation_id":"1a3a1287-3d8e-446a-af6a-7de4476f5680","resolution":{"observed_at":"2026-08-10T23:02:07.880690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T23:02:07.885317Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.885317Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:3bc0fb4ec32cf29c89246e08e2285952b9522cb37a4fb13e4592fe4f099fde23","observation_id":"5554944d-8fef-4dbc-a107-a310e4eb2d63","resolution":{"observed_at":"2026-08-10T23:02:07.885317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-13T06:27:06.478433Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T23:02:07.890346Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.890346Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:7f819ba4dba2aa732353855b6a3a63876919551f2fc4a46dc3b0e126d8d822ac","observation_id":"7a85e97e-667e-4a98-aeff-3fc37818342f","resolution":{"observed_at":"2026-08-10T23:02:07.890346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-10T23:02:07.895344Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.895344Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:f7c6646e9cfe7d769d176272e829eb1db10a69a633afbab2f2cc47e0b140d7ce","observation_id":"0ce767ee-4f28-479e-9a5b-7d095aa1768b","resolution":{"observed_at":"2026-08-10T23:02:07.895344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T23:02:07.900245Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.900245Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:77a9d5e412309b92f34f4d485fba18544f6d0260aa055c4728a46b8cfff74e48","observation_id":"49080754-2798-46a1-b8bc-35d5a6a1faca","resolution":{"observed_at":"2026-08-10T23:02:07.900245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.647261Z","title":"A connection between score matching and denoising autoencoders","venue":null,"work_id":"195931e0-0af1-4e54-94ee-c1446bb43e75","year":2011},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.905064Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:c83592bfa55d7942290ca49749d99202467729f59c849d8a0e92d832a8f0ebd1","observation_id":"1d1253d4-a196-485f-987d-2ec1352ebd18","resolution":{"observed_at":"2026-08-10T23:02:08.652669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-10T23:02:07.909908Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.909908Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:b3b121cf0746c29a56ea55480f6a872d80f6c178924a06c18c53744f94f6feea","observation_id":"6633b1ed-d3a6-4578-add5-08de184f0d66","resolution":{"observed_at":"2026-08-10T23:02:07.909908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-10T23:02:07.914690Z","title":"Vila-u: a unified foundation model inte- grating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.914690Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:db4474ffb0bc20ab1bbf4aa701faed58c2f573b3cd8e16b4d946a405a4541833","observation_id":"8af2dd09-1b19-40ad-90c6-8cb3addcb339","resolution":{"observed_at":"2026-08-10T23:02:07.914690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-10T23:02:07.919728Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.919728Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:6952f4fc3f8266e81126c4fc0b8f5e8ad44203f5027ec1bd8811601a243747fa","observation_id":"f4bcfe59-c79a-4ba7-afc4-d7bead0b7692","resolution":{"observed_at":"2026-08-10T23:02:07.919728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.631678Z","title":"Versatile diffusion: Text, images and variations all in one diffusion model","venue":null,"work_id":"57054484-7132-4175-b575-a697ab39069b","year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.924609Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:b0adc7643b44493ab488951df8bc6b4382ede4a7a015ad38b48d426c7704c0fe","observation_id":"7edc67d6-4819-48cd-a2de-de9b643e65fe","resolution":{"observed_at":"2026-08-10T23:02:08.636588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-10T23:02:07.929381Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.929381Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:c99c4a00d9b156f82ed456581291f272667ff10ffeed2a8b85c378e9312dfb16","observation_id":"135d5202-5355-4b3f-b18e-10559816eb6e","resolution":{"observed_at":"2026-08-10T23:02:07.929381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.616936Z","title":"Scaling autoregressive multi-modal mod- els: Pretraining and instruction tuning, 2023","venue":null,"work_id":"d7fbe2fa-e4ea-4e79-90de-1b7127c12660","year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.934634Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:b0e4067d8aa4889843d17e3eb0fb6daa5eaa8c35172336d6de3c30c1c39b0c38","observation_id":"0cba4a55-bae1-4657-9598-9a2761189983","resolution":{"observed_at":"2026-08-10T23:02:08.621701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:07.939321Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.939321Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:f19669989850fc1d90bd23322b3591d47fe85e4e9f93cf39a22f3d2a49c901a8","observation_id":"646f88c1-ec84-4785-a9a0-ca8a56d6aacd","resolution":{"observed_at":"2026-08-10T23:02:07.939321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-10T23:02:07.943972Z","title":"Transfusion: Pre- dict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.943972Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:54ab582d047d7e7d9f9deba1a2fe6f7ffc1ac630a1518e82923a222bef2317b7","observation_id":"9a96a108-076f-4901-a72c-4f033c1eab6a","resolution":{"observed_at":"2026-08-10T23:02:07.943972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T23:02:07.949502Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.949502Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:28f1f977751824919650287098be85f6c1c1d06fef87cadeb8018d4f3eccc2b2","observation_id":"ed18e898-53b6-4a40-80b4-02a19d08ff69","resolution":{"observed_at":"2026-08-10T23:02:07.949502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.592943Z","title":"Dual pretrainContinued pretrainInstruct","venue":null,"work_id":"c00b211e-a7d0-4a16-b062-23805d2960cd","year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.954670Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:dcdec1c2b362d548f1497216c0f4f816873121db68b18fa98e4df55a81692ad6","observation_id":"893d3773-da98-4aff-ad5c-b2ad65017bd2","resolution":{"observed_at":"2026-08-10T23:02:08.597705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.577738Z","title":"(B) FID ↓ SD-XL [60] Diff","venue":null,"work_id":"a2bda62f-2e49-4a83-8433-bef0be85031b","year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.959469Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:2a23aeec0bbd3a59df5db3c6546587b2e07a96a31df0c77d70c06246eb9e6b76","observation_id":"981ccc90-16f0-4585-9ab8-e18da6861801","resolution":{"observed_at":"2026-08-10T23:02:08.582647Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:02:08.559558Z","title":"On T2I CompBench, we find that after dual diffusion fine tuning the model performs worse in texture","venue":null,"work_id":"7f5e7bfd-d734-43e3-b737-2f4f534bde72","year":null},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.964380Z"},"links":{"citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:e1db43e6ba3da139ae9175dbc86e4d089c3b6b0a31f56045dfbc1cc1e621ef50","observation_id":"84498b3d-5063-4915-ba59-cbe31d579ee6","resolution":{"observed_at":"2026-08-10T23:02:08.566612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:47:26.570433Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 11 inbound Pith citation observations for arXiv:2501.00289."}