{"as_of":"2026-08-09T12:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:089ba86fec5beb6354cc0ab6ab1ccb97112a4c5e82527e3adc27be4c62a8ac6e","coverage":[{"denominator":178,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:05:03.315466Z","state":"measured"},{"denominator":111,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":111,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:15:21.721749Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-05T11:41:02.728596Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-08-05T20:15:21.721749Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-05T20:14:58.845639Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:21.721749Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2508.10875"},"observation_digest":"sha256:1d38afc418bd5cd9d60446e89bf02757198c7d318d5e9112b208f5bbbec52813","observation_id":"7938a21f-4eeb-415c-97a7-3b94b7cfc3b4","resolution":{"observed_at":"2026-08-05T20:15:21.721749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":"2505.20147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-07-05T11:41:02.728596Z","title":"FUDOKI: Discrete flow-based unified understanding and generation via kinetic-optimal velocities","venue":null,"work_id":"69def97c-6b34-442e-bb6f-53741695848c","year":2025},"citing_paper":{"arxiv_id":"2509.21912","last_updated":"2026-04-15T06:09:32Z","snapshot_observed_at":"2026-08-02T07:15:59.205489Z","submitted_at":"2025-09-26T05:51:31Z","title":"Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-18T14:13:48.523955Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2509.21912"},"observation_digest":"sha256:6dacf7c7dcf335b2df52cffeede922e92e424affb117ec71e504127f43a40614","observation_id":"5fab91ed-cdb0-4945-9d2e-f0487e0dbc96","resolution":{"observed_at":"2026-05-18T14:16:27.823170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":"2505.20147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-07-05T11:41:02.728596Z","title":"FUDOKI: Discrete flow-based unified understanding and generation via kinetic-optimal velocities","venue":null,"work_id":"69def97c-6b34-442e-bb6f-53741695848c","year":2025},"citing_paper":{"arxiv_id":"2603.26320","last_updated":"2026-08-06T10:15:07Z","snapshot_observed_at":"2026-08-09T11:10:07.381389Z","submitted_at":"2026-03-27T11:38:43Z","title":"DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T22:59:21.473359Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2603.26320"},"observation_digest":"sha256:86f3576560f56f396782e95aee3b6f6892a17f50dd42d8a0471e22668eaff18b","observation_id":"5ee8038c-463c-4d80-8abd-026fde5638ee","resolution":{"observed_at":"2026-05-14T22:59:34.043445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":"2505.20147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-07-05T11:41:02.728596Z","title":"FUDOKI: Discrete flow-based unified understanding and generation via kinetic-optimal velocities","venue":null,"work_id":"69def97c-6b34-442e-bb6f-53741695848c","year":2025},"citing_paper":{"arxiv_id":"2604.16514","last_updated":"2026-07-12T15:32:26Z","snapshot_observed_at":"2026-08-09T10:15:00.063934Z","submitted_at":"2026-04-15T09:17:38Z","title":"BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T14:28:47.505755Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2604.16514"},"observation_digest":"sha256:e05142233b02b4b1107813c724eaf9fc33894aed2c729b1b41d4f4648031c9d6","observation_id":"1bbe8ea2-1a6e-4fbb-988c-df81dc05d22c","resolution":{"observed_at":"2026-05-10T14:30:30.660105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":"2505.20147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-07-05T11:41:02.728596Z","title":"FUDOKI: Discrete flow-based unified understanding and generation via kinetic-optimal velocities","venue":null,"work_id":"69def97c-6b34-442e-bb6f-53741695848c","year":2025},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-08-08T16:34:03.216972Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T05:32:54.235578Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:7274b6c9634c652e74c0985cc087bb04ffcc091601293cf1d724ca69ade50980","observation_id":"7d2f5983-b12d-4e73-908e-b5b3ea887e0c","resolution":{"observed_at":"2026-05-10T05:36:01.889481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":"2505.20147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-07-05T11:41:02.728596Z","title":"FUDOKI: Discrete flow-based unified understanding and generation via kinetic-optimal velocities","venue":null,"work_id":"69def97c-6b34-442e-bb6f-53741695848c","year":2025},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-08-08T16:34:03.216972Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-05T11:32:38.636335Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:c4ea42a0af43051efb7e664ee76f6c239d161d289e134217cea391005dbc6a73","observation_id":"f7f62af5-c6db-4057-85c9-ea7f551df780","resolution":{"observed_at":"2026-07-05T11:41:02.730254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":"2505.20147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-07-05T11:41:02.728596Z","title":"FUDOKI: Discrete flow-based unified understanding and generation via kinetic-optimal velocities","venue":null,"work_id":"69def97c-6b34-442e-bb6f-53741695848c","year":2025},"citing_paper":{"arxiv_id":"2605.08724","last_updated":"2026-05-09T06:13:58Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:13:58Z","title":"SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T02:52:01.518301Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2605.08724"},"observation_digest":"sha256:ba9b3bff24bf1cf0f8198955372220bb60f74ae3117897e9f74e121dccf26db9","observation_id":"6d6dab0f-be0f-49f9-8a90-ed5935a107a3","resolution":{"observed_at":"2026-05-12T07:26:31.139664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":"2505.20147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-07-05T11:41:02.728596Z","title":"FUDOKI: Discrete flow-based unified understanding and generation via kinetic-optimal velocities","venue":null,"work_id":"69def97c-6b34-442e-bb6f-53741695848c","year":2025},"citing_paper":{"arxiv_id":"2605.08882","last_updated":"2026-05-09T11:06:33Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T11:06:33Z","title":"Discrete Flow Matching: Convergence Guarantees Under Minimal Assumptions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T01:47:08.976886Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2605.08882"},"observation_digest":"sha256:070f5b3efa87efb4715c648ac169a1ba2def712514f86aaef73a79cd1cfc2f3d","observation_id":"92b09563-0761-44f8-ac49-816d37abf3b3","resolution":{"observed_at":"2026-05-12T07:51:42.502998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":"2505.20147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-07-05T11:41:02.728596Z","title":"FUDOKI: Discrete flow-based unified understanding and generation via kinetic-optimal velocities","venue":null,"work_id":"69def97c-6b34-442e-bb6f-53741695848c","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:802b48b03491f80304c594bd8802fe0c7fd09c5524bdce36a87008c148de7d45","observation_id":"2d614183-073a-40d1-b8dc-a1449344745d","resolution":{"observed_at":"2026-07-02T03:06:29.415805Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":"2505.20147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-07-05T11:41:02.728596Z","title":"FUDOKI: Discrete flow-based unified understanding and generation via kinetic-optimal velocities","venue":null,"work_id":"69def97c-6b34-442e-bb6f-53741695848c","year":2025},"citing_paper":{"arxiv_id":"2606.24333","last_updated":"2026-06-23T09:11:24Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T09:11:24Z","title":"UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T00:50:22.839005Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2606.24333"},"observation_digest":"sha256:aca23d698bef7ed0c9d840fdf9e2597ec0685b30b92dc1c9d1aab87b20990b5f","observation_id":"cc12751c-e27c-4a5b-b2ed-845747d2d182","resolution":{"observed_at":"2026-07-04T16:09:57.466387Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-08-01T02:14:09.712121Z","title":"arXiv preprint arXiv:2505.20147 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.712121Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:df902fcd18e4dd0b4b17dbe55b75b0f67295b242fd6e38fdadb4094d473b1455","observation_id":"cd52193b-2f7b-45d8-89dd-1614479348c3","resolution":{"observed_at":"2026-08-01T02:14:09.712121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20147/citation-record","integrity":"/paper/2505.20147/integrity","json":"/paper/2505.20147/citation-record.json","paper":"/paper/2505.20147"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:52.894142Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:52.894142Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:e0b835362611723aeef2587724624d496a09c929c87b9427c6a99f9e49dc7e72","observation_id":"c1a2050a-50dc-4922-9ecc-560b97188b1b","resolution":{"observed_at":"2026-08-07T14:04:52.894142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:04:53.001703Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.001703Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:b5e31d7cf21e677bbdd7725d870eac87b4f6e3391c66f6f393f9c226f378bb62","observation_id":"d06f3e0a-b160-4abf-ad26-e98df6c9265a","resolution":{"observed_at":"2026-08-07T14:04:53.001703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:04:53.087151Z","title":"Hartshorn, Aobo Yang, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.087151Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:ab7ce48f8fbd49b53e0981e82e36061ecb17f0646aeb5c921a0fbdf748d7c1c3","observation_id":"9766cfe1-7c43-40a3-adee-c7e8565673da","resolution":{"observed_at":"2026-08-07T14:04:53.087151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:53.189524Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.189524Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:37fdf1a8bc2678b0132eace5c4c3a2b18d081964bca580513a81017335692673","observation_id":"557b361b-e49e-4301-af2a-f4f445f6ada3","resolution":{"observed_at":"2026-08-07T14:04:53.189524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:53.273869Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.273869Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:08204445ee363a92aea74d564a0c5ad326229040382506e4d13cbd07d1b65fb1","observation_id":"893607b1-69e4-4efa-af02-4b5edf3eb4ae","resolution":{"observed_at":"2026-08-07T14:04:53.273869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:53.355130Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.355130Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:2dc23d09773fd4092abf9a94327bd72c5e1689d9bb33b5d8bc87cfc47f713789","observation_id":"97d2b2f3-d6b7-4f33-a2c4-6fd32cfd1999","resolution":{"observed_at":"2026-08-07T14:04:53.355130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:04:53.432740Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.432740Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:832ff85f7ca8a5674abf7d2de7db742a3719dd85fb7f84ef6f71e65385cb3c03","observation_id":"db23d69b-55c2-44be-abb1-0feb49777ee3","resolution":{"observed_at":"2026-08-07T14:04:53.432740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:53.479004Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.479004Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:1dc0c2993b9eebe126f508df39406b11ca034fd55c759a58e1937c5361b39191","observation_id":"454ddda6-a733-44f4-b480-3e1225dfb1da","resolution":{"observed_at":"2026-08-07T14:04:53.479004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T14:04:53.530572Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.530572Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:f65331690fc13aea81d31ff7d090f08908cacc4f755ef222676368ffcd685966","observation_id":"d01f4598-f6a0-4977-a4f7-101b2ba3b4b4","resolution":{"observed_at":"2026-08-07T14:04:53.530572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T14:04:53.598580Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.598580Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:416a3d44e952127a7be35ed4e8f57aff601d7dfd2a14eaf6a777fc04fcb55ca9","observation_id":"4683a615-9f8c-4fd8-b3f7-400d37f7e149","resolution":{"observed_at":"2026-08-07T14:04:53.598580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:53.662581Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.662581Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:d3ff288d8964de55c747cb10169463fa8804eae0e08f33a4822ccdbef4ffe006","observation_id":"2323d415-217c-4847-bfb0-ef81d7169882","resolution":{"observed_at":"2026-08-07T14:04:53.662581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:53.750305Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.750305Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:e2aec0e9bf4fa82d4bd8c275cc162e4809360d03d37b344dfba39d76bbf64cd9","observation_id":"636b6e21-ad95-4f6d-b3a0-a963a6adae44","resolution":{"observed_at":"2026-08-07T14:04:53.750305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T14:04:53.892795Z","title":"Pixart-𝑎𝑙𝑝ℎ𝑎 : Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.892795Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:105957da296eff5fa7a9aa418438fc0fc025636a131309a94fb04e194bc0ad2c","observation_id":"eb910a6c-253f-4a62-b77b-d680bc3cd313","resolution":{"observed_at":"2026-08-07T14:04:53.892795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-07T14:04:53.994314Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:53.994314Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:e6a8ee8f94f8d2cc970ed2cf973c8e07c7a22fa860d61ba533594bf4c2dbc63b","observation_id":"a5e348ca-5944-4461-adfa-7f42f8129d5e","resolution":{"observed_at":"2026-08-07T14:04:53.994314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:54.051129Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:54.051129Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:50ad85e4e6a40c3603178eafba1726c16ab2528700b6e77acac35e5a57dad06e","observation_id":"94390c54-1090-4fc6-9be6-6c9c48ae45db","resolution":{"observed_at":"2026-08-07T14:04:54.051129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08041","last_updated":"2023-08-12T04:42:29Z","snapshot_observed_at":"2026-08-06T07:20:51.958343Z","submitted_at":"2023-07-16T13:41:39Z","title":"Planting a SEED of Vision in Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08041","snapshot_observed_at":"2026-08-07T14:04:54.247781Z","title":"Planting a seed of vision in large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:54.247781Z"},"links":{"cited_paper":"/paper/2307.08041","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:72c590fd9e3880d89a14b86d89358859541d6f1a20100bf60dba2c9de04d9aae","observation_id":"9121c834-8d28-4554-bafa-d53507f3dc9c","resolution":{"observed_at":"2026-08-07T14:04:54.247781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-07T14:04:54.366169Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:54.366169Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:77a8a6fd531b7bc9e9ca857cd2b2566b7e6eb25e2246404940438ed85aca6379","observation_id":"11016a83-596a-4a6e-bee4-aad63d187c44","resolution":{"observed_at":"2026-08-07T14:04:54.366169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:54.505810Z","title":"Emu3: Next-token prediction is all you need, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:54.505810Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:0d0452448de03d294e0a2f61d2b1a5cdcbcf0afd144e4bbb3373bae138e3c436","observation_id":"b821a411-f2e3-4a95-b6c6-3e93d6704e58","resolution":{"observed_at":"2026-08-07T14:04:54.505810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T14:04:54.628978Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:54.628978Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:ed18b11887666c5f5296d2173694e85bb932679f6b0aa5ed9deeeae3af93f94d","observation_id":"7cc05029-eff6-4938-9724-845eb0cc0041","resolution":{"observed_at":"2026-08-07T14:04:54.628978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T14:04:54.764534Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:54.764534Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:45ccd05af82999cb0091bc17896317e46570d2207eed4f03b66deff47a26dc7e","observation_id":"d171d038-a94b-4373-b222-57963cb0f648","resolution":{"observed_at":"2026-08-07T14:04:54.764534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:54.940447Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:54.940447Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:d393c8b4b852d5267eac9ded1e3334e0b90b98d7604468aca4d96ed1f5019afb","observation_id":"3f887847-1b4b-4e0d-a8e0-b141537f80dc","resolution":{"observed_at":"2026-08-07T14:04:54.940447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T14:04:55.018343Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.018343Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:59c3446c3fd080ccc46b35affd3307cefa0adaea0ddfff3a45a5b1d8efdd9bc8","observation_id":"72b3daa5-cb80-40be-8d0d-595107375aa1","resolution":{"observed_at":"2026-08-07T14:04:55.018343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.066665Z","title":"Illume+: Illuminating unified mllm with dual visual tokenization and diffusion refinement, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.066665Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:50f71d3dfde3b34028f4786c7d5abafe730ab79c1e6c3a140a7f375bc7bf982a","observation_id":"95f3b668-cc3d-46ab-a44f-4ef7ac551063","resolution":{"observed_at":"2026-08-07T14:04:55.066665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.161855Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.161855Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:56df505b6d857df77d2ee50fb870bd7fb457d33a7b3b53c8fb77d0eb62e5a4bf","observation_id":"9d79ce17-4fd2-49e5-9ba8-787a0ef4d3a4","resolution":{"observed_at":"2026-08-07T14:04:55.161855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.199306Z","title":"Hwang, Soumya Sanyal, Sean Welleck, Xiang Ren, Allyson Ettinger, Zaid Harchaoui, and Yejin Choi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.199306Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:fa8a0f8acaadee38b49bbc39a5e0d37f55ac7ad31690e750628daccae1fc4f5f","observation_id":"118b17c7-1120-408c-bc87-39974a88512b","resolution":{"observed_at":"2026-08-07T14:04:55.199306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06963","last_updated":"2025-07-29T03:57:01Z","snapshot_observed_at":"2026-07-06T17:42:49.471518Z","submitted_at":"2024-03-11T17:47:30Z","title":"The pitfalls of next-token prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06963","snapshot_observed_at":"2026-08-07T14:04:55.284361Z","title":"The pitfalls of next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.284361Z"},"links":{"cited_paper":"/paper/2403.06963","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:5ceb73b3896cb0b37e1d5be562900f75e951ddfa30ae9831cf6034ccf0f0dafa","observation_id":"29109999-bdad-4cb0-9c0b-2d873aa2b929","resolution":{"observed_at":"2026-08-07T14:04:55.284361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14157","last_updated":"2025-02-18T03:52:31Z","snapshot_observed_at":"2026-07-06T19:35:44.200337Z","submitted_at":"2024-10-18T03:48:53Z","title":"Beyond Autoregression: Discrete Diffusion for Complex Reasoning and Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14157","snapshot_observed_at":"2026-08-07T14:04:55.361338Z","title":"Beyond autoregression: Discrete diffusion for complex reasoning and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.361338Z"},"links":{"cited_paper":"/paper/2410.14157","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:2c41813356532fa19e24e4ff1248b6265854a65f954828057c70bc2ede4cc6a3","observation_id":"ee6bcc26-c9a3-42c4-8471-0480ce1f13f1","resolution":{"observed_at":"2026-08-07T14:04:55.361338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-07T14:04:55.454519Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.454519Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:5d92e7dcace0d435233dcba2e7f54b4c4fd6bbcbc00c67e93747259504beb65b","observation_id":"8f803c8a-825f-417a-a536-21852e44ef64","resolution":{"observed_at":"2026-08-07T14:04:55.454519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.571239Z","title":"Structured denoising diffusion models in discrete state-spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.571239Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:dfbf95480f18950ab1dcfe4441d24776be32bc361efd8e0493f81dbba6caad7c","observation_id":"7bce1405-d86a-47cb-8cc8-faa0a7b09366","resolution":{"observed_at":"2026-08-07T14:04:55.571239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.654115Z","title":"Discrete diffusion modeling by estimating the ratios of the data distribution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.654115Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:3d201b8106e3aba2313b5b6b914b019473a63c9764d9de20b74a151e25c3bbd9","observation_id":"d5350019-08ef-4869-9a03-a701ae7d2443","resolution":{"observed_at":"2026-08-07T14:04:55.654115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.747086Z","title":"Simplified and generalized masked diffusion for discrete data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.747086Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:0929d6a6d8d63527f2c45c1ccc945b1cf08ad60d82980c0cc99c67cf29084c10","observation_id":"515895c9-5225-4d24-b22e-51667697f591","resolution":{"observed_at":"2026-08-07T14:04:55.747086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.841729Z","title":"Simple and effective masked diffusion language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.841729Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:0d31af0ce32e00b0ac52a163c94efec78b6ea30e53ce1fe6816bb170776b671b","observation_id":"e3f3d6bc-b168-4c2d-89c7-df2311791e2e","resolution":{"observed_at":"2026-08-07T14:04:55.841729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:55.936733Z","title":"Discrete flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:55.936733Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:c65ab3087f4a73d13aa256a160db56b54ebbec61b3079b4f306692f0e3b9698d","observation_id":"b8adb77b-f844-4fa8-b17f-531e7296e865","resolution":{"observed_at":"2026-08-07T14:04:55.936733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:56.033731Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.033731Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:5e2e54872ed02ad816367c6dc801bce7fc3a55c25e622b91fe8098b94ca6b7c1","observation_id":"259dca27-6153-4b04-b29e-d90de1fe47f8","resolution":{"observed_at":"2026-08-07T14:04:56.033731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:56.155859Z","title":"Generative flows on discrete state-spaces: Enabling multimodal flows with applications to protein co-design","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.155859Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:025c8ecca6a08cd90b2b7b309b5dbe82cb8f5b97120bbf0a64dc208ae45e4396","observation_id":"c4a8de79-0f51-4e97-bb7c-6b56de394639","resolution":{"observed_at":"2026-08-07T14:04:56.155859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:56.267641Z","title":"URL https://www.inceptionlabs.ai/news","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.267641Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:353edaf59ff16fe9227204c0a8a53c62c7951ccd8abf79c2e924a60e26bd0771","observation_id":"a5e545d2-a5d0-4150-ad5f-c91395878700","resolution":{"observed_at":"2026-08-07T14:04:56.267641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T14:04:56.402891Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.402891Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:b4e8956f76b8b16a56fa33f05c4b16605b4c16275e36b9101faf1aa4b00245fd","observation_id":"d3252845-391e-4ed8-8564-25bebc7bed1b","resolution":{"observed_at":"2026-08-07T14:04:56.402891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T14:04:56.567632Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.567632Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:24b18cdf3af2b197d456e9c1f511cdc92544d1006f37e11de1f4fe279330c4d3","observation_id":"2eaeb6cb-6b90-484e-a368-ec39be947865","resolution":{"observed_at":"2026-08-07T14:04:56.567632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:56.668735Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.668735Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:bea0b767ad78488c854e1edb91235ee959c06ffd72add0098c4541c0bd1c3e86","observation_id":"516f93ed-57ba-40e8-aa40-443d0c92fff2","resolution":{"observed_at":"2026-08-07T14:04:56.668735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-07T14:04:56.761698Z","title":"Large language diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.761698Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:0eab4a1d604a1775e3dc03f1153882a91aa1ea0de56f62db22b2394a6872aa57","observation_id":"d3c0dfc9-9034-4a0a-8f65-5776a66aa78a","resolution":{"observed_at":"2026-08-07T14:04:56.761698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:56.821080Z","title":"Dream 7b, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.821080Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:7513dc649f214f4f1a663144533562278c0afb7b8f522b236be010f013e9c45c","observation_id":"631d0bb4-be91-4b6b-b597-8ddbb990a2b4","resolution":{"observed_at":"2026-08-07T14:04:56.821080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-07T22:18:33.579780Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-07T14:04:56.901976Z","title":"Dual diffusion for unified image generation and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.901976Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:203bf42d57de522fb1cc71f0652a76520296d38b31d33feaa9145ffc59682e24","observation_id":"45345e19-f584-4399-ae16-ff1d85fe254c","resolution":{"observed_at":"2026-08-07T14:04:56.901976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14842","last_updated":"2022-11-27T14:46:01Z","snapshot_observed_at":"2026-07-06T14:23:31.320164Z","submitted_at":"2022-11-27T14:46:01Z","title":"Unified Discrete Diffusion for Simultaneous Vision-Language Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14842","snapshot_observed_at":"2026-08-07T14:04:56.951731Z","title":"Unified discrete diffusion for simulta- neous vision-language generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:56.951731Z"},"links":{"cited_paper":"/paper/2211.14842","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:5f2e9a703e3d64e7bf357fbd9ac74b004e414a4d2d4a39586b9ac220a81ef563","observation_id":"24d9e19b-6303-413a-bbf3-646a55d82b0a","resolution":{"observed_at":"2026-08-07T14:04:56.951731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20853","last_updated":"2025-03-26T17:59:51Z","snapshot_observed_at":"2026-08-07T16:34:48.936382Z","submitted_at":"2025-03-26T17:59:51Z","title":"Unified Multimodal Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20853","snapshot_observed_at":"2026-08-07T14:04:57.037941Z","title":"Unified multimodal discrete diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.037941Z"},"links":{"cited_paper":"/paper/2503.20853","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:af8da396461d7287056a02495bc15bb85ff6581f63abb01a23cee33669f2f232","observation_id":"8a7ddd00-d69d-4127-bcbd-7de3b7e2b9ec","resolution":{"observed_at":"2026-08-07T14:04:57.037941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17891","last_updated":"2025-05-31T07:01:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-23T14:04:22Z","title":"Scaling Diffusion Language Models via Adaptation from Autoregressive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17891","snapshot_observed_at":"2026-08-07T14:04:57.107795Z","title":"Scaling diffusion language models via adaptation from autoregressive models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.107795Z"},"links":{"cited_paper":"/paper/2410.17891","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:532bd17c9d703c06e0661a2f6e558d0aded75d4709100774dae05ae0d0c7458c","observation_id":"4b174cf9-7e0e-4e02-ab50-dd8c81e95aec","resolution":{"observed_at":"2026-08-07T14:04:57.107795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-06T13:34:35.279373Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-07T14:04:57.190356Z","title":"Sana 1.5: Efficient scaling of training-time and inference-time compute in linear diffusion transformer.arXiv preprint arXiv:2501.18427, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.190356Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:677b6b7e110b81bcfdc0e56180553aedcca90a1aa220382919364be6b3db8e47","observation_id":"5bd7432a-5bd7-4cc2-9a71-2277744ba661","resolution":{"observed_at":"2026-08-07T14:04:57.190356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:57.273486Z","title":"Dancegrpo: Unleashing grpo on visual generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.273486Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:a0b2716bb4373d663d58042aae7be6c97bfb3256d20c2e6356871ec607626f06","observation_id":"8a287536-95fb-43e8-b179-b55524e88c6c","resolution":{"observed_at":"2026-08-07T14:04:57.273486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01934","last_updated":"2025-04-03T16:43:14Z","snapshot_observed_at":"2026-08-07T16:13:53.338367Z","submitted_at":"2025-04-02T17:45:00Z","title":"ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01934","snapshot_observed_at":"2026-08-07T14:04:57.327788Z","title":"Illume+: Illuminating unified mllm with dual visual tokenization and diffusion refinement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.327788Z"},"links":{"cited_paper":"/paper/2504.01934","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:93d65523b9a0cb189242508ba90b02bdcef4321e8fa1f5423c39a17ed52bbdcb","observation_id":"4daf39c0-2bfa-401f-8cad-40101393906b","resolution":{"observed_at":"2026-08-07T14:04:57.327788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:57.411925Z","title":"VILA-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.411925Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:46064899e5d5a543f23f646e6041b7a9439c8714fc94c95bba839cced5127fc3","observation_id":"be3146dd-8cf7-459a-a608-98c4b78936f1","resolution":{"observed_at":"2026-08-07T14:04:57.411925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T14:04:57.497040Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.497040Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:7d710d431897cee52b618272fc2f722f03a290fbac3da0a3b02f03ec1e758c9c","observation_id":"be7d454e-1ea6-4802-8b50-dfcf7255c269","resolution":{"observed_at":"2026-08-07T14:04:57.497040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:57.555386Z","title":"Unified language-vision pretraining in LLM with dynamic discrete visual tokenization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.555386Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:e1bfeb5ae67e52aea3d30804175a8390716306ef5b4f99c2aeaee8d84a279331","observation_id":"7ee0f59a-7eec-43d0-87b3-82e6d30bf694","resolution":{"observed_at":"2026-08-07T14:04:57.555386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T14:04:57.633027Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.633027Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:942c1b64a86e7d1198012c9c52ffd54b54bc94af26e8855cf3e4477acdc8f4ea","observation_id":"dbce4436-7354-453b-a11b-914505f55b45","resolution":{"observed_at":"2026-08-07T14:04:57.633027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:57.691101Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.691101Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:a01de6c7402b39219710a46153ad09dcc2e44295eea44c99b24fe4b48239457a","observation_id":"9e986136-9cde-44b3-bd4b-f25bb51d660f","resolution":{"observed_at":"2026-08-07T14:04:57.691101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:57.761658Z","title":"Diffusionbert: Improving generative masked language models with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.761658Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:8c8f9097491c802519fee6917edd2823a2fcead09ecb69a64c8f04ebee40a689","observation_id":"33a9a937-9203-4e14-96c4-1b152633a63e","resolution":{"observed_at":"2026-08-07T14:04:57.761658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:57.843795Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.843795Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:76aa95bd49dd845ea20f56e6425664d7dca42413459f3368a9527672894b1d55","observation_id":"abfef5d2-d562-4075-8b8d-35165a4bc48c","resolution":{"observed_at":"2026-08-07T14:04:57.843795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T14:04:57.901384Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.901384Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:84d9b38ebd33a9cf4a6c3cc4bef1cb5bb7dedeea7da56535561f2579f991ce7b","observation_id":"4116490a-c833-4136-9af7-14e168160f06","resolution":{"observed_at":"2026-08-07T14:04:57.901384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T14:04:57.989894Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.989894Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:aecf7db498d2235e4a527bd65e3fc44b3802c58fe28b0502c71746dcdb62fc49","observation_id":"b6e354e6-b377-4bf1-90e4-2954bd1181c7","resolution":{"observed_at":"2026-08-07T14:04:57.989894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:57.994253Z","title":"wendlerc/renderedtext, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:57.994253Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:8d61f207278d495fc157bfdadedfb213a249e3cd0842c1ae1bc8658d7fc04f97","observation_id":"2bf5523b-33b5-4c4f-93a7-d24eb14b9c9a","resolution":{"observed_at":"2026-08-07T14:04:57.994253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:58.065592Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:58.065592Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:9d6387627cb4c3ba6b6568a5db967fcf61bf81bd7f097af2c7ca88dbcf56ed97","observation_id":"180e9c8d-04e6-4591-93f4-45afe9049e9a","resolution":{"observed_at":"2026-08-07T14:04:58.065592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:58.133657Z","title":"Chart-to-text: Generating natural language descriptions for charts by adapting the transformer model, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:58.133657Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:1e857eaea86c07b4842913e32b5d20ec61ce3d16e6b73030d6e242a3bbe7b63b","observation_id":"c0efe589-9f20-4eb6-86dd-88ff569f833d","resolution":{"observed_at":"2026-08-07T14:04:58.133657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:58.242162Z","title":"Visualmrc: Machine reading compre- hension on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:58.242162Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:2d3882fb44657460187108cd084267331ad4a295f2ddfd4d31d279c46077abb3","observation_id":"e1206549-5bc3-4261-9251-af4a896f38c4","resolution":{"observed_at":"2026-08-07T14:04:58.242162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:58.330589Z","title":"G-llava: Solving geomet- ric problem with multi-modal large language model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:58.330589Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:c6736f1e59aa119011795116a0161d3150d6533be9065c2a7a1427de4c8be7c3","observation_id":"946e16cf-21bb-4a77-93bc-530a43a3a1e2","resolution":{"observed_at":"2026-08-07T14:04:58.330589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:58.422124Z","title":"Xing, and Liang Lin","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:58.422124Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:5c37b5e21efa3fff0a4c30146cb8672058cd9e3008eefcb7213fa33289f894f1","observation_id":"9fce5abe-f0ee-483b-bdcf-af20234e15a2","resolution":{"observed_at":"2026-08-07T14:04:58.422124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-07T14:04:58.508179Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:58.508179Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:1bf052b106118b5278fd6f4c68e5006048169473637f7013d657fa6bb07cd35f","observation_id":"356ccaf6-4178-44f5-b634-a9a3c7375158","resolution":{"observed_at":"2026-08-07T14:04:58.508179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:58.598819Z","title":"World model on million-length video and language with blockwise ringattention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:58.598819Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:06924de996978a1ecf79174b5ada540a935f54a77826e85497dc7b4812bd112d","observation_id":"608d9593-a179-42da-b8e3-f89ecada8317","resolution":{"observed_at":"2026-08-07T14:04:58.598819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T14:04:58.711136Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:58.711136Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:421c3a82fc6da60b00be9f83bce86dec3b5e2e2cb568e439ab69d40895375085","observation_id":"e91cac6a-9d61-4be5-8337-dcd7b674c884","resolution":{"observed_at":"2026-08-07T14:04:58.711136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:04:58.885542Z","title":"Sdxl: Improving latent diffusion models for high- resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:58.885542Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:f7ba01cf6f6f5236949bfc7745f58f646e572b56ef4c8274cb199fb7535b217a","observation_id":"d72b7cb6-759b-4c6e-8e72-dab9c8f573be","resolution":{"observed_at":"2026-08-07T14:04:58.885542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:59.052307Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:59.052307Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:9b56811463ecf849cb52b69de26f478537de725edb12a9446c42d632a38207ea","observation_id":"639ed477-c027-466e-843e-aecd9275f5de","resolution":{"observed_at":"2026-08-07T14:04:59.052307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-07T14:04:59.164314Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:59.164314Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:64200bb45f1386d56b0d272fd90dd1357e8e430e5ccf78eb9a39046fc0a29c5c","observation_id":"51ebc488-ffbf-4871-bacd-0cb52cff561e","resolution":{"observed_at":"2026-08-07T14:04:59.164314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-07T14:04:59.258830Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:59.258830Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:7d2344e462f558d5bc7dac939b67bf9e4ef562dc6965d74b41b69523a794dd09","observation_id":"d9455675-b83a-4d95-beea-188e4e763b43","resolution":{"observed_at":"2026-08-07T14:04:59.258830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:59.365597Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:59.365597Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:221d476332a670a0dd04d3a61b5d280f8d82c17a267fd5deae11c210220098ec","observation_id":"0ee9b758-72d2-4472-a2d9-593715f9512e","resolution":{"observed_at":"2026-08-07T14:04:59.365597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-07T14:04:59.529591Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:59.529591Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:6a806dc7a4ab7b637650c185e07402d0514ee4b0b15e7e800be3b655e5f60f4a","observation_id":"0205f82c-f161-429e-9c93-371945102ce1","resolution":{"observed_at":"2026-08-07T14:04:59.529591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-07T14:04:59.650981Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:59.650981Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:ae3d8e2d8f8ee8483a9ef697fa9e9232dce91895d91c27a7883b10f3469f660a","observation_id":"ea734a38-7f00-41dd-9e73-0c3226fbc66c","resolution":{"observed_at":"2026-08-07T14:04:59.650981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-01T18:43:37.910915Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-07T14:04:59.785169Z","title":"Llava-phi: Efficient multi-modal assistant with small language model.arXiv preprint arXiv:2401.02330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:59.785169Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:da32e7b5f6ad2cb070cc164205a32fef7de2eb8908fc896a72582067d0ddd571","observation_id":"62bdc963-0009-484b-8998-f6b6db471a92","resolution":{"observed_at":"2026-08-07T14:04:59.785169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:59.952940Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:04:59.952940Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:63da06817056e758ac4fa4c7c6825ed2e9d6ebdf33847d8a066bf92b9d07cc34","observation_id":"e0b17c29-69e1-48d5-9d54-25a7d565b4bc","resolution":{"observed_at":"2026-08-07T14:04:59.952940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T14:05:00.103130Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:00.103130Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:3096950ba252b3666dc44fb9877cc9088c61b9ebb3c5adefdba703e8a31d78f1","observation_id":"8ddb8461-d77c-4bfd-998f-58f3745bd411","resolution":{"observed_at":"2026-08-07T14:05:00.103130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:00.285717Z","title":"Introducing idefics: An open reproduction of state-of-the-art visual language model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:00.285717Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:e58e5e9419ca0fe8623d754d7d4df50ce7f7efccdfe9096a8ecec4fdb348b543","observation_id":"8057f8b4-a8d9-4940-b546-2217476ce832","resolution":{"observed_at":"2026-08-07T14:05:00.285717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:00.396906Z","title":"Unified language-vision pretraining with dynamic discrete visual tokenization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:00.396906Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:ea5ca3215c6bca0c1091707e4792e2fd11755f14bad25aa2cc9cda95333a470f","observation_id":"d7afa45c-ae24-4cd7-bc30-8283bc127c8c","resolution":{"observed_at":"2026-08-07T14:05:00.396906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T14:05:00.470954Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:00.470954Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:2b45d248e923e3590c7dd11cdc8cfc413327b5f691f99fb931a29e569debf086","observation_id":"a288f023-8bb1-4e83-98a7-cc8f9b59bfb1","resolution":{"observed_at":"2026-08-07T14:05:00.470954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:05:00.549878Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:00.549878Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:ad5585c09a08cb77de148d8ebf13e50231c26ff210d2ece0f083ab6e9fe4ee47","observation_id":"27cc4a4f-dce6-46b7-a579-aead07dadab0","resolution":{"observed_at":"2026-08-07T14:05:00.549878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T14:05:00.625941Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:00.625941Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:b750e94315f3671f125c1de2324706843c25751ca02fd8bf363327cb6a992180","observation_id":"c70f29be-085f-4c1a-b320-9a229d9baeef","resolution":{"observed_at":"2026-08-07T14:05:00.625941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T14:05:00.773460Z","title":"Evaluat- ing object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:00.773460Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:9229f79d6bb4baa7f2d7732666792318b8a8bbbf8000e146c67c131d3c666693","observation_id":"9cf071ae-eb3c-40a2-9a8d-13f5ba9565b5","resolution":{"observed_at":"2026-08-07T14:05:00.773460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T14:05:00.924654Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:00.924654Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:16f8a5396c0a4aabf4046a26d4902b301495ba64c7ae68ac316cd88fc59945a1","observation_id":"e6a730c6-f49e-44b6-a039-9b4b7dd5f33c","resolution":{"observed_at":"2026-08-07T14:05:00.924654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T14:05:01.070236Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:01.070236Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:7932a99e08043f81feb46f4aef494c690e9a8a37d9be79b2ad55f7b2ad313fe9","observation_id":"f9442855-c1f7-40af-bca1-0b4b52740018","resolution":{"observed_at":"2026-08-07T14:05:01.070236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T14:05:01.227959Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:01.227959Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:6e0e20868664f0aa6a467e567d914f3f34a0518fea218ffbac0d7ff9a671cd68","observation_id":"f0db4cdd-7d8a-46fd-8aa0-322d844a3618","resolution":{"observed_at":"2026-08-07T14:05:01.227959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:01.400652Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:01.400652Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:0e8a6b45ee20fa2429974074c9eb271802d84a705bfab084250cd3f3dc36ab51","observation_id":"f16fcff8-183a-48df-9fa0-0402126d77ec","resolution":{"observed_at":"2026-08-07T14:05:01.400652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:01.542154Z","title":"Mmmu: A massive multi- discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:01.542154Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:fd4e40023449c706a081adfa8e71e3f950bb05a917d1398ff61e1bffb7a9f3cc","observation_id":"cfb9a97b-0c24-421f-af97-1bc4efe5f708","resolution":{"observed_at":"2026-08-07T14:05:01.542154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T14:05:01.611547Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:01.611547Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:15953260d85acfaf1bb1263ce481c9dd102ac711a951a61b10d7d32bcb8e4cec","observation_id":"a717de63-b6ef-4029-b109-cebaf2e65ab5","resolution":{"observed_at":"2026-08-07T14:05:01.611547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T14:05:01.704476Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:01.704476Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:a4bf93c96160be30315f2e910160333cf966a2dedc6bb8d87da23c84d021b933","observation_id":"ef6700ac-f5f4-4846-b60a-0cefd3575d1f","resolution":{"observed_at":"2026-08-07T14:05:01.704476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-08-07T14:05:01.819382Z","title":"Flow-grpo: Training flow matching models via online rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:01.819382Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:ff3beb6cce552af3d29119cbfb09576abb1fcc9a246f1353924ebc993df2d801","observation_id":"c2a388f0-818e-46b1-a604-67ae8745ee15","resolution":{"observed_at":"2026-08-07T14:05:01.819382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T14:05:01.991113Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:01.991113Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:c5d46e9d24c790d63ef4928a4b1178f00610c6ca563b4c1c90f8e61c13197118","observation_id":"083b6baa-5d7f-478c-88d3-a32dcd1b8eb4","resolution":{"observed_at":"2026-08-07T14:05:01.991113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:02.113485Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:02.113485Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:5f739c3b58381896500a587a8ae9c1994a5b10b72e5f0e49e7468249c02036e4","observation_id":"f2ee1038-e567-4fe8-8bd3-82bad39e832c","resolution":{"observed_at":"2026-08-07T14:05:02.113485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-07T14:05:02.261823Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:02.261823Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:73f81ab9857c56b25d3affcead8409999d3887f2571c111759a8735ce811090f","observation_id":"ed131da7-b973-4265-9ad3-00dc48bac017","resolution":{"observed_at":"2026-08-07T14:05:02.261823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14666","last_updated":"2025-04-20T16:14:28Z","snapshot_observed_at":"2026-08-07T16:00:45.229157Z","submitted_at":"2025-04-20T16:14:28Z","title":"Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14666","snapshot_observed_at":"2026-08-07T14:05:02.393418Z","title":"Generative multimodal pretraining with discrete diffusion timestep tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:02.393418Z"},"links":{"cited_paper":"/paper/2504.14666","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:e57f4586e59988c268821b65bbc2c56acf5a8078d1517c4659f6c021a02d8594","observation_id":"73ba1ad5-474b-4b33-91bd-c6f6d0e70bbd","resolution":{"observed_at":"2026-08-07T14:05:02.393418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:02.571307Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:02.571307Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:ea1cc97b430c86ef61019ed15c06286bd65f372b8157fa0d45b6afeb4f367d4f","observation_id":"b913b799-b7fa-4f75-9a1e-4a153fe1ddaf","resolution":{"observed_at":"2026-08-07T14:05:02.571307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:02.723014Z","title":"Minigpt-5: Interleaved vision-and-language generation via generative vokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:02.723014Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:32ce76b386b9da2b39f3b68f5787013fc9b38b7a4c95576ce0832fa5405d7a84","observation_id":"f46af32c-f3f7-41da-9a09-73517e82ff99","resolution":{"observed_at":"2026-08-07T14:05:02.723014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:02.879601Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:02.879601Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:e256f926b3261bdc63dd21b37c5471d13e29d1e88158984dfb415dd74e111d92","observation_id":"de85dd05-1d00-430b-ba82-b0d600da042e","resolution":{"observed_at":"2026-08-07T14:05:02.879601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:03.050083Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:03.050083Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:bb593f895413a765b3f35a503be8949c58cae82af2eae0371a0587c1ad9a0967","observation_id":"32ce7d75-fa9f-401b-803d-6fee32024c85","resolution":{"observed_at":"2026-08-07T14:05:03.050083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-07-06T19:49:17.129421Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-07T14:05:03.212698Z","title":"Janusflow: Harmonizing autore- gression and rectified flow for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:03.212698Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:3901fc6cabd48ff2e37b76af7962672ec04527256916b7c8e5771101ce2f8bb6","observation_id":"2066104d-ff3d-471e-993c-6f70524108d5","resolution":{"observed_at":"2026-08-07T14:05:03.212698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:03.315466Z","title":"Building normalizing flows with stochastic interpolants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:03.315466Z"},"links":{"citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:e32a8fb142dfd0fb50eda25943236563d26be63e057a40deda7a99945431642d","observation_id":"e033c797-86a4-46d5-971b-b01e308d1284","resolution":{"observed_at":"2026-08-07T14:05:03.315466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":178},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 178 outbound references and 11 inbound Pith citation observations for arXiv:2505.20147."}