{"as_of":"2026-08-09T19:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa58f7d4f18bbc3525438978ef0e23e4f465414a18e810c6d4186371526a75eb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":66,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:21:56.187775Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":119,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2302.11550","last_updated":"2023-02-22T18:47:51Z","snapshot_observed_at":"2026-08-05T16:16:51.134330Z","submitted_at":"2023-02-22T18:47:51Z","title":"Scaling Robot Learning with Semantically Imagined Experience","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-17T18:59:10.352342Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2302.11550"},"observation_digest":"sha256:96c4c0e7830df03c5976087577f1975ee85e32d4b60102a6a45e5ebb7969abd3","observation_id":"9232872e-81f2-4cf9-80d4-dadf982e014b","resolution":{"observed_at":"2026-05-17T18:59:10.586456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:d882ac8dacabec3d48ad6166786a7b8a832b1dbe6f3c7501343cb78377a20f39","observation_id":"0f796b13-7c6f-4551-8c62-4e22c30ac520","resolution":{"observed_at":"2026-05-20T13:03:57.973110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T18:34:13.439993Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2309.15505"},"observation_digest":"sha256:f8071690fda309ee9e839a796fe37d9945a5fa9300bedba6ef55d7f9841a09c7","observation_id":"a694b0ae-382a-41c6-b127-2f87bba00510","resolution":{"observed_at":"2026-05-16T18:34:13.478920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"reference_index":173,"source":"arxiv_source","source_observed_at":"2026-05-16T02:15:18.265190Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2310.06114"},"observation_digest":"sha256:cb2e832288c15f5d2aa249daa0ae64c997815cae9f9cc94228e302b724ba407e","observation_id":"c77dcd03-48dd-492f-9de5-fdf451d90738","resolution":{"observed_at":"2026-05-16T02:15:18.633063Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:43.956642Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2310.19512"},"observation_digest":"sha256:ab18f95542ed697006a5ec04f58bdafa8882c799d582972e224898f9d69e3844","observation_id":"a07e5ce6-1751-4c76-9b09-d8f18e2bd385","resolution":{"observed_at":"2026-05-14T21:40:44.012282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T17:51:05.465548Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2312.14125"},"observation_digest":"sha256:ac28b8d29508977aa43d82798bfd66780933ac8307b73c589ee3168dda805ab9","observation_id":"c40f8024-858c-4265-a131-657112c79235","resolution":{"observed_at":"2026-05-15T17:51:05.648073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2405.06535","last_updated":"2026-04-07T11:38:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-10T15:27:35Z","title":"Controllable Image Generation with Composed Parallel Token Prediction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T00:53:36.830943Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2405.06535"},"observation_digest":"sha256:b5077124666b384b70594460e7d0d493471adb715ec4dccd6f347f1c2fcc3d3d","observation_id":"5b3eb7f1-a16f-4980-8df3-66b9a26b42c7","resolution":{"observed_at":"2026-05-24T00:53:40.560109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T22:09:16.622717Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2406.06525"},"observation_digest":"sha256:3325f1a570aabf180d9bd61accc666237b2d408e9cd5274c83d825835b8a977d","observation_id":"53a8d595-7b89-4e86-9456-b2e176e8dd26","resolution":{"observed_at":"2026-05-11T22:09:16.842300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T21:03:33.427939Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2408.12528"},"observation_digest":"sha256:2663a1a1432d2e179209f29831adcc7cebbf61efb04d40451e7ae24e4cd36728","observation_id":"131f433b-66db-4afd-a722-86e083c996f1","resolution":{"observed_at":"2026-05-11T21:03:33.528653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:2b9de4a92b67d0ad7028b99cff9e8c58e4d85e95042389e9d59a37cf8e457714","observation_id":"80dc1c22-9878-45d2-9c2a-0b0e873d3836","resolution":{"observed_at":"2026-05-15T22:09:16.400212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:f478578b9b6416ce087503b18ae1eb060c7c0755243911838a7747f06ea2904a","observation_id":"66e0d9ea-dd01-44ae-baca-dd2d23af5fab","resolution":{"observed_at":"2026-05-17T15:07:39.770391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-09T19:21:56.187775Z","title":"T., Rubinstein, M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00382","last_updated":"2025-02-01T09:41:01Z","snapshot_observed_at":"2026-08-09T19:09:18.962010Z","submitted_at":"2025-02-01T09:41:01Z","title":"Masked Generative Nested Transformers with Decode Time Scaling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:56.187775Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.00382"},"observation_digest":"sha256:e5a8c544e80f423c6a8e8c50e5e6b529774e4923e91305186eac4b0bbf49658b","observation_id":"874af9ce-81f9-439c-ae8a-eae8f136e615","resolution":{"observed_at":"2026-08-09T19:21:56.187775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-09T05:54:18.435628Z","title":"T., Rubinstein, M., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.435628Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:2d9772efea15e8164ae03488202e59c44a39dc11af738a63db58cd17b550a7e5","observation_id":"8ab7713c-374a-45dc-a085-e8a845ca2ad3","resolution":{"observed_at":"2026-08-09T05:54:18.435628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-08T21:59:05.452842Z","title":"Muse: Text-to- image generation via masked generative transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04669","last_updated":"2025-02-07T05:26:29Z","snapshot_observed_at":"2026-08-09T09:34:16.060007Z","submitted_at":"2025-02-07T05:26:29Z","title":"A Comprehensive Review on Noise Control of Diffusion Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T21:59:05.452842Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.04669"},"observation_digest":"sha256:4183856535335dbc002b3def58b7e3b9954498b98fb7da2a0c16698d837f652b","observation_id":"b86abbaa-4d4c-4d29-acc8-624c0b490d9d","resolution":{"observed_at":"2026-08-08T21:59:05.452842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-08T19:32:31.782645Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.782645Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:f2a1b10eb80b93e21209c64b156c5a15033c25d774c559c978596a537e734f05","observation_id":"24e8bcc5-a1d0-4987-94ad-3c0953077f90","resolution":{"observed_at":"2026-08-08T19:32:31.782645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-08T15:24:46.297104Z","title":"T., Rubinstein, M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.297104Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:03c1e0506b460ef8bfce74b1232ceba049cce57cadee233bc78adab57d60162a","observation_id":"e226a789-8427-4973-bcc9-0d1358c5bb95","resolution":{"observed_at":"2026-08-08T15:24:46.297104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-08T05:44:46.441310Z","title":"T.; Rubinstein, M.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08302","last_updated":"2025-02-12T11:03:51Z","snapshot_observed_at":"2026-08-09T02:39:56.008707Z","submitted_at":"2025-02-12T11:03:51Z","title":"HDT: Hierarchical Discrete Transformer for Multivariate Time Series Forecasting","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T05:44:46.441310Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.08302"},"observation_digest":"sha256:6e2c62f72c3e0dc816d473e465e3cf534fb91c2eaf238c10f34c9e328dbb973e","observation_id":"a882e97a-118b-4887-abc5-24d56748b228","resolution":{"observed_at":"2026-08-08T05:44:46.441310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T22:29:07.156820Z","title":"T., Rubinstein, M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09164","last_updated":"2025-02-13T10:48:11Z","snapshot_observed_at":"2026-08-09T09:33:50.530294Z","submitted_at":"2025-02-13T10:48:11Z","title":"E-MD3C: Taming Masked Diffusion Transformers for Efficient Zero-Shot Object Customization","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T22:29:07.156820Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.09164"},"observation_digest":"sha256:86bbd97d9f3d2df4faef08f68f5eedb6e25c4775d6e4431d127e73c2d47a9fea","observation_id":"75741d7b-c34c-41a6-a371-b8e7c276f273","resolution":{"observed_at":"2026-08-07T22:29:07.156820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-11T01:42:54.279353Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.09992"},"observation_digest":"sha256:ebcff088a630350c6e5dd03c49bab47b6f445a899eb6ee999b538f38b4fe3064","observation_id":"e4c62dd1-97f8-43f1-b85b-6c6e62cec95a","resolution":{"observed_at":"2026-05-11T01:42:54.605300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2505.14202","last_updated":"2026-04-06T02:54:59Z","snapshot_observed_at":"2026-07-30T11:23:54.758846Z","submitted_at":"2025-05-20T11:01:36Z","title":"MSDformer: Multi-scale Discrete Transformer For Time Series Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T13:44:08.891339Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.14202"},"observation_digest":"sha256:95cec135512aaf4e6a8b3adec1c46302f0b65de5e8477c4e812b9508f0961d4e","observation_id":"2a1143d1-7a46-454e-9f27-222bada2c9f2","resolution":{"observed_at":"2026-05-22T13:44:52.815486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:4289bdae75de83fc544be7528ac2c58d626794763d0519115c1c9d2461602ea3","observation_id":"25db7335-c11d-44ce-a2bb-695de5c292dd","resolution":{"observed_at":"2026-05-15T14:50:59.789654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T15:09:57.486525Z","title":"Muse: Text-to- image generation via masked generative transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.486525Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:4fa5f01915e56c35baa8c92601d0a4677fdc73a449f2c4d66af0287b9d10c551","observation_id":"e77c68c5-45da-461b-aeba-416f1234010b","resolution":{"observed_at":"2026-08-07T15:09:57.486525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T14:59:32.902329Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-08-08T00:51:08.095497Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:59:32.902329Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.16839"},"observation_digest":"sha256:dab4e4866e60a7d7ad49330b8ac60b452d5eeae82bf48467b732e869385b1692","observation_id":"9e99710c-9d77-427f-8763-c4e96e5bdcd7","resolution":{"observed_at":"2026-08-07T14:59:32.902329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T12:48:35.069080Z","title":"Chang, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.069080Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:34f8f958a178b96e0bd3a1482dde72c6fbd7ebf359558e9ed9b776c43ec20462","observation_id":"f51b3af5-c512-4de2-977c-a437fe25ccf4","resolution":{"observed_at":"2026-08-07T12:48:35.069080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T12:03:23.180725Z","title":"T., Rubinstein, M., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00736","last_updated":"2025-05-31T22:51:36Z","snapshot_observed_at":"2026-08-09T04:35:50.309243Z","submitted_at":"2025-05-31T22:51:36Z","title":"IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:23.180725Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.00736"},"observation_digest":"sha256:0982d4153dfafde88ae9fab7d41482227fd5efdf4e5e270ff4e39ce78a924ea7","observation_id":"20a3d936-6f55-46db-9e63-6e5bf523bf11","resolution":{"observed_at":"2026-08-07T12:03:23.180725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T11:15:21.740312Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.740312Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:7adca159f35d54d85c9f1f3da9ed22edf57602f66d45d1c7bab388293aa68243","observation_id":"36887104-8b08-42f6-9869-9f24112971e3","resolution":{"observed_at":"2026-08-07T11:15:21.740312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T10:47:52.273933Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T20:35:26.253139Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.273933Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:9978ef1a09f6e5c3f40c26bfd0fe25c0a8249228b7bfb365fad27c25a1dd8aca","observation_id":"4b2b60c7-2598-43c8-ad79-1de3049e13ba","resolution":{"observed_at":"2026-08-07T10:47:52.273933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T05:59:47.443309Z","title":"Muse: Text-to-image generation via masked generative transform- ers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06483","last_updated":"2025-06-06T19:17:37Z","snapshot_observed_at":"2026-08-09T04:49:12.989102Z","submitted_at":"2025-06-06T19:17:37Z","title":"Noise Consistency Regularization for Improved Subject-Driven Image Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:47.443309Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.06483"},"observation_digest":"sha256:0d49951f920f0abbc8ab1495fa67fb8bc9a9ed4a013bbe48f9273032510e9101","observation_id":"c3712f10-5504-470b-a3ff-dff63c008640","resolution":{"observed_at":"2026-08-07T05:59:47.443309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T05:40:23.832417Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07350","last_updated":"2025-06-09T01:55:55Z","snapshot_observed_at":"2026-08-09T09:33:58.926650Z","submitted_at":"2025-06-09T01:55:55Z","title":"MapBERT: Bitwise Masked Modeling for Real-Time Semantic Mapping Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:23.832417Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.07350"},"observation_digest":"sha256:3de6c6e4dac96bddb88e6fe09766b1fcdf8131c6386da4388f947a0fc3463f14","observation_id":"c9c346ec-e6fd-49ab-adf8-2a271f52af36","resolution":{"observed_at":"2026-08-07T05:40:23.832417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T15:39:24.622157Z","title":"T., Rubinstein, M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11029","last_updated":"2025-05-20T14:31:06Z","snapshot_observed_at":"2026-08-07T23:55:50.036141Z","submitted_at":"2025-05-20T14:31:06Z","title":"Output Scaling: YingLong-Delayed Chain of Thought in a Large Pretrained Time Series Forecasting Model","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:24.622157Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.11029"},"observation_digest":"sha256:aeb9c63fb8c1ef8b83592531891b2fac24883b6c1c0e4f0429defae3d0aa1112","observation_id":"ff38e35f-58a8-4028-8e43-25e4f3c590c4","resolution":{"observed_at":"2026-08-07T15:39:24.622157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T14:51:36.281876Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12035","last_updated":"2025-05-22T23:26:56Z","snapshot_observed_at":"2026-08-09T01:40:05.216347Z","submitted_at":"2025-05-22T23:26:56Z","title":"MARch\\'e: Fast Masked Autoregressive Image Generation with Cache-Aware Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:36.281876Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.12035"},"observation_digest":"sha256:4144009a243e6ca31066d8c36a8d1c0006005740909cf3a8880f2e7d8758007b","observation_id":"93898f86-93a1-4007-bbe9-fd4ddcd0c70e","resolution":{"observed_at":"2026-08-07T14:51:36.281876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T23:35:33.442154Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17505","last_updated":"2025-06-20T22:57:59Z","snapshot_observed_at":"2026-08-09T09:33:46.286211Z","submitted_at":"2025-06-20T22:57:59Z","title":"Learning golf swing signatures from a single wrist-worn inertial sensor","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:33.442154Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.17505"},"observation_digest":"sha256:f79a87f7ed6e51ecbd0d1e51aa957f868fbf7c75906b5351433bd2cd9183c996","observation_id":"7f962a37-9a2e-400b-9a7d-5a0dbce28b9d","resolution":{"observed_at":"2026-08-06T23:35:33.442154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T04:52:09.670357Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00006","last_updated":"2025-06-11T08:02:40Z","snapshot_observed_at":"2026-08-09T16:23:11.547988Z","submitted_at":"2025-06-11T08:02:40Z","title":"MVGBench: Comprehensive Benchmark for Multi-view Generation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:52:09.670357Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.00006"},"observation_digest":"sha256:6cedc27781951d3fd6e27405475373ecd012d2d20b1dd22cc2f1e393ef6ddfdb","observation_id":"e8f6cd43-d7dc-455d-a05e-11b2a34633df","resolution":{"observed_at":"2026-08-07T04:52:09.670357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T21:12:05.800608Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00868","last_updated":"2025-07-02T09:16:31Z","snapshot_observed_at":"2026-08-09T09:46:50.040681Z","submitted_at":"2025-07-01T15:32:23Z","title":"Is Visual in-Context Learning for Compositional Medical Tasks within Reach?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:05.800608Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.00868"},"observation_digest":"sha256:e30a963890557b357d4ee70b6261205908d63d2ead1213983708a3c633e18e0f","observation_id":"53d434c6-451e-4728-bb7a-2559e37af9e4","resolution":{"observed_at":"2026-08-06T21:12:05.800608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T20:43:53.858179Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-09T14:58:57.065117Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.858179Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:222893e2a6f60b3c2f28038ce5290a77847e7f766aa29aa1925de7b5f5fd523d","observation_id":"dc6d1286-0035-4aa1-9ff1-5e25eab8a452","resolution":{"observed_at":"2026-08-06T20:43:53.858179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T19:41:23.621281Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04947","last_updated":"2025-07-07T12:45:23Z","snapshot_observed_at":"2026-08-08T12:12:25.015685Z","submitted_at":"2025-07-07T12:45:23Z","title":"DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:23.621281Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.04947"},"observation_digest":"sha256:9fb6ab3dffe1f97a6e9f9f123ef7a113d5718a5c4a73c090cf244e5a3415e7b4","observation_id":"0757d32b-5882-4aac-a7ab-e83195aef7f6","resolution":{"observed_at":"2026-08-06T19:41:23.621281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T16:58:28.623018Z","title":"Muse: Text-to- image generation via masked generative transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12136","last_updated":"2025-07-16T11:09:50Z","snapshot_observed_at":"2026-08-09T11:06:43.662995Z","submitted_at":"2025-07-16T11:09:50Z","title":"Room Impulse Response Generation Conditioned on Acoustic Parameters","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:58:28.623018Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.12136"},"observation_digest":"sha256:0dfa00cd4e8fbefa272d41d5e5f6b670460fbc48b47d62eaff2ac534958f30ec","observation_id":"ed205e6c-4d82-4db4-bc82-fb3e72b207a6","resolution":{"observed_at":"2026-08-06T16:58:28.623018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T16:48:29.960911Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-09T09:34:20.574844Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:29.960911Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:0f1d8d701435a3289e9ab6914456331172e19b6745c5d55cfb5c3b8e64a5df6b","observation_id":"07764351-64d3-4d07-9710-39ec82cf5df2","resolution":{"observed_at":"2026-08-06T16:48:29.960911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T14:28:45.675804Z","title":"URL: https://arxiv.org/abs/2301.00704, arXiv:2301.00704","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19372","last_updated":"2025-07-25T15:24:56Z","snapshot_observed_at":"2026-08-08T11:27:34.501967Z","submitted_at":"2025-07-25T15:24:56Z","title":"Learning neuro-symbolic convergent term rewriting systems","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:28:45.675804Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.19372"},"observation_digest":"sha256:0bfe36fd1f70cdad13cb0d4a8f17d0c57f5cbc0a24fd6837fcb0347af3dd6f7b","observation_id":"3469a9a0-887f-4059-ad72-6d7dc63615e5","resolution":{"observed_at":"2026-08-06T14:28:45.675804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T00:04:32.077010Z","title":"Muse: Text-to-image gen- eration via masked generative transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04472","last_updated":"2025-08-06T14:19:32Z","snapshot_observed_at":"2026-08-09T06:08:47.407244Z","submitted_at":"2025-08-06T14:19:32Z","title":"Zero-Residual Concept Erasure via Progressive Alignment in Text-to-Image Model","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T00:04:32.077010Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2508.04472"},"observation_digest":"sha256:59710ae8048aa2d686c991c93232c20e63180aef79c2f7dbab35241e359ec372","observation_id":"7235f01d-ba09-49de-a38a-6496680f10d2","resolution":{"observed_at":"2026-08-06T00:04:32.077010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T18:37:17.815731Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14441","last_updated":"2025-08-20T05:53:05Z","snapshot_observed_at":"2026-08-05T18:37:15.366913Z","submitted_at":"2025-08-20T05:53:05Z","title":"FBI: Learning Dexterous In-hand Manipulation with Dynamic Visuotactile Shortcut Policy","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T18:37:17.815731Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2508.14441"},"observation_digest":"sha256:2ee4c9b21c2ec03ae3a669540337ab7b1979286755e893d5bcf59a401c27baa1","observation_id":"c0233a12-2300-4dcf-8ad9-faf649f90181","resolution":{"observed_at":"2026-08-05T18:37:17.815731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-04T16:43:49.262777Z","title":"T.; Rubinstein, M.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12046","last_updated":"2026-07-04T12:10:43Z","snapshot_observed_at":"2026-08-06T10:47:51.701860Z","submitted_at":"2025-09-15T15:27:29Z","title":"Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T16:43:49.262777Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2509.12046"},"observation_digest":"sha256:7254efb723681402588429dceec26a3022a6d6fdb749f76b6c67aba416e51647","observation_id":"03f319a0-c123-4471-9679-1616fb66726a","resolution":{"observed_at":"2026-08-04T16:43:49.262777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-04T15:39:34.022747Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.19244","last_updated":"2026-07-15T22:48:21Z","snapshot_observed_at":"2026-08-04T15:39:16.754746Z","submitted_at":"2025-09-23T17:05:46Z","title":"Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T15:39:34.022747Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2509.19244"},"observation_digest":"sha256:c0a0ea7b7ad60f40fe851e7b50f94a06656bfa1e6935593ac46eb708b1c55615","observation_id":"a3eeabf2-40d5-4655-b1f5-f0bdfb7aee7c","resolution":{"observed_at":"2026-08-04T15:39:34.022747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-04T11:08:02.386459Z","title":"Muse: Text-to-image generation via masked generative trans- formers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06928","last_updated":"2026-05-27T05:34:49Z","snapshot_observed_at":"2026-08-09T16:33:37.475163Z","submitted_at":"2025-10-08T12:08:21Z","title":"IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T11:08:02.386459Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2510.06928"},"observation_digest":"sha256:e3cf166e6335d0870b1714c64b78cd313246954b2bd8520bc0376a7327b60066","observation_id":"5b9524c7-760c-40a4-b39b-46c5de90dd0f","resolution":{"observed_at":"2026-08-04T11:08:02.386459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-03T20:15:25.700535Z","title":"Muse: Text-to-image generation via masked generative transform- ers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20651","last_updated":"2026-07-21T00:23:00Z","snapshot_observed_at":"2026-08-04T02:39:13.955398Z","submitted_at":"2025-11-25T18:59:55Z","title":"RubricRL: Simple Generalizable Rewards for Text-to-Image Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:25.700535Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2511.20651"},"observation_digest":"sha256:fd9b36bed04c82207a8070ce6d254a20a0614a827740fc59c671f66cd0428cd2","observation_id":"71063a29-1ae8-45a6-87fa-202e586ea3d0","resolution":{"observed_at":"2026-08-03T20:15:25.700535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-03T16:21:31.725029Z","title":"Muse: Text-to-image generation via masked generative transform- ers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-04T04:44:58.323566Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.725029Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:45b774df2971f8ce4711f03f9541f2bda7c59d12a77870a327d4a75e8bff757d","observation_id":"ab85a340-a5c4-4404-a48d-c2a01f7d38e5","resolution":{"observed_at":"2026-08-03T16:21:31.725029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-03T08:16:22.354776Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17737","last_updated":"2026-05-27T06:53:57Z","snapshot_observed_at":"2026-08-07T17:02:56.952261Z","submitted_at":"2026-01-25T08:10:28Z","title":"The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T08:16:22.354776Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2601.17737"},"observation_digest":"sha256:e49973efc4e9b6a5a61b495ac05ddc5b420d2f15505f34acc795ff3fdac7f202","observation_id":"e823a537-1fdc-4c00-bb45-09ecb3b07f47","resolution":{"observed_at":"2026-08-03T08:16:22.354776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2603.00918","last_updated":"2026-05-10T14:01:21Z","snapshot_observed_at":"2026-07-06T22:47:24.369805Z","submitted_at":"2026-03-01T04:39:09Z","title":"Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T18:40:18.940889Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2603.00918"},"observation_digest":"sha256:4e71e23f43da14a9efca1e00ba307ce2c1639b9271913d99faa7b352c993d879","observation_id":"e8362087-437c-4cbf-a03b-83b1d4e73e9b","resolution":{"observed_at":"2026-05-15T18:41:28.773088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2603.02667","last_updated":"2026-05-17T06:09:20Z","snapshot_observed_at":"2026-07-06T22:47:37.679205Z","submitted_at":"2026-03-03T06:54:19Z","title":"Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T12:15:57.019720Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2603.02667"},"observation_digest":"sha256:bb668bc25d8a6d8d24b810f9af8f18a4e024190e0b71645a10a2bdc71ecbaf75","observation_id":"a83873ff-e267-4133-8856-ff170a96f15b","resolution":{"observed_at":"2026-05-21T12:20:06.998166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2604.05730","last_updated":"2026-04-07T11:33:52Z","snapshot_observed_at":"2026-08-05T07:50:50.379461Z","submitted_at":"2026-04-07T11:33:52Z","title":"Controllable Image Generation with Composed Parallel Token Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T19:33:03.066564Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2604.05730"},"observation_digest":"sha256:a838f15ea2bd71121742af1eda4f991e3ae1cdaf513a8f53e6824cc0f3bdde54","observation_id":"ef4784c5-9a87-4b1d-9891-5fb6a6b4e38f","resolution":{"observed_at":"2026-05-10T22:50:48.709020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-08-08T16:34:03.216972Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T05:32:54.235578Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:279f9b3cf38b7bc89887e6590e0e320e9d318915dfaec2fa44d49c855c54f1f6","observation_id":"14212172-9d6b-4810-9261-eae613d889da","resolution":{"observed_at":"2026-05-10T05:36:01.840743Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-08-08T16:34:03.216972Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-05T11:32:38.636335Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:053a24baa1595c4cdad8db25e5492a520b8352b93074bcf2bb6521485b74f5bd","observation_id":"7d97494e-1a26-412c-a643-e19525e82873","resolution":{"observed_at":"2026-07-05T11:41:02.733153Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.07193","last_updated":"2026-05-08T03:40:39Z","snapshot_observed_at":"2026-08-02T09:51:08.410161Z","submitted_at":"2026-05-08T03:40:39Z","title":"Coupling Models for One-Step Discrete Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-11T02:58:10.909499Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.07193"},"observation_digest":"sha256:597af9f29ae42c01796c67bc5123204980cb5203739d2785a9cf0d41c8e33f60","observation_id":"83ed988c-ef11-45c2-a602-6aad93d637dc","resolution":{"observed_at":"2026-05-11T03:00:55.161047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.15661","last_updated":"2026-05-15T06:32:49Z","snapshot_observed_at":"2026-07-06T23:26:56.013191Z","submitted_at":"2026-05-15T06:32:49Z","title":"VAGS: Velocity Adaptive Guidance Scale for Image Editing and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T18:33:47.573164Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.15661"},"observation_digest":"sha256:61695df32a0c299e5d8b72e988a3475dedfbefe2ae471d949cb69555d2180090","observation_id":"9d6ce223-0082-4686-ae56-d033d04f4f12","resolution":{"observed_at":"2026-05-20T18:33:53.079392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.17232","last_updated":"2026-07-22T19:34:37Z","snapshot_observed_at":"2026-08-02T13:52:45.590847Z","submitted_at":"2026-05-17T03:00:23Z","title":"Dimension-Free Convergence of Discrete Diffusion Models: Adjoint Equations Induce the Right Space","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-20T14:47:33.474443Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.17232"},"observation_digest":"sha256:6e439abb02c7114973f1fe59590bde88652d35b9deb61f9982e91914cb5cbdf8","observation_id":"609ca211-2bb8-4d53-b578-5bbb2630e701","resolution":{"observed_at":"2026-05-20T14:48:23.247806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.17232","last_updated":"2026-07-22T19:34:37Z","snapshot_observed_at":"2026-08-02T13:52:45.590847Z","submitted_at":"2026-05-17T03:00:23Z","title":"Dimension-Free Convergence of Discrete Diffusion Models: Adjoint Equations Induce the Right Space","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-30T19:13:35.794787Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.17232"},"observation_digest":"sha256:af8c84e421bf753de2f35e597e14c8bc35fb4975761a38b9021c0ccce1ae4ca3","observation_id":"04ea7e06-9606-4226-9f00-13106dcbd614","resolution":{"observed_at":"2026-06-30T19:15:00.171208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-02T13:53:01.557172Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.17232","last_updated":"2026-07-22T19:34:37Z","snapshot_observed_at":"2026-08-02T13:52:45.590847Z","submitted_at":"2026-05-17T03:00:23Z","title":"Dimension-Free Convergence of Discrete Diffusion Models: Adjoint Equations Induce the Right Space","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T13:53:01.557172Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.17232"},"observation_digest":"sha256:bd0d4d6036c14208a2046e924c8eec0390d13afd9e56571df02262e337dec9ab","observation_id":"281bbec6-d233-4b26-9316-e46384d8f824","resolution":{"observed_at":"2026-08-02T13:53:01.557172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.19190","last_updated":"2026-05-18T23:34:53Z","snapshot_observed_at":"2026-08-02T02:36:37.244109Z","submitted_at":"2026-05-18T23:34:53Z","title":"Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T07:06:57.555070Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.19190"},"observation_digest":"sha256:d68270f0c4208a45e4d37fbd8989481613ecc5e5f43045e34caf7742b372c0b1","observation_id":"bc82891e-2ef2-4cef-886d-9807b393be94","resolution":{"observed_at":"2026-05-20T07:08:07.000756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.25751","last_updated":"2026-05-25T12:02:43Z","snapshot_observed_at":"2026-08-08T08:19:21.623481Z","submitted_at":"2026-05-25T12:02:43Z","title":"SplitAvatar: One-shot Head Avatar with Autoregressive Gaussian Splitting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T23:02:13.380306Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.25751"},"observation_digest":"sha256:3aa1b114efef8652fbfd00bd18900ec66a6767792d881bc3732322f2b2cb1a9a","observation_id":"41295a1b-dadb-4525-8144-73c64613c3ba","resolution":{"observed_at":"2026-06-29T23:04:00.978197Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.03578","last_updated":"2026-06-02T12:47:14Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:47:14Z","title":"Diffusing in the Right Space: A Systematic Study of Latent Diffusability","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-28T10:44:24.318786Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.03578"},"observation_digest":"sha256:6b14822806997558d4e2f178832f65c70894315ffb75f992d9d4117f1a3c4d4f","observation_id":"98eb01a1-65d2-4d36-b016-935ee963d365","resolution":{"observed_at":"2026-07-02T02:36:27.646872Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.04935","last_updated":"2026-07-07T17:04:28Z","snapshot_observed_at":"2026-08-06T13:56:30.086076Z","submitted_at":"2026-06-03T14:24:53Z","title":"What Type of Inference is Active Inference?","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T06:45:53.233544Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.04935"},"observation_digest":"sha256:6f90358029916290f980d1cab8153a00bbe5fadab9d7fcdd6f8c0006beed3cdc","observation_id":"b7772da1-d62b-4175-b2b5-9909ce03c38b","resolution":{"observed_at":"2026-06-28T06:51:44.836825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.11188","last_updated":"2026-06-09T17:59:28Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:59:28Z","title":"ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T13:29:11.526106Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.11188"},"observation_digest":"sha256:c5379dc9cd4abd8a5840f1fcc79585e2373d10a4b34cdd49f3ecaf6bd3055a9a","observation_id":"05d80a24-c1eb-495f-8d8c-cf224c716547","resolution":{"observed_at":"2026-07-03T05:07:38.441534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.20658","last_updated":"2026-06-09T08:09:48Z","snapshot_observed_at":"2026-08-01T16:26:27.186003Z","submitted_at":"2026-06-09T08:09:48Z","title":"Expected Free Energy-based Planning as Variational Inference","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:28.078342Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.20658"},"observation_digest":"sha256:2c4d19cd74c47661dcb6f7099be0b29be4363e06486636534c233587a50cbe07","observation_id":"5a832f26-c88c-40e4-81b6-d31f4a969b93","resolution":{"observed_at":"2026-06-27T13:40:57.096595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.24192","last_updated":"2026-06-23T06:22:00Z","snapshot_observed_at":"2026-08-06T06:51:13.657171Z","submitted_at":"2026-06-23T06:22:00Z","title":"Co-occurring associated retained concepts in Diffusion Unlearning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T00:50:58.689718Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.24192"},"observation_digest":"sha256:c7761923682ce58bb06c7bde0c99dc23299aa2fbf24c8ec3d0e9d004e5aec87f","observation_id":"4e6b0e0c-9da9-4d51-bef2-c9129619da42","resolution":{"observed_at":"2026-07-04T16:09:57.475269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":153,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:cc8679213866877b9deafdaf919cbe2f83d2dbf31974acf45b69f625df71c8d9","observation_id":"7d4417cc-c09e-40ff-9e0e-29344603c31c","resolution":{"observed_at":"2026-07-01T11:55:42.259206Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2301.00704 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:fc0dd580ac9c4d295d40f1646a7d5032078ce29f0d8eaefc1eea5c5cdc259076","observation_id":"bda92eb2-a1ff-4c83-8505-db6d71b2ede1","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2301.00704/citation-record","integrity":"/paper/2301.00704/integrity","json":"/paper/2301.00704/citation-record.json","paper":"/paper/2301.00704"},"outbound":[],"paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 66 inbound Pith citation observations for arXiv:2301.00704."}