{"as_of":"2026-08-10T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a89d60fc0f557e08fa76a0c7cc1212b62990ec9b7c0e4f3c26e1af4ad32fbac","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T01:44:22.710205Z","state":"measured"},{"denominator":195,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":195,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":128,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:51:12.330646Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T13:29:51.539140Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2210.00379","last_updated":"2026-02-12T16:09:50Z","snapshot_observed_at":"2026-07-06T13:58:37.592838Z","submitted_at":"2022-10-01T21:35:11Z","title":"NeRF: Neural Radiance Field in 3D Vision: A Comprehensive Review (Updated Post-Gaussian Splatting)","version":8},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-05-24T10:32:20.149563Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2210.00379"},"observation_digest":"sha256:86de22359a865f7eed0133fa56cf5d59f789d4c53bf369bfae20efb744ddf277","observation_id":"bdf8ed78-c207-4125-b799-4913d7b2971e","resolution":{"observed_at":"2026-05-24T10:34:20.533027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T22:47:50.355642Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2302.08453"},"observation_digest":"sha256:32d1a66dcc588391b49beee1e332a5c363910520d0d072aae49403832dcbbc76","observation_id":"2764842a-2273-44a9-80a9-3c14c9dfee30","resolution":{"observed_at":"2026-05-16T22:47:50.400569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-07-06T14:58:02.852672Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-13T15:47:28.598205Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2303.01469"},"observation_digest":"sha256:89c5b0d1ba7d4a0909c77dd7900fae9a6d0bc7ae035a66bce19e03c350c72ea8","observation_id":"20dce26c-f6c9-4f23-8086-572b291a80c0","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2304.09479","last_updated":"2026-05-12T07:05:20Z","snapshot_observed_at":"2026-08-08T17:46:14.611153Z","submitted_at":"2023-04-19T08:03:20Z","title":"DiFaReli++: Diffusion Face Relighting with Consistent Cast Shadows","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T08:42:04.321790Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2304.09479"},"observation_digest":"sha256:f7873ddf4f95f4e81cbf7cceb0623c993e567da65af19674f2e929c65bf05b60","observation_id":"3fc65082-e7f3-42ae-8dae-fba640ed343a","resolution":{"observed_at":"2026-05-24T08:44:14.130740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2305.16347","last_updated":"2026-04-14T07:08:36Z","snapshot_observed_at":"2026-07-06T15:33:31.386787Z","submitted_at":"2023-05-24T14:48:18Z","title":"Prompt Evolution for Generative AI: A Classifier-Guided Approach","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T08:59:24.602556Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2305.16347"},"observation_digest":"sha256:2892c87a6bd3ee468129448071ece7110d99f83068d0b7a6a9dd728a9f566546","observation_id":"c123aba8-de3e-4800-b6e4-48d92a7cca4e","resolution":{"observed_at":"2026-05-24T09:04:15.173018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:22:03.530707Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2307.01952"},"observation_digest":"sha256:3629edec1fec6eafaed4a18c93453f0aa89fbe39d4109e83b7f2de2f1301915e","observation_id":"45d634d4-d80b-498f-be33-6f59c564e938","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T22:52:19.359362Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2307.04725"},"observation_digest":"sha256:f50e58385be1397c0c5c474fe42dd622d6a8495971cfb9c2e9f10640b3bddf48","observation_id":"02f79f4c-cc6b-430c-acd4-66152a56093b","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T23:57:08.818348Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2308.06721"},"observation_digest":"sha256:fe3f2e5d6f75950e2e037b02478591b7c23e5075be50ac1ce4ee45cd512b3873","observation_id":"3d88d694-61b1-4990-846b-f4df7c2c3259","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:578e7e4771a80ff044a9431af3834f48ba0f3f23f8d45848aa40fb4f9ac75814","observation_id":"4bd54afd-6a5e-42ae-aca7-603047463c40","resolution":{"observed_at":"2026-05-20T13:03:58.065481Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-07-06T16:12:38.269310Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"reference_index":164,"source":"arxiv_source","source_observed_at":"2026-05-15T08:36:19.457852Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2308.16512"},"observation_digest":"sha256:fe41bd0fd570f2e0422f0800fc1e76ce20f7225adbd95c013c31032e5180e835","observation_id":"2c046cec-5907-4c81-a0cb-35e556cc4837","resolution":{"observed_at":"2026-05-15T08:36:19.573457Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-16T02:15:18.265190Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2310.06114"},"observation_digest":"sha256:7f73d79ee6c8353e45ac2da5942b4f127155565ea90d5819f669d69a890f8b06","observation_id":"7b95c5a5-74d7-4fdc-87d7-0c0ce455427f","resolution":{"observed_at":"2026-05-16T02:15:18.693262Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:43.956642Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2310.19512"},"observation_digest":"sha256:b11a43a9bd6e038cab30f1d84f9c52ea0655006d7b1072943f4a62453a20e842","observation_id":"17968458-04fe-42e0-841b-a467d0eca150","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T21:02:41.399183Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2401.07519"},"observation_digest":"sha256:9282318bfa499c3be15a57ae255b5bb54be005a7366e931dfab12a3ef7e0e155","observation_id":"26554b5a-2043-41e6-b1da-e0724043cbdb","resolution":{"observed_at":"2026-05-17T21:02:41.489773Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2401.16764","last_updated":"2026-05-03T08:30:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-30T05:59:00Z","title":"BoostDream: Efficient Refining for High-Quality Text-to-3D Generation from Multi-View Diffusion","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T04:35:57.539388Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2401.16764"},"observation_digest":"sha256:e8d574e730d2d89c887f5f63d2efa3f67def7dd6c8bcd07a2aafaf4d595adbb9","observation_id":"75f5d5b0-74f9-424b-ad9f-ae273871f9b9","resolution":{"observed_at":"2026-05-24T04:36:00.736190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T19:43:03.310237Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2403.05135"},"observation_digest":"sha256:55d56757c66c257f0179e9dcd3ec5d0bc9208b3ef21f621e9eda99277c98a67b","observation_id":"7b202ce5-b983-44a9-9df1-3edd10b1e140","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-13T02:06:23.410241Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2404.02101"},"observation_digest":"sha256:82a92fb0dc477cc6222edf60904a845d69f7c77dcbecea448fac771a716c6441","observation_id":"78ab5429-a823-4fa5-9e63-173aee7337f1","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:545dc96833226672976d81dd033f54ae11d4a4f3df59df98014194320307256d","observation_id":"40c7ac0e-f72c-4415-a366-1a4b84bb0193","resolution":{"observed_at":"2026-05-16T14:58:37.412582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2409.08248","last_updated":"2026-05-19T07:22:47Z","snapshot_observed_at":"2026-08-01T17:09:07.344749Z","submitted_at":"2024-09-12T17:47:51Z","title":"TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-23T20:50:21.184443Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2409.08248"},"observation_digest":"sha256:f15451914a8e7cca98d46b764325ece4eeca3bd7fe0a65ff49a15d8570929b30","observation_id":"94225b43-da3c-44b2-9511-53771f76c96d","resolution":{"observed_at":"2026-05-23T20:53:26.539359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:50.009149Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2410.10629"},"observation_digest":"sha256:528f9616e61a9c631c8cafc240f6cc2b056c62d2cf9c9d117416e4fb9ee79b96","observation_id":"47b5e893-0e2b-4a04-895e-7b7f32a9ba64","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:6db0934eb1778e5c99dc6295186c5a950749f957ae0fc8ae836d73311666718e","observation_id":"758571fd-a831-4955-8a9d-c18f47ea0350","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T23:38:44.933410Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2501.03575"},"observation_digest":"sha256:f9dbc1e25245f0586afd9ef59ddd7c639273213eac4b4cce87129e39f9494abe","observation_id":"cf7f9cde-43d7-4a40-921f-1846801b588a","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-09T18:51:12.330646Z","title":"ediff-i: Text- to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00500","last_updated":"2025-02-04T15:19:12Z","snapshot_observed_at":"2026-08-09T23:35:15.645922Z","submitted_at":"2025-02-01T17:40:11Z","title":"Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T18:51:12.330646Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2502.00500"},"observation_digest":"sha256:e9d285837989c3c0aab7734e88cca0cdd9bc3164329bb5b529faa9aa1849b957","observation_id":"545203ea-5b61-4c9c-bb9d-7c1da1fc867e","resolution":{"observed_at":"2026-08-09T18:51:12.330646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-09T11:46:23.056519Z","title":"21 Yogesh Balaji, Seungjun Nah, Xun Huang, Arash Vahdat, Jiaming Song, Karsten Kreis, Miika Aittala, Timo Aila, Samuli Laine, Bryan Catanzaro, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05215","last_updated":"2025-02-04T18:49:50Z","snapshot_observed_at":"2026-08-09T11:39:50.709602Z","submitted_at":"2025-02-04T18:49:50Z","title":"Watermarking across Modalities for Content Tracing and Generative AI","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T11:46:23.056519Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2502.05215"},"observation_digest":"sha256:dce4100b531ed434c2cf58acd7dff59a1322293912935b884b1083131ad6fb34","observation_id":"25f25f0e-8ac1-44d4-949e-6aa22a1d3f8c","resolution":{"observed_at":"2026-08-09T11:46:23.056519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-08T14:45:08.350537Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06682","last_updated":"2025-04-01T19:10:21Z","snapshot_observed_at":"2026-08-08T14:38:49.805886Z","submitted_at":"2025-02-10T17:07:53Z","title":"Transfer Your Perspective: Controllable 3D Generation from Any Viewpoint in a Driving Scene","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T14:45:08.350537Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2502.06682"},"observation_digest":"sha256:14e29fc8798090c867e83f911cda1669710bb902c83be85a21384fb709f7c0f7","observation_id":"46a425fe-bd6d-4204-85d3-73730dcf5979","resolution":{"observed_at":"2026-08-08T14:45:08.350537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-08T13:21:50.430646Z","title":"ediffi: Text-to-image diffusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07278","last_updated":"2026-05-22T20:48:36Z","snapshot_observed_at":"2026-08-08T13:13:34.171986Z","submitted_at":"2025-02-11T05:47:16Z","title":"Articulate That Object Part (ATOP): 3D Part Articulation via Text and Motion Personalization","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:50.430646Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2502.07278"},"observation_digest":"sha256:b6ee682218d4904ef57393195d9380640f7fbcc2cf5a75d552cadc5625030473","observation_id":"56416b48-ca4d-43bd-a8b9-5242bb02e118","resolution":{"observed_at":"2026-08-08T13:21:50.430646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T18:49:30.595132Z","title":"ediff-i: Text-to- image diffusion models with an ensemble of expert denoisers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10258","last_updated":"2025-02-14T16:11:57Z","snapshot_observed_at":"2026-08-09T10:45:52.068762Z","submitted_at":"2025-02-14T16:11:57Z","title":"PromptArtisan: Multi-instruction Image Editing in Single Pass with Complete Attention Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T18:49:30.595132Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2502.10258"},"observation_digest":"sha256:2ea0e01f359bebfcbb3585558752609f36ab009eef74c7e1856b4b6d340b6e63","observation_id":"7f592f08-e036-4c8c-8ea0-6c6b1f05c71c","resolution":{"observed_at":"2026-08-07T18:49:30.595132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T14:25:20.356553Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19084","last_updated":"2025-05-25T10:40:52Z","snapshot_observed_at":"2026-08-08T13:14:27.649311Z","submitted_at":"2025-05-25T10:40:52Z","title":"Jodi: Unification of Visual Generation and Understanding via Joint Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:20.356553Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2505.19084"},"observation_digest":"sha256:4f4c9d55b4b981d1b1bbec9cb3b3a5dc670afcf429bafe0e658a66f240c8c0e1","observation_id":"0f7ea959-4290-480d-9d5c-248382f79c16","resolution":{"observed_at":"2026-08-07T14:25:20.356553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T13:42:35.515561Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21179","last_updated":"2025-06-03T02:46:07Z","snapshot_observed_at":"2026-08-07T21:11:55.613725Z","submitted_at":"2025-05-27T13:30:46Z","title":"Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:35.515561Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2505.21179"},"observation_digest":"sha256:8fb192bb2d7224b5805701528c72232e6b7089e5a9910371d9dc04124b684c1b","observation_id":"a48c735c-3dd2-44fd-be3d-f629a778b2be","resolution":{"observed_at":"2026-08-07T13:42:35.515561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T13:14:45.731108Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22360","last_updated":"2025-05-28T13:40:46Z","snapshot_observed_at":"2026-08-08T05:21:31.444480Z","submitted_at":"2025-05-28T13:40:46Z","title":"Identity-Preserving Text-to-Image Generation via Dual-Level Feature Decoupling and Expert-Guided Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:45.731108Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2505.22360"},"observation_digest":"sha256:6041f921fd66786c3c49c459ed59e63e691def0a6e5323f0080b344636e30377","observation_id":"cfaec9be-ac44-4d80-b2ff-1bec1a79e8d8","resolution":{"observed_at":"2026-08-07T13:14:45.731108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T12:49:23.258264Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23434","last_updated":"2025-05-29T13:28:04Z","snapshot_observed_at":"2026-08-09T16:25:43.691444Z","submitted_at":"2025-05-29T13:28:04Z","title":"UrbanCraft: Urban View Extrapolation via Hierarchical Sem-Geometric Priors","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:49:23.258264Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2505.23434"},"observation_digest":"sha256:4bfaade78eadc7b62d692bd8709de762f034c8518e9e02bde9c5fe2b2bfaf419","observation_id":"69c35e9d-17ed-4476-8658-0d53c2b9043c","resolution":{"observed_at":"2026-08-07T12:49:23.258264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T11:15:21.483651Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.483651Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:0620923fc16d383e704946d50aa7fe1162bcaf27828d2881f2adaf33415c5c63","observation_id":"98f66a24-4a99-4702-b379-d7a5dff555e7","resolution":{"observed_at":"2026-08-07T11:15:21.483651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T10:45:30.269887Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04545","last_updated":"2025-06-05T01:30:40Z","snapshot_observed_at":"2026-08-09T19:12:31.218137Z","submitted_at":"2025-06-05T01:30:40Z","title":"Seamless and Efficient Interactions within a Mixed-Dimensional Information Space","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:30.269887Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.04545"},"observation_digest":"sha256:2acd5c8dbd56d9db6922f2d93e76e753ff592098c743fe7efa6cc938d899060d","observation_id":"072f38b0-8994-4b35-9dbb-c8f93bfb91ad","resolution":{"observed_at":"2026-08-07T10:45:30.269887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T06:02:59.493679Z","title":"ediffi: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06276","last_updated":"2025-06-06T17:58:39Z","snapshot_observed_at":"2026-08-08T06:15:04.945610Z","submitted_at":"2025-06-06T17:58:39Z","title":"STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:59.493679Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.06276"},"observation_digest":"sha256:e191d3c17359111dc19397d7eeda044461ee2709fca7a335d0aadf282dacd3db","observation_id":"12eee950-c05b-49ec-846a-471dd2090737","resolution":{"observed_at":"2026-08-07T06:02:59.493679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T05:51:42.823441Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06952","last_updated":"2026-06-17T19:53:28Z","snapshot_observed_at":"2026-08-09T07:24:19.702501Z","submitted_at":"2025-06-08T00:15:32Z","title":"LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:42.823441Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.06952"},"observation_digest":"sha256:577822a228db3e179ecf288a4e369eb6be196bb572f2ee745adb11c7ce0b4820","observation_id":"66448d8b-09d7-4164-b986-eaa1344cea25","resolution":{"observed_at":"2026-08-07T05:51:42.823441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T05:20:50.982334Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.982334Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:995ab30468dc85e1e635cb7c3246ae4ea094df9501898c1f42518acde95bc6cc","observation_id":"aa460d2e-26ff-4f00-8a19-b5c09a34d2db","resolution":{"observed_at":"2026-08-07T05:20:50.982334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T23:58:30.815789Z","title":"ediffi: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-08T08:30:17.628486Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:30.815789Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:86bb4d112b88637b789036726b469e7080c842e35fc965b78d48d2a3f14fbb91","observation_id":"111bc253-d5c9-41d7-9272-575b3dd794ce","resolution":{"observed_at":"2026-08-06T23:58:30.815789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T23:42:39.205574Z","title":"eDiff-I: Text-to-image diffusion models with an ensem- ble of expert denoisers.arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.205574Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:746d70c93576dffc45787fb00d9ea6e4c9e8e67f5d5f5eae40ff952806d46ede","observation_id":"b29b55f1-1eae-4431-8287-c32b58950ab5","resolution":{"observed_at":"2026-08-06T23:42:39.205574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T23:11:08.054870Z","title":"arXiv preprint arXiv:2211.01324 (2022) 3, 4","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19261","last_updated":"2025-06-24T02:42:34Z","snapshot_observed_at":"2026-08-06T23:04:37.610443Z","submitted_at":"2025-06-24T02:42:34Z","title":"Automated Image Recognition Framework","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:08.054870Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.19261"},"observation_digest":"sha256:d07b80d4ca3b6ce502ba88489462fd29ab5bf0254984913bdba8f8305292cfe3","observation_id":"15472cfd-bef3-4be7-88a9-d01fda915b1e","resolution":{"observed_at":"2026-08-06T23:11:08.054870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T22:52:28.405764Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20548","last_updated":"2025-06-25T15:46:41Z","snapshot_observed_at":"2026-08-09T14:01:40.879158Z","submitted_at":"2025-06-25T15:46:41Z","title":"Pay Less Attention to Deceptive Artifacts: Robust Detection of Compressed Deepfakes on Online Social Networks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:28.405764Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.20548"},"observation_digest":"sha256:6741cc85fa41cea57eeb0453e97c9f8cfb6d00d714bd0127efa95f5fe72154fe","observation_id":"eb7ac436-19c2-499c-b12a-d029958e457e","resolution":{"observed_at":"2026-08-06T22:52:28.405764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T22:40:18.447091Z","title":"Ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.447091Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:ab3bfad8df17c5fb9ba8e3e1b44b190189561433edcfe22bd99047d0c1a9b655","observation_id":"45547b5a-3975-438f-8a80-e554d2d9599b","resolution":{"observed_at":"2026-08-06T22:40:18.447091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T20:35:50.644902Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.644902Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:361190c97f2db803cbcf326e796abac8a8c323d3c8d46a08da5205b8f76ef6e0","observation_id":"b08804e5-8ff5-4084-b159-68d3b0b1c927","resolution":{"observed_at":"2026-08-06T20:35:50.644902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T19:23:13.558538Z","title":"ediff-i: Text-to-image diffusion models with an ensem- ble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05798","last_updated":"2025-07-08T09:03:24Z","snapshot_observed_at":"2026-08-08T23:01:31.374352Z","submitted_at":"2025-07-08T09:03:24Z","title":"SPADE: Spatial-Aware Denoising Network for Open-vocabulary Panoptic Scene Graph Generation with Long- and Local-range Context Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:23:13.558538Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.05798"},"observation_digest":"sha256:9a55385f35aed58e993a3587915bc090781704d57e8c8805c33971065bec068c","observation_id":"e6c1f154-424c-4e6e-8c97-0885f4d72d77","resolution":{"observed_at":"2026-08-06T19:23:13.558538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T17:47:41.908874Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-09T06:49:52.603374Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.908874Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:5622c6c0ec7a31ef0269d08102279103389040bea5e763490f6460af1a0461a4","observation_id":"445a8dba-1b05-4cba-a628-2d456a35a3c4","resolution":{"observed_at":"2026-08-06T17:47:41.908874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T17:40:15.105103Z","title":"eDiff-I: Text-to-image diffusion models with ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10340","last_updated":"2025-08-04T04:07:02Z","snapshot_observed_at":"2026-08-09T14:51:05.310170Z","submitted_at":"2025-07-14T14:44:59Z","title":"Text Embedding Knows How to Quantize Text-Guided Diffusion Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:15.105103Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.10340"},"observation_digest":"sha256:779d9c6f7ab2f317c33605793d1ceb5889191c36c22996dcbd4984c63708739f","observation_id":"16c16034-acc9-42f5-babd-616579a769d2","resolution":{"observed_at":"2026-08-06T17:40:15.105103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T17:05:44.688352Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11980","last_updated":"2025-07-16T07:23:14Z","snapshot_observed_at":"2026-08-09T05:33:23.673940Z","submitted_at":"2025-07-16T07:23:14Z","title":"EC-Diff: Fast and High-Quality Edge-Cloud Collaborative Inference for Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:05:44.688352Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.11980"},"observation_digest":"sha256:bdf08ccc4d0ad5db16aeb4a9c1ed3b4417f6f92c1ac2197ede5db5c1f63c05cf","observation_id":"d4852944-9482-474d-b09d-235fe642719d","resolution":{"observed_at":"2026-08-06T17:05:44.688352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T17:02:23.270265Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11986","last_updated":"2025-08-05T03:45:30Z","snapshot_observed_at":"2026-08-08T06:55:38.171575Z","submitted_at":"2025-07-16T07:36:07Z","title":"Style Composition within Distinct LoRA modules for Traditional Art","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:23.270265Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.11986"},"observation_digest":"sha256:7c493420b4ece40daa57e907acfd390c4fec28bc7707fb72b7a1c0c3bc1ffe75","observation_id":"1e51ab2b-227c-4396-9f02-83f95e68273a","resolution":{"observed_at":"2026-08-06T17:02:23.270265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T17:01:03.781898Z","title":"eDiff-I: Text-to-image diffusion models with an ensemble of expert denoisers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11990","last_updated":"2025-07-16T07:42:02Z","snapshot_observed_at":"2026-08-06T16:54:11.551496Z","submitted_at":"2025-07-16T07:42:02Z","title":"ID-EA: Identity-driven Text Enhancement and Adaptation with Textual Inversion for Personalized Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:03.781898Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.11990"},"observation_digest":"sha256:ab37d028fff24d3906f3aa907a3490ef5efb0fee17700f3258a2688b0674beda","observation_id":"828bbe64-59ce-4710-842a-dbbf1bc3cc40","resolution":{"observed_at":"2026-08-06T17:01:03.781898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T15:42:23.635524Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15249","last_updated":"2025-07-21T05:15:45Z","snapshot_observed_at":"2026-08-08T19:24:05.470945Z","submitted_at":"2025-07-21T05:15:45Z","title":"FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:23.635524Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.15249"},"observation_digest":"sha256:2ba24f56f61bbe2df3667a2b990d1b8399e498c48cdaa2ab123b32543a764b3e","observation_id":"54bc3a67-0437-45f9-b8e2-4f611f159b68","resolution":{"observed_at":"2026-08-06T15:42:23.635524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T15:07:42.903385Z","title":"ediff-i: Text-to-image diffu- sion models with an ensemble of expert denoisers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16732","last_updated":"2025-07-22T16:14:35Z","snapshot_observed_at":"2026-08-06T15:00:26.780090Z","submitted_at":"2025-07-22T16:14:35Z","title":"HarmonPaint: Harmonized Training-Free Diffusion Inpainting","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:42.903385Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.16732"},"observation_digest":"sha256:c6c10b50c2541d6981816099ecfa3821df6a795916bdca5fae80719ad9d9e99d","observation_id":"6d627450-7cb7-4798-a4b1-1da25ab7f4a7","resolution":{"observed_at":"2026-08-06T15:07:42.903385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T14:45:53.164955Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17853","last_updated":"2026-06-21T15:14:16Z","snapshot_observed_at":"2026-08-07T20:37:21.945333Z","submitted_at":"2025-07-23T18:20:46Z","title":"Detail++: Training-Free Detail Enhancer for T2I Diffusion Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:53.164955Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.17853"},"observation_digest":"sha256:c2436e66ac5954ad90a44756340289e166ad625fc1898407e615bce63fac3d3c","observation_id":"d266571f-816c-4dea-86a4-4e3ca68ebe78","resolution":{"observed_at":"2026-08-06T14:45:53.164955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2507.18064","last_updated":"2026-05-01T09:45:37Z","snapshot_observed_at":"2026-08-02T12:29:58.765834Z","submitted_at":"2025-07-24T03:35:20Z","title":"Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T03:04:20.516410Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.18064"},"observation_digest":"sha256:88a64636f67c7e3384ddc7d6a63e16d86dcbf685e34f65579c429a396ae7724e","observation_id":"971b1463-4aac-482a-bee5-efb6137713e3","resolution":{"observed_at":"2026-05-19T03:07:00.089556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T13:58:05.146539Z","title":"ediff- i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19939","last_updated":"2025-07-26T12:57:02Z","snapshot_observed_at":"2026-08-06T19:10:47.776898Z","submitted_at":"2025-07-26T12:57:02Z","title":"LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:58:05.146539Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.19939"},"observation_digest":"sha256:9685223bddc1c5fec9d9e05c115531bb7e808ddf67d283abf2604327377586bf","observation_id":"2be2634a-9867-456f-97c1-6ceb237ba7e2","resolution":{"observed_at":"2026-08-06T13:58:05.146539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T15:01:52.186385Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.186385Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:aa1946bc39c727e18fdeb99b28ec3c96458538a69f931f481ded875cbfddf204","observation_id":"2e92cf0d-7eeb-4d4c-9d31-50ebba10271f","resolution":{"observed_at":"2026-08-06T15:01:52.186385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T11:32:39.827546Z","title":"ediffi: Text-to-image diffusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22604","last_updated":"2025-07-30T12:19:01Z","snapshot_observed_at":"2026-08-06T11:32:38.916172Z","submitted_at":"2025-07-30T12:19:01Z","title":"ShortFT: Diffusion Model Alignment via Shortcut-based Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:32:39.827546Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.22604"},"observation_digest":"sha256:338528fc40d50e57e89960a2438e2ca9ee7441b39415bae0c12c1c030d833989","observation_id":"25cbc780-269d-4c77-afc9-00fb10c257ad","resolution":{"observed_at":"2026-08-06T11:32:39.827546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2507.23372","last_updated":"2026-05-22T03:38:02Z","snapshot_observed_at":"2026-08-01T18:46:29.354743Z","submitted_at":"2025-07-31T09:39:27Z","title":"UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-25T08:14:28.540629Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.23372"},"observation_digest":"sha256:457be5d3ac6aeec07c1ef66b6042e1ba7e2430cf9948a97688f959752b68e00b","observation_id":"b494398e-e282-4e35-87d9-2f46d17112af","resolution":{"observed_at":"2026-05-25T08:15:33.760443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T10:38:58.427687Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23620","last_updated":"2025-07-31T15:00:15Z","snapshot_observed_at":"2026-08-06T10:38:55.839039Z","submitted_at":"2025-07-31T15:00:15Z","title":"DivControl: Knowledge Diversion for Controllable Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:38:58.427687Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.23620"},"observation_digest":"sha256:66e08e44b2202cdcb76da8c47daf6d6d0bebbd9eefedb02af889c43fb1e25120","observation_id":"6aca2a9f-dbf2-47ee-804d-bc3e525102b7","resolution":{"observed_at":"2026-08-06T10:38:58.427687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T10:47:00.530198Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03735","last_updated":"2025-07-31T11:24:40Z","snapshot_observed_at":"2026-08-08T12:16:40.336330Z","submitted_at":"2025-07-31T11:24:40Z","title":"StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:47:00.530198Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2508.03735"},"observation_digest":"sha256:035d90fcfbf8ceab4c0bb5df993daddef43791e60b65c02aede10e662b305951","observation_id":"07287fd2-36b5-461f-bb83-b7d6b51313a9","resolution":{"observed_at":"2026-08-06T10:47:00.530198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-05T22:02:50.001994Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07647","last_updated":"2025-08-11T05:57:59Z","snapshot_observed_at":"2026-08-08T09:09:54.565738Z","submitted_at":"2025-08-11T05:57:59Z","title":"LaRender: Training-Free Occlusion Control in Image Generation via Latent Rendering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:02:50.001994Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2508.07647"},"observation_digest":"sha256:cf4df1e3bc9555411ddea4b0ef08ca9e4967dd35b0b82346bf576cdb78788d52","observation_id":"474696b9-8d40-4138-b547-7d2445b24a9f","resolution":{"observed_at":"2026-08-05T22:02:50.001994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-05T18:41:30.780764Z","title":"ediff-i: Text-to-image diffusion models with ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.14413","last_updated":"2025-08-20T04:21:26Z","snapshot_observed_at":"2026-08-09T07:57:34.176288Z","submitted_at":"2025-08-20T04:21:26Z","title":"Disentanglement in T-space for Faster and Distributed Training of Diffusion Models with Fewer Latent-states","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T18:41:30.780764Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2508.14413"},"observation_digest":"sha256:c447dc79fe80140b976f8721a6d9fff77bf1236af96147918c72d337a893bf55","observation_id":"eb7e1a1c-5734-40e6-be3c-6219bf1c564e","resolution":{"observed_at":"2026-08-05T18:41:30.780764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-05T18:37:17.304373Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.14441","last_updated":"2025-08-20T05:53:05Z","snapshot_observed_at":"2026-08-05T18:37:15.366913Z","submitted_at":"2025-08-20T05:53:05Z","title":"FBI: Learning Dexterous In-hand Manipulation with Dynamic Visuotactile Shortcut Policy","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T18:37:17.304373Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2508.14441"},"observation_digest":"sha256:66dba43a07b1f77b9f0b66c0152391c140f76fc26338fef3d7a57d4769659257","observation_id":"7f098930-233b-4c61-95fa-773a854f20bc","resolution":{"observed_at":"2026-08-05T18:37:17.304373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-05T17:06:01.024756Z","title":"Balaji, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17050","last_updated":"2025-08-23T14:55:03Z","snapshot_observed_at":"2026-08-05T17:05:40.298074Z","submitted_at":"2025-08-23T14:55:03Z","title":"PVNet: Point-Voxel Interaction LiDAR Scene Upsampling Via Diffusion Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T17:06:01.024756Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2508.17050"},"observation_digest":"sha256:b300a21b2e4b8871abb681687594e7136d65b90f4eb40938c52d2b5bcb97bd17","observation_id":"b5ec6584-cfa5-4459-ba90-11305488c884","resolution":{"observed_at":"2026-08-05T17:06:01.024756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-05T13:02:41.014213Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01028","last_updated":"2025-09-03T15:01:47Z","snapshot_observed_at":"2026-08-09T10:46:02.325297Z","submitted_at":"2025-08-31T23:36:44Z","title":"CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:02:41.014213Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2509.01028"},"observation_digest":"sha256:889de355a49940f68f7e74810bfb6fef6dd3c10c6e50da384d56b22fe11a8cc5","observation_id":"3893f42b-8f57-47a7-8e03-eef69f1cb5b3","resolution":{"observed_at":"2026-08-05T13:02:41.014213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-05T11:42:08.312655Z","title":"ediffi: Text-to-image diffusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.02466","last_updated":"2025-09-02T16:20:20Z","snapshot_observed_at":"2026-08-08T09:51:53.618217Z","submitted_at":"2025-09-02T16:20:20Z","title":"TeRA: Rethinking Text-guided Realistic 3D Avatar Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:08.312655Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2509.02466"},"observation_digest":"sha256:33233a59931f2fecf1cf1748380f2eb3625b6338cfe68d4bcc4a02aade26a4e8","observation_id":"09184a01-47fa-4191-a0b0-786f9e66bac6","resolution":{"observed_at":"2026-08-05T11:42:08.312655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-05T10:52:02.104137Z","title":"eDiff-I: text-to-image diffusion models with ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03680","last_updated":"2025-09-03T19:59:20Z","snapshot_observed_at":"2026-08-09T08:25:50.746510Z","submitted_at":"2025-09-03T19:59:20Z","title":"LuxDiT: Lighting Estimation with Video Diffusion Transformer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:52:02.104137Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2509.03680"},"observation_digest":"sha256:32b178195935607381cadfa1a8496274f3dbb415449745e10b7a764a0ba1abe1","observation_id":"3ff10ea4-1236-492a-9fb8-96c01277074a","resolution":{"observed_at":"2026-08-05T10:52:02.104137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-05T10:24:55.186279Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04126","last_updated":"2025-09-14T00:18:40Z","snapshot_observed_at":"2026-08-05T10:24:49.011461Z","submitted_at":"2025-09-04T11:44:28Z","title":"MEPG:Multi-Expert Planning and Generation for Compositionally-Rich Image Generation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T10:24:55.186279Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2509.04126"},"observation_digest":"sha256:3e0c80b9d3bb26b4f64607b7d4b24215b2bc6480b1c5bb965eb9f7a89ace28fd","observation_id":"ed700eef-2748-4f9f-bb7b-d5a258b5aaf1","resolution":{"observed_at":"2026-08-05T10:24:55.186279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2510.21366","last_updated":"2026-04-09T14:57:51Z","snapshot_observed_at":"2026-07-06T22:33:58.663508Z","submitted_at":"2025-10-24T11:50:03Z","title":"BADiff: Bandwidth Adaptive Diffusion Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T04:31:20.147005Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2510.21366"},"observation_digest":"sha256:0454e616ebbc39d35550bc4688ce2d3505313d159dc29efb942de120c9a74f77","observation_id":"15b31ab6-c551-4039-a9f1-66e1b0a3951d","resolution":{"observed_at":"2026-05-18T04:32:23.149648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2511.07756","last_updated":"2026-05-11T15:40:18Z","snapshot_observed_at":"2026-08-03T11:14:03.491358Z","submitted_at":"2025-11-11T02:12:38Z","title":"Determinism of Randomness: Prompt-Residual Seed Shaping for Diffusion Generation","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T00:13:15.606804Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2511.07756"},"observation_digest":"sha256:d11c0422a4b1ad9cde9b2b79c378e018ef9faa449079bba66c2ad9752d4bf108","observation_id":"9d6c44bf-1ede-4ea1-a049-a9693044934b","resolution":{"observed_at":"2026-05-18T00:15:31.754773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2511.13285","last_updated":"2026-04-29T11:24:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-17T12:02:52Z","title":"SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T21:53:26.925547Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2511.13285"},"observation_digest":"sha256:4ea83518e890fed9bfe1708fcd3e1312cb702d835f2affc5401c936bf85915aa","observation_id":"fefe3a7e-d032-4dcf-897d-76eb4e067756","resolution":{"observed_at":"2026-05-17T21:55:20.229332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2511.17171","last_updated":"2026-05-22T12:44:18Z","snapshot_observed_at":"2026-08-02T04:31:50.136077Z","submitted_at":"2025-11-21T11:45:22Z","title":"FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:15.034196Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2511.17171"},"observation_digest":"sha256:6a40637a5b4dd4a82ad268c52a3893b2eadf995c69a3df570c375dc475310a01","observation_id":"d87214ab-67cf-4651-b51e-c6eb10ea12ab","resolution":{"observed_at":"2026-05-17T20:50:15.283812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2511.17171","last_updated":"2026-05-22T12:44:18Z","snapshot_observed_at":"2026-08-02T04:31:50.136077Z","submitted_at":"2025-11-21T11:45:22Z","title":"FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T07:17:26.381232Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2511.17171"},"observation_digest":"sha256:5c06054edba64f9845d15e6891ccff3650798f93c52f25148a987ac875a2ac95","observation_id":"632eaac9-d5d2-459f-b7b2-4266d9336fda","resolution":{"observed_at":"2026-05-25T07:20:28.831141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2601.22160","last_updated":"2026-04-10T13:20:41Z","snapshot_observed_at":"2026-08-03T08:11:38.324053Z","submitted_at":"2025-12-13T08:45:03Z","title":"Screen, Cache, and Match: A Training-Free Causality-Consistent Reference Frame Framework for Human Animation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T23:13:09.767909Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2601.22160"},"observation_digest":"sha256:4523915f028cc89fea1f041ed0458b3a2313f966fd5232665fd17fcefd7ba660","observation_id":"9e9988b7-d6e1-4195-b2ca-0440c21aafab","resolution":{"observed_at":"2026-05-16T23:13:39.301040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2603.08090","last_updated":"2026-06-30T03:35:03Z","snapshot_observed_at":"2026-07-15T12:51:11.895253Z","submitted_at":"2026-03-09T08:30:28Z","title":"DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T15:16:59.801347Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2603.08090"},"observation_digest":"sha256:0f598056c482a1e247d34fd31e84be139325a527da13bf24ac70d9f4b58549c3","observation_id":"5f44977e-193e-4bf3-a87a-5592d628d969","resolution":{"observed_at":"2026-05-15T15:20:09.021378Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-15T12:51:20.969593Z","title":"arXiv preprint arXiv:2211.01324 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.08090","last_updated":"2026-06-30T03:35:03Z","snapshot_observed_at":"2026-07-15T12:51:11.895253Z","submitted_at":"2026-03-09T08:30:28Z","title":"DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-15T12:51:20.969593Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2603.08090"},"observation_digest":"sha256:783736198da1564becf8d70b8f306764e551a8800b97247d8122beacd0c6f24a","observation_id":"a78a7641-2561-4da6-b075-d196545bf8f6","resolution":{"observed_at":"2026-07-15T12:51:20.969593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2603.08155","last_updated":"2026-05-20T06:27:00Z","snapshot_observed_at":"2026-08-02T10:42:01.827936Z","submitted_at":"2026-03-09T09:37:17Z","title":"C$^2$FG: Control Classifier-Free Guidance via Score Discrepancy Analysis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T15:02:16.208300Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2603.08155"},"observation_digest":"sha256:8089ee7b91d9075f93b5e7d2882ee29f8edca83ec9e0ad65a820ae784a97675f","observation_id":"a0afd2ce-21b2-46fc-b4e6-43f1058deb03","resolution":{"observed_at":"2026-05-15T15:06:10.175696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2603.08155","last_updated":"2026-05-20T06:27:00Z","snapshot_observed_at":"2026-08-02T10:42:01.827936Z","submitted_at":"2026-03-09T09:37:17Z","title":"C$^2$FG: Control Classifier-Free Guidance via Score Discrepancy Analysis","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T12:04:07.443646Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2603.08155"},"observation_digest":"sha256:ca0a0948e6ff580888fd1b48e9c41fad8da72faf8221ca32c732a67d80bdec2a","observation_id":"3034ded7-ae14-4f6a-b7d3-70bb11d81576","resolution":{"observed_at":"2026-05-21T12:04:09.476559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-15T12:07:05.640150Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.09241","last_updated":"2026-06-26T11:58:42Z","snapshot_observed_at":"2026-07-15T12:07:03.818843Z","submitted_at":"2026-03-10T06:16:23Z","title":"RAE-NWM: Navigation World Model in Dense Visual Representation Space","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-15T12:07:05.640150Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2603.09241"},"observation_digest":"sha256:588f2955e06beaa80681713d997a10d99803ddeff6d16c16fbd33b9528cd0c0e","observation_id":"70a3f10d-a146-43a8-b2ad-ef9e332b2aae","resolution":{"observed_at":"2026-07-15T12:07:05.640150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-04T05:37:54.863413Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.00933","last_updated":"2026-08-03T02:50:39Z","snapshot_observed_at":"2026-08-09T21:21:39.436819Z","submitted_at":"2026-04-01T14:10:23Z","title":"EmoScene: A Dual-space Dataset for Controllable Affective Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T05:37:54.863413Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2604.00933"},"observation_digest":"sha256:b5539e6408e4dfbd96ebc1bdd221296c0c36c626a05f6fb6f212422b3c69e1ca","observation_id":"63f9bc40-804d-440f-b078-c284791897e8","resolution":{"observed_at":"2026-08-04T05:37:54.863413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2604.05687","last_updated":"2026-04-22T08:35:48Z","snapshot_observed_at":"2026-07-30T10:59:44.086141Z","submitted_at":"2026-04-07T10:37:30Z","title":"3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T19:44:10.507760Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2604.05687"},"observation_digest":"sha256:36debee1b9080902ada95a12ec0d455d6a44f59c8420a01a3c88aef9e1e894e3","observation_id":"0ef16b8a-25dd-4b9d-adee-70a6e9343615","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2604.06129","last_updated":"2026-04-07T17:40:37Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:40:37Z","title":"PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:20:52.810648Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2604.06129"},"observation_digest":"sha256:221cf7f821816fe8255b4c81b28011d5c14943750108c1b8270bc65c3288afc8","observation_id":"c956675c-cbfe-4f4d-bf63-5891f02140c3","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2604.12668","last_updated":"2026-04-14T12:39:13Z","snapshot_observed_at":"2026-07-06T23:00:51.385974Z","submitted_at":"2026-04-14T12:39:13Z","title":"OFA-Diffusion Compression: Compressing Diffusion Model in One-Shot Manner","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:37:25.939058Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2604.12668"},"observation_digest":"sha256:a9695f7d4a7f113902c133b45f106568c267d7de50e9e981cc15f2e9ce6f7417","observation_id":"4422cfb9-91cf-48be-9843-a6641d9e44af","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2604.13495","last_updated":"2026-04-15T05:30:14Z","snapshot_observed_at":"2026-08-02T15:09:55.311008Z","submitted_at":"2026-04-15T05:30:14Z","title":"ADP-DiT: Text-Guided Diffusion Transformer for Brain Image Generation in Alzheimer's Disease Progression","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T14:27:50.244229Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2604.13495"},"observation_digest":"sha256:07e4f74db50e5b0c6863d2ecb1a90d61b8c560564e4e4b3f621385d0738dbe7d","observation_id":"2f3a28ab-4758-46d4-b5fe-780ad92178d6","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2604.13841","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-06T23:01:46.092000Z","submitted_at":"2026-04-15T13:13:04Z","title":"DiffMagicFace: Identity Consistent Facial Editing of Real Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T13:00:14.782905Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2604.13841"},"observation_digest":"sha256:ea2e02ddc95709ccfd05c73a8b061d5a70f2c35408bbf4e19ac20de36d0b6326","observation_id":"ded06288-94af-4f76-ab28-11a439e6023e","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2604.20156","last_updated":"2026-04-22T03:50:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T03:50:52Z","title":"Temporally Extended Mixture-of-Experts Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T00:39:39.492135Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2604.20156"},"observation_digest":"sha256:c874f1caa0078bebf682faf0983778fffafe31072d600d8d1d6dac781c7d32bc","observation_id":"078095d8-0147-472c-acaa-8b3449688842","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2604.25358","last_updated":"2026-04-28T08:25:32Z","snapshot_observed_at":"2026-07-06T23:11:16.247497Z","submitted_at":"2026-04-28T08:25:32Z","title":"Benchmarking Layout-Guided Diffusion Models through Unified Semantic-Spatial Evaluation in Closed and Open Settings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T16:58:28.380188Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2604.25358"},"observation_digest":"sha256:1d7f5577f595f96d3d869cfc126dd64e81712f16422f68fad62eb4cd7e431ccc","observation_id":"75e5cae1-5760-40b1-ba75-a4493a90f105","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T08:00:33.307429Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:bb60025451751079c67a3c7ff6bf7788175bb637995b2bed8fc62637200265e4","observation_id":"7ad172ae-bb5d-4534-9d8d-1b6d2c7130b8","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T09:11:02.183133Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:6b0b05e67c57f399b6502f2e522f0b3804d5d6402d1a386258338d494c98ebd7","observation_id":"5f1fb990-3ae2-4748-9199-c8f48e649161","resolution":{"observed_at":"2026-05-21T09:14:05.985262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2605.01799","last_updated":"2026-06-06T07:05:08Z","snapshot_observed_at":"2026-08-03T01:13:04.956310Z","submitted_at":"2026-05-03T09:39:44Z","title":"Embody4D: A Generalist Data Engine for Embodied 4D World Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T19:16:50.004359Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2605.01799"},"observation_digest":"sha256:51002a660454e2821f5be618f5000cf09948576ebfb9a809a8e9aa10d036848b","observation_id":"c94b9064-742f-4c50-977e-3f5f60bc7520","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2605.01799","last_updated":"2026-06-06T07:05:08Z","snapshot_observed_at":"2026-08-03T01:13:04.956310Z","submitted_at":"2026-05-03T09:39:44Z","title":"Embody4D: A Generalist Data Engine for Embodied 4D World Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T00:17:39.409452Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2605.01799"},"observation_digest":"sha256:657c66985c1f74411bff7978743bd1872fb42ce644c81b19517ed526502a9563","observation_id":"af36eaac-8998-435a-a5bb-540b219ba0b6","resolution":{"observed_at":"2026-07-01T00:25:09.902756Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2605.06272","last_updated":"2026-05-07T13:47:21Z","snapshot_observed_at":"2026-08-02T22:51:09.359998Z","submitted_at":"2026-05-07T13:47:21Z","title":"A Flow Matching Algorithm for Many-Shot Adaptation to Unseen Distributions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T13:13:22.775999Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2605.06272"},"observation_digest":"sha256:e279a47f97bcc5395b33779d905777f703e4e691d825a44aac1872e0b83f5957","observation_id":"f1cbd7d5-a271-4c37-a846-60a2a858c529","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2605.15684","last_updated":"2026-05-15T07:13:27Z","snapshot_observed_at":"2026-08-02T22:46:51.504070Z","submitted_at":"2026-05-15T07:13:27Z","title":"ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-20T20:00:27.987481Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2605.15684"},"observation_digest":"sha256:a3a25a54120b4ab667d5e02f1409641610399df5fb15b5ad1e160c94decbe7da","observation_id":"78006a91-efd5-46cf-8011-4aa4f4d486ee","resolution":{"observed_at":"2026-05-20T20:03:43.779101Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2605.16732","last_updated":"2026-05-16T00:52:00Z","snapshot_observed_at":"2026-07-31T16:38:42.574868Z","submitted_at":"2026-05-16T00:52:00Z","title":"DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T21:48:35.203469Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2605.16732"},"observation_digest":"sha256:c88fd68a02485a6d77d636d118f7646e2a2f9394179ff2b7034b21ea100a2b25","observation_id":"dba62026-e24a-49ee-81dd-825f6bf31fa9","resolution":{"observed_at":"2026-05-19T21:52:48.380410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2605.18010","last_updated":"2026-05-18T08:05:07Z","snapshot_observed_at":"2026-08-02T12:16:21.427153Z","submitted_at":"2026-05-18T08:05:07Z","title":"Functionalization via Structure Completion and Motion Rectification","version":1},"reference_index":235,"source":"arxiv_source","source_observed_at":"2026-05-20T12:25:07.157086Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2605.18010"},"observation_digest":"sha256:8d12e9d5dacc836633630a53cfec6e6c74cdb9155b8af0d32197d603468d1685","observation_id":"5f3a5b1d-2f8f-43ab-bff8-ae7d49bdf35d","resolution":{"observed_at":"2026-05-20T12:28:17.055342Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2605.19532","last_updated":"2026-05-19T08:33:10Z","snapshot_observed_at":"2026-08-02T22:16:23.062173Z","submitted_at":"2026-05-19T08:33:10Z","title":"Boosting Text-to-Image Diffusion Models via Core Token Attention-Based Seed Selection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T06:25:32.694239Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2605.19532"},"observation_digest":"sha256:1a6e047094e77d2de2651b28db8adb66a0e6d1104f5333d61086f438de1610db","observation_id":"863a4281-f374-49a6-a2dd-b14c782dcecb","resolution":{"observed_at":"2026-05-20T06:28:05.554995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2605.20079","last_updated":"2026-05-19T16:34:01Z","snapshot_observed_at":"2026-08-01T20:03:48.478574Z","submitted_at":"2026-05-19T16:34:01Z","title":"Probability-Conserving Flow Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T05:44:00.004160Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2605.20079"},"observation_digest":"sha256:76fc17e774971ac65d9d8b93f7880b63fd14c282ff341c974532d034abd3aacd","observation_id":"116b8b7b-a159-4256-ae79-42c055c1e030","resolution":{"observed_at":"2026-05-20T05:48:04.580212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2605.31590","last_updated":"2026-05-29T17:56:09Z","snapshot_observed_at":"2026-08-07T14:51:20.539252Z","submitted_at":"2026-05-29T17:56:09Z","title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:58.580004Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2605.31590"},"observation_digest":"sha256:4a0bb28a7d10cb2b6a7b92552c4c53c9d1731916adbceb0d40d02879109d9775","observation_id":"76e9be83-1093-4ba6-8b1b-1331471cb602","resolution":{"observed_at":"2026-06-28T23:12:46.594052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2606.00954","last_updated":"2026-05-31T02:10:34Z","snapshot_observed_at":"2026-08-02T19:44:09.651553Z","submitted_at":"2026-05-31T02:10:34Z","title":"COLLAR: Cascaded Object-Level Latent Refinement for High-Fidelity Conditional Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T17:51:18.190103Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2606.00954"},"observation_digest":"sha256:fadccc076a8e3762a7bc81225d684c2b78a4e1a3d0b0ab32498e52b781ee9625","observation_id":"ee394b25-a001-41d7-ba28-6582004b9f15","resolution":{"observed_at":"2026-06-28T17:52:27.267203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2606.01825","last_updated":"2026-07-01T05:50:06Z","snapshot_observed_at":"2026-08-05T10:25:09.105468Z","submitted_at":"2026-06-01T07:41:44Z","title":"ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search","version":1},"reference_index":149,"source":"arxiv_source","source_observed_at":"2026-06-28T15:18:17.427707Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2606.01825"},"observation_digest":"sha256:e2a2304a182198442b27c8c4e6ca2767f3248c84d5cc1f4532a3eb877d911e1c","observation_id":"592ee39d-b797-44be-866a-445beb32c426","resolution":{"observed_at":"2026-07-01T22:36:16.991442Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2606.01825","last_updated":"2026-07-01T05:50:06Z","snapshot_observed_at":"2026-08-05T10:25:09.105468Z","submitted_at":"2026-06-01T07:41:44Z","title":"ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search","version":2},"reference_index":149,"source":"arxiv_source","source_observed_at":"2026-07-02T23:17:03.456746Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2606.01825"},"observation_digest":"sha256:e3be97063ee360a8bc0cfc270eb651169733ee2e25193a1f74d4fa4543c6ccc1","observation_id":"3ca6233f-727d-4d2b-869a-c15ad2ca206e","resolution":{"observed_at":"2026-07-02T23:17:28.858650Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2606.04306","last_updated":"2026-06-03T00:25:56Z","snapshot_observed_at":"2026-08-05T10:27:41.050145Z","submitted_at":"2026-06-03T00:25:56Z","title":"Organizational Control Layer: Governance Infrastructure at the Execution Boundary of LLM Agent Systems","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-06-28T04:17:18.483765Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2606.04306"},"observation_digest":"sha256:26b40d1a6b9843e4eff2cbc8a3ca41a91148f4c208c810aa253075db34b0db1c","observation_id":"80813f2b-ef85-444f-9024-be2fcb752dbf","resolution":{"observed_at":"2026-07-02T11:16:53.831404Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2606.06477","last_updated":"2026-06-04T17:57:15Z","snapshot_observed_at":"2026-08-02T17:51:25.103694Z","submitted_at":"2026-06-04T17:57:15Z","title":"Complexity-Balanced Diffusion Splitting","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:11.177707Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2606.06477"},"observation_digest":"sha256:da19cded9b0436379fa964851e6b3435dac3232c477dd505cd0ce0b3e856bfb7","observation_id":"f9a6089f-248c-4f82-894f-0a0f5becdf0e","resolution":{"observed_at":"2026-07-02T12:16:56.637155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2211.01324/citation-record","integrity":"/paper/2211.01324/integrity","json":"/paper/2211.01324/citation-record.json","paper":"/paper/2211.01324"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.10684","last_updated":"2022-10-26T16:14:05Z","snapshot_observed_at":"2026-08-03T02:24:22.577450Z","submitted_at":"2021-12-20T17:05:11Z","title":"Efficient Large Scale Language Modeling with Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2112.10684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.10684","snapshot_observed_at":"2026-07-01T22:36:16.721505Z","title":"Artetxe et al., Efficient Large-Scale Language Modeling with Mixture of Experts","venue":null,"work_id":"711d98e0-b9e1-4350-b81d-a621de85a6bb","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2112.10684","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:bc623a9ebff4e8a4aad8fcbef0eed57b3d3f8422728cba4bc3912d12ff7c55bf","observation_id":"4cfcdc35-95fd-4e6d-9bea-35bfe4e126f3","resolution":{"observed_at":"2026-05-15T01:44:22.789288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02779","last_updated":"2023-04-30T17:43:11Z","snapshot_observed_at":"2026-08-09T10:53:50.742239Z","submitted_at":"2022-06-06T17:58:04Z","title":"Blended Latent Diffusion","version":2},"cited_work":{"arxiv_id":"2206.02779","doi":"10.48550/arxiv.2206.02779","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.02779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2206.02779 , year=","venue":"arXiv (Cornell University)","work_id":"1aef642e-c5e8-42d8-a391-f41998245355","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2206.02779","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:84f87ab210db3679af5c040410a9f15bc43fb928dd8822ceb2ca9d12e5003a31","observation_id":"96e6915f-ccb4-40c1-b904-7c981be28cec","resolution":{"observed_at":"2026-05-15T01:44:22.747418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":"b7d69bd8-2483-45c0-93f6-0bf59101b935","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:1a70c0744ed7cd7fcd5f6e77836ca4cc24f02698ca3360aa07f99357c537e6e2","observation_id":"e0248014-4cd4-44b8-a626-6cb267d67067","resolution":{"observed_at":"2026-05-15T01:44:22.931947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Estimating the optimal covariance with imperfect mean in diffusion probabilistic models","venue":null,"work_id":"6a02cf87-87e3-4e01-8807-1815408583fe","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:9451e3bee8620914964f954fb7b13f4d368ebcd382872cb7798356701a30f0cb","observation_id":"06bd2e55-cf1b-4ca1-9c54-d58ef5f55195","resolution":{"observed_at":"2026-05-15T01:44:22.934122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analytic- DPM: An analytic estimate of the optimal reverse variance in diffusion probabilistic models","venue":null,"work_id":"83033437-6996-4dfd-9f0f-41f417388b99","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:d2ed7f75ca01e9a671b6dfb5f9fce434507185813ffcf0c8c1a5b4011593dcea","observation_id":"f7f5fc54-3b53-4f2a-9aa7-c76684be0834","resolution":{"observed_at":"2026-05-15T01:44:22.936164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10951","last_updated":"2023-03-23T21:31:18Z","snapshot_observed_at":"2026-08-06T09:36:46.171618Z","submitted_at":"2021-03-19T17:59:08Z","title":"Paint by Word","version":3},"cited_work":{"arxiv_id":"2103.10951","doi":"10.48550/arxiv.2103.10951","metadata_source":"arxiv_reference","pith_arxiv_id":"2103.10951","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2021 , journal =","venue":"arXiv (Cornell University)","work_id":"34137c1a-a794-46f0-90ed-ed2d3e8e856f","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2103.10951","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:06adc5c4f7e9052f76cadb7aecda70ad9655a77a3454fe30d0ad5f8653677ba9","observation_id":"e0a1bb80-58bd-496e-a983-ebe519f29acf","resolution":{"observed_at":"2026-05-15T01:44:22.751402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semi-Parametric Neural Image Synthesis","venue":null,"work_id":"9c767c04-e7ec-440a-a94d-bfc2fd4fe310","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:9b5cda4469b9ef72820841d392807a5f5befcf8594b770313435598190051c09","observation_id":"16cfe5b7-4b2b-419d-9eea-26467d06b0d1","resolution":{"observed_at":"2026-05-15T01:44:22.940165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Sub- biah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":"9f600c7e-9f2c-47be-8c6f-d5641514baf1","year":2020},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:1fb5cea75a9d0d6cfe9b7df54d10c5d122f57a81a21194b13738e4b17cb776a7","observation_id":"8bdaa08c-f548-41bf-98ef-1073d0590f2c","resolution":{"observed_at":"2026-05-15T01:44:22.942657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14491","last_updated":"2022-11-22T02:09:38Z","snapshot_observed_at":"2026-08-03T22:24:49.500281Z","submitted_at":"2022-09-29T00:57:28Z","title":"Re-Imagen: Retrieval-Augmented Text-to-Image Generator","version":3},"cited_work":{"arxiv_id":"2209.14491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.14491","snapshot_observed_at":"2026-07-04T13:19:51.137014Z","title":"Re-imagen: Retrieval-augmented text-to-image generator","venue":null,"work_id":"3b99c692-394e-4df1-aede-f245b6e75ed8","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2209.14491","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:4fa201e78abdde450481d3305c1fe8ec72fbdf2c46c0f6bb137a48ce94a11e0a","observation_id":"1fbfb04f-8ef9-4145-8dc6-4133e4029d08","resolution":{"observed_at":"2026-05-15T01:44:22.755533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:349f8bdaa2de09513a81ca0b1466a1604583149c882f739a9c33c98b94c83e1d","observation_id":"0e5fb1cf-e8b8-4fe3-97cd-c5f9b975fece","resolution":{"observed_at":"2026-05-15T01:44:22.759067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving diffusion models for inverse problems using manifold constraints","venue":null,"work_id":"7bbcf6ae-5786-4fa5-9add-5395d13dbf24","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:d29e4a494818fbfe1550301d84afc4e22cbd7d08effbcb1aa85a7f8994568ced","observation_id":"f1925581-ac49-4bd2-b550-fc83f3d6f2fd","resolution":{"observed_at":"2026-05-15T01:44:22.948948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-01T15:07:11.635426Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":"2210.11427","doi":"10.48550/arxiv.2210.11427","metadata_source":"pith","pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffedit: Diffusion-based semantic image editing with mask guidance","venue":"cs.CV","work_id":"e0e59c16-b6da-4ec1-9bf5-488374e2cde5","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:85065e116126290144e9dfa22610c250b5f1b968687ffb7d1c48744426a9b20a","observation_id":"0101af1d-0f1d-4eb1-947a-81383b86f351","resolution":{"observed_at":"2026-05-15T01:44:22.763483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models beat GANs on image synthesis","venue":null,"work_id":"e554e606-c2ba-43d7-afb3-4c297ccfbaed","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:c84629710b014ccc324b43d6ec4eba2a365a6a26301869489e0cf1cf1bdfd1e6","observation_id":"edce3746-14fc-4d51-bb8b-4dc0d25f16f6","resolution":{"observed_at":"2026-05-15T01:44:22.953231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09929","last_updated":"2023-12-31T01:24:45Z","snapshot_observed_at":"2026-07-06T14:07:15.678393Z","submitted_at":"2022-10-18T15:20:47Z","title":"Differentially Private Diffusion Models","version":3},"cited_work":{"arxiv_id":"2210.09929","doi":"10.48550/arxiv.2210.09929","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.09929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Differentially private diffusion models","venue":"arXiv (Cornell University)","work_id":"aca33393-7661-4a15-a84a-6dffdbb3b1a0","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2210.09929","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:ad4b676315dbb47d756715c6ea6cdaf1ca1b5a7868ca912d80463432ba043dc5","observation_id":"c5591587-d3e4-409d-befa-6bfc711f906d","resolution":{"observed_at":"2026-05-15T01:44:22.767374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GENIE: Higher-order denoising diffusion solvers","venue":null,"work_id":"b5aa13c5-35be-4849-afa5-625b7e0b8929","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:d4ed3a0550880a651c1ad04e11112e1eb0b6398ab8ea7998a0d3cf1e5cd81934","observation_id":"a8a8fbe6-f931-48b2-bc36-c64d1c399a94","resolution":{"observed_at":"2026-05-15T01:44:22.957290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score- based generative modeling with critically-damped Langevin diffusion","venue":null,"work_id":"8fcf496c-12a2-48ff-9650-378f8baddb03","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:05095ead9a0dc9a9e82fb12add277273ef311bd855d27bd040bd8cc1aef44955","observation_id":"93284660-d9df-4aca-9a2e-67dfe01522a8","resolution":{"observed_at":"2026-05-15T01:44:22.959390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:e7b0a250df265c8ea5af65e2a5766aa019447b6accf9c1db7a6acd33282e1659","observation_id":"ed82296c-576b-4c67-870b-f8a6d783e25f","resolution":{"observed_at":"2026-05-15T01:44:22.771350Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":"2208.01618","doi":"10.48550/arxiv.2208.01618","metadata_source":"pith","pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","venue":"cs.CV","work_id":"ca618c21-3ba6-448e-bd86-bcecff3cdeb5","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:8c0ed48f9a772c675b2f28511e009f2baf8cfb40b6df5c68be7f4a17acf0db75","observation_id":"a2ddae1b-1548-4a2a-a7ed-19dffcb59f0d","resolution":{"observed_at":"2026-05-15T01:44:22.774581Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vector quan- tized diffusion model for text-to-image synthesis","venue":null,"work_id":"0e26f057-ceb9-42ef-ba0f-92ff5b075442","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:89821bb7fbdc09348984a5f5c7d66b3f76f23c3f19a9fc38d5165266e16bc1aa","observation_id":"6861b754-c203-4aa0-b5e9-1ad46753b053","resolution":{"observed_at":"2026-05-15T01:44:22.965929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11495","last_updated":"2022-12-15T20:57:59Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:51:48Z","title":"Flexible Diffusion Modeling of Long Videos","version":3},"cited_work":{"arxiv_id":"2205.11495","doi":"10.48550/arxiv.2205.11495","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.11495","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flexible diffusion modeling of long videos","venue":"arXiv (Cornell University)","work_id":"ea21a47c-f4b3-49bb-91fa-c68fd79c77e3","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2205.11495","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:27a98b939410a5e207faf8f5316b965a5353c53e33adf3346e4171811396ddac","observation_id":"bca94485-57b3-4344-acba-318a655fac47","resolution":{"observed_at":"2026-05-15T01:44:22.778510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":"2010.14701","doi":"10.48550/arxiv.2010.14701","metadata_source":"pith","pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Autoregressive Generative Modeling","venue":"cs.LG","work_id":"1f180c21-02d6-4b11-9dfc-08d7f0d8fc81","year":2020},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:b32057bc0223f9ac8576e0e65302d9d2a4785d92c4e890018d10eec110868500","observation_id":"af63918c-b025-4525-9679-939864f63423","resolution":{"observed_at":"2026-05-15T01:44:22.781916Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":"2208.01626","doi":"10.48500/arxiv.2208.01626","metadata_source":"pith","pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","venue":"cs.CV","work_id":"196f7eef-d65a-47e4-b815-9a188f6aedcf","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:f93f5600d870f36904b8085baa5c5e094269fff2ce8530c0df79716c51e603bf","observation_id":"2ec3655f-cd4d-4a21-b47e-95f71a26e2f8","resolution":{"observed_at":"2026-05-15T01:44:22.785529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:4699aa6db7ef546ce92765a517fb617c819fcbf7d544af80abe2c0e7d3749135","observation_id":"a502432f-8db1-48ee-b10c-840050cbd313","resolution":{"observed_at":"2026-05-15T01:44:22.742944Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"e309f7c3-caff-421b-a32c-df16108cd59d","year":2017},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:df362e448fe4c27ec68562b23541c81a6187bc2ff7dfa52c9226bd14519d914b","observation_id":"71502766-3199-4882-8103-17175225866a","resolution":{"observed_at":"2026-05-15T01:44:22.975987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:795755bb1959c00d3bc5f57f7cd7312c0cf3e1ebbc22a4f48cf6b99bc24c4494","observation_id":"d9b86598-1fb0-481b-a3c4-0f796ee15abd","resolution":{"observed_at":"2026-05-15T01:44:22.792960Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"41fe1fcf-bca9-4c79-b6cb-1d41fcc9bdbc","year":2020},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:4b6f2d64735c0867ee6328ac5c9bd53bf045dcd9c745e087e1bc8127e54b43df","observation_id":"d64444c0-ed2a-4645-a4ff-4794030c2c54","resolution":{"observed_at":"2026-05-15T01:44:22.980712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fleet, Mohammad Norouzi, and Tim Salimans","venue":null,"work_id":"d28eabd0-cb10-4bc3-93cc-3492540a9cdd","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:c553062de4e0d2e13c6bce2e0f21d963750e6d534fd7d3b3cfbdb208f44766e9","observation_id":"3af1b140-a25a-4315-9acd-713e288c105f","resolution":{"observed_at":"2026-05-15T01:44:22.982818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Classiﬁer-free diffusion guidance","venue":null,"work_id":"6266247e-b295-4167-a63e-3b4d3216a3fc","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:3be0d0cf2755340e28cf9610e229624f15f5ca63414fc40e5ae040119105ad19","observation_id":"ae71d0e1-b9ec-49c3-86fc-74893d87e08d","resolution":{"observed_at":"2026-05-15T01:44:22.984720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"661deffd-9044-464b-ab4e-9cfaf821d635","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:d2ef5d325d9b7a956e0af8c06a9b4b1e916b75b90fa27dd6b8c3184374b37280","observation_id":"713da928-6dbb-47d5-8dca-273214ee4d5c","resolution":{"observed_at":"2026-05-15T01:44:22.986794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal conditional image synthesis with product- of-experts GANs","venue":null,"work_id":"ad5bbf24-e0f2-45ad-85b6-b5f304d06bff","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:e35dab3c50caa0548512acebaba1f43bd67265d7a9ca642c25ba6006e743abd1","observation_id":"c253ac07-5e7e-47a2-a41b-7d25d9798e75","resolution":{"observed_at":"2026-05-15T01:44:22.988830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Estimation of non-normalized statistical models by score matching","venue":null,"work_id":"d6dcf9c1-030b-4621-854c-a61741cdc4ca","year":2005},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:9b982232aed728f24aa6b9865c37f21d4f0aa281e5fd741049f496762f533bc2","observation_id":"65ed0c4a-39fc-4f44-bd70-749d758c9f33","resolution":{"observed_at":"2026-05-15T01:44:22.990901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"64e0f771-6e2c-4bdd-bb5a-94a2aaef782f","year":2017},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:d29ed759c72bf2fbd5619701577237f19991a42ef2ae2978364eeac93356c129","observation_id":"6d670588-9885-41c2-beff-358cba4d52d2","resolution":{"observed_at":"2026-05-15T01:44:22.851104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:8dc72eb584f49103e8904c8ae132a025067107d8cc5a983845427ea38fc15262","observation_id":"28e1549b-7fed-42fa-b805-5a3deb7c4026","resolution":{"observed_at":"2026-05-15T01:44:22.796173Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"25c90e69-bfa1-4e54-9d24-33f44e39df10","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:1bf53bf1aa0b851eeb44ba0a9bf98511dfb2f9d34e08c6319130cea25e140a93","observation_id":"b5717a46-70ef-43cc-ba4f-64b259d99028","resolution":{"observed_at":"2026-05-15T01:44:22.856375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion restoration models","venue":null,"work_id":"8be94e58-b1b1-4718-9f39-0697e28ad043","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:4908af63f50b3472dbc7febb562b0df39c8f3587a896d39d5bc623cda55b8fb9","observation_id":"4765c859-fb2b-4e91-8b19-81102673512d","resolution":{"observed_at":"2026-05-15T01:44:22.858761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JPEG artifact correction using denoising diffusion restoration models","venue":null,"work_id":"d9523b21-0cf3-4241-bb20-833bb5f1ebfa","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:1449b21fad9d201dfb3a0830c56541598e74221000cf81a35e907470ee60c6f9","observation_id":"28b32dd2-6a5f-442e-bb3f-9220ae29e3a0","resolution":{"observed_at":"2026-05-15T01:44:22.860934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09276","last_updated":"2023-03-20T15:58:50Z","snapshot_observed_at":"2026-07-06T14:06:48.707061Z","submitted_at":"2022-10-17T17:27:32Z","title":"Imagic: Text-Based Real Image Editing with Diffusion Models","version":3},"cited_work":{"arxiv_id":"2210.09276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.09276","snapshot_observed_at":"2026-07-02T23:17:28.942618Z","title":"arXiv preprint arXiv:2210.09276 , year=","venue":null,"work_id":"1788e556-8e11-4023-930c-dbb8fc0121a2","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2210.09276","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:498157b7a7be0bbd51bff09faccfaf17ab4a5ec806821fafcf6a90be8189206e","observation_id":"d2d4e7b0-3766-4fc1-935a-855a3ccd338b","resolution":{"observed_at":"2026-05-15T01:44:22.800076Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13435","last_updated":"2023-02-23T13:31:20Z","snapshot_observed_at":"2026-08-08T04:01:12.255493Z","submitted_at":"2022-09-27T14:44:57Z","title":"Scaling Laws For Deep Learning Based Image Reconstruction","version":2},"cited_work":{"arxiv_id":"2209.13435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.13435","snapshot_observed_at":"2026-07-02T16:07:08.705454Z","title":"Scaling laws for deep learning based image reconstruction","venue":null,"work_id":"378b95e0-8eb2-418b-a607-e1e79791bada","year":2023},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2209.13435","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:0a5213a3f4a870280c3e0d667cd6db38d5843cb4f3655f05068f8eb35f5a771c","observation_id":"911cff8d-3a9b-47b8-8d48-09344cc9fea7","resolution":{"observed_at":"2026-05-15T01:44:22.803125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DiffWave: A versatile diffusion model for audio synthesis","venue":null,"work_id":"b49530f2-6bbf-46b8-a2ea-2d96023811cb","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:de091c4b513854494ade5b7a9d84fd49637ec5598c4682a0d0b825858ae71f6d","observation_id":"de748b40-0c38-46f7-8f42-2da104786a49","resolution":{"observed_at":"2026-05-15T01:44:22.867629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shamma, Michael Bernstein, and Li Fei-Fei","venue":null,"work_id":"25f5ba4b-3a28-4688-b6d8-4f75c08e7742","year":2017},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:f779fd78f627ca2a78770c4291782d6720431c5fe53b83a9fccadae6e3f3dc10","observation_id":"b919c1cb-ac17-44a0-bd97-5286d6136579","resolution":{"observed_at":"2026-05-15T01:44:22.869730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14217","last_updated":"2022-05-27T20:12:09Z","snapshot_observed_at":"2026-07-06T13:14:52.308302Z","submitted_at":"2022-05-27T20:12:09Z","title":"Diffusion-LM Improves Controllable Text Generation","version":1},"cited_work":{"arxiv_id":"2205.14217","doi":"10.48550/arxiv.2205.14217","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.14217","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion- lm improves controllable text generation","venue":"arXiv (Cornell University)","work_id":"fa3c84e2-33fb-4131-b9ae-116e0938f4d7","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2205.14217","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:a9d17164b40a21066ce4918f2caa98004d47868fe8e39302e406c68509cb7323","observation_id":"bf2ecf67-d2a1-4b1e-896f-a3302efc7553","resolution":{"observed_at":"2026-05-15T01:44:22.806438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick","venue":null,"work_id":"b9cd85bf-683e-462a-8f7d-355d92d7c102","year":2014},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:08b1c80cdf252b6d0e57ffebfc42cd13945ba14c4314b771f849637228c92d05","observation_id":"140d7666-2750-46fc-86f4-92068cca4887","resolution":{"observed_at":"2026-05-15T01:44:22.873930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pseudo numerical methods for diffusion models on manifolds","venue":null,"work_id":"5e0a4a42-4eba-4669-a7ee-0293deba86e7","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:727e8812a599ab5a0b6c0ab2f763e1ad4f88b8740a51ad162a7c67b1c636f22f","observation_id":"20c0cd8c-9101-4ad6-8b55-9922cd475ff0","resolution":{"observed_at":"2026-05-15T01:44:22.875987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imaginaire","venue":null,"work_id":"2721f6eb-3798-4a12-833a-9de68c2b8b85","year":2020},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:7c3ec3426b576e93334744f4b2b5750e73b79ff21a55759a57e30298536db79b","observation_id":"3db6695a-cfa9-4c01-9fb9-14606c2bf699","resolution":{"observed_at":"2026-05-15T01:44:22.878209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"a295d18d-89f3-4d5e-9f2b-a762aee86b5d","year":2019},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:2967a794eb49d4ae0e7bc81a47ea642206ebc17e2833a0778ef7187a2fca7536","observation_id":"c536e42b-c314-4bcb-9d62-0abf470bdcfb","resolution":{"observed_at":"2026-05-15T01:44:22.880236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DPM-Solver: A fast ODE solver for diffu- sion probabilistic model sampling in around 10 steps","venue":null,"work_id":"b98d5e8e-eeb1-4ad5-ab6b-58df7fd0fec4","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:99f6e082fad2abbdeedd8dfbd9bb6f085c5093259cefbcbe2693d560c436c20c","observation_id":"c5e52d17-b3fc-49f9-a9dd-d0aa8d788082","resolution":{"observed_at":"2026-05-15T01:44:22.882527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RePaint: Inpainting us- ing denoising diffusion probabilistic models","venue":null,"work_id":"49f8af9c-37ca-44dd-9dfa-8d2fc60bffb9","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:6065c3e05e67c348faf415820cd2c05cc32b87c104125ea441e460f9cbef46c6","observation_id":"07bcd33a-7e69-4128-b9aa-8c573645c0a6","resolution":{"observed_at":"2026-05-15T01:44:22.886236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04316","last_updated":"2022-07-09T18:21:32Z","snapshot_observed_at":"2026-07-06T13:29:32.211007Z","submitted_at":"2022-07-09T18:21:32Z","title":"Improving Diffusion Model Efficiency Through Patching","version":1},"cited_work":{"arxiv_id":"2207.04316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.04316","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving diffusion model efﬁciency through patching.arXiv preprint arXiv:2207.04316","venue":null,"work_id":"0c70eeaa-8f16-471a-bedb-feb737dd2f38","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2207.04316","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:102c8a985fde0ee4ccab86281ce840416f8368a0810d4634e1f5f97b0cdb4abb","observation_id":"092e0232-8153-49ee-a80d-27467c6deec2","resolution":{"observed_at":"2026-05-15T01:44:22.809834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion probabilistic models for 3D point cloud generation","venue":null,"work_id":"ca1c53e5-19c3-476a-99e3-69a525a380a6","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:32cf2499c7af24b0cc2de4ce54676020166c63379a44afafdc1831ec821a2fa6","observation_id":"9b4edcb0-a35a-43e6-97c3-679614052a53","resolution":{"observed_at":"2026-05-15T01:44:22.893209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SDEdit: Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":"b8e773d8-496e-4a86-bf56-1e89937931a7","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:f3f8a3e6a0acac8b2ff8015eff3a8ae4de0dc038852efd0ea99a430209a94a54","observation_id":"b810f07a-55e1-4600-b264-171769075615","resolution":{"observed_at":"2026-05-15T01:44:22.895304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GLIDE: Towards photorealistic image genera- tion and editing with text-guided diffusion models","venue":null,"work_id":"97cd490e-6e2f-4ee1-ae29-12275bb2ca7e","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:a48cc72ae25632ed0cb6bd12f57000ce10d3704fb9530978e29c7c9ffb66f857","observation_id":"4dece804-9451-4355-8db1-8aad6f4fadfd","resolution":{"observed_at":"2026-05-15T01:44:22.897380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models for adver- sarial puriﬁcation","venue":null,"work_id":"27b0fab2-6c48-4b36-8bc8-16fa6744c622","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:cf0c3fe849c4df0c8c35aaa7bc8589fd6af179845bae56a9640df0509401a531","observation_id":"b9eb3469-1eda-44f3-be24-b6e31fc808be","resolution":{"observed_at":"2026-05-15T01:44:22.899438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic image synthesis with spatially-adaptive nor- malization","venue":null,"work_id":"90ab60f0-46dc-401e-8892-928e7a25dc81","year":2019},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:b321a525146c5af1d05dda1b8ac0f29768ca120df165f8e5df9dbeeb6395ce02","observation_id":"7a69962c-9d00-4c5c-8830-4dab6b02704b","resolution":{"observed_at":"2026-05-15T01:44:22.901581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PyTorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"c7eaf7a8-c96c-4e9e-ae05-f613c9a23a45","year":2019},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:f0eb459aced67859314f24fb32456a4bf086ff1e224d8b33d8e412eae8f83307","observation_id":"8de4a19a-e6cf-4de6-9b97-affc0806e97a","resolution":{"observed_at":"2026-05-15T01:44:22.903719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"86536aa3-fcd2-4223-8e92-346e685a66a2","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:eadd75653d9e7fc58c701e37f87baf90e7bafb73050d9aeea69766497e070b1b","observation_id":"a17cc095-0636-4915-92f0-8c0f1c28bc32","resolution":{"observed_at":"2026-05-15T01:44:22.906261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"213b1c94-8599-441c-996a-10d20b521378","year":2020},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:9dc31e321b1aeaa2521b5c0b4362cd865cdd619920b709b6a96c6ff9b447ceec","observation_id":"7314203c-2ae9-4cad-8d59-5f4c79b270c0","resolution":{"observed_at":"2026-05-15T01:44:22.908447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:51aeaef7dec638d20abd46f4343d455c1859eceda9b6ce2d58f058c18700c5ed","observation_id":"5589e3b5-5838-437e-90fa-b3572cec858f","resolution":{"observed_at":"2026-05-15T01:44:22.812845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"75eee6d7-bbc2-4560-92fd-11667bd66236","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:b9ab817ad316c1ad7bb543745511baa985d76618340fb02ccc50f3e76d5c6ad1","observation_id":"2aaaa9a8-e06d-413d-b42b-cc2d7159bcdc","resolution":{"observed_at":"2026-05-15T01:44:22.912758Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling vision with sparse mixture of experts","venue":null,"work_id":"89eddeee-6835-4acf-96f1-6fa6e8eb8161","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:6b5b578c1217c47f9f2624ada8cda6b9054200a5dce248f5d59034158ea572df","observation_id":"e230708c-e033-4455-b4aa-9f5433c60bfa","resolution":{"observed_at":"2026-05-15T01:44:22.914806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"19d9d8e5-3d5a-475d-9cae-736a44aba60d","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:50677edc522601ffe409fd4031c59ef97feba189f27aa9c5e7b3a080fcbb769f","observation_id":"7803db55-2f72-4eca-9782-be577ac641ae","resolution":{"observed_at":"2026-05-15T01:44:22.917350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable diffusion v1-4","venue":null,"work_id":"e9509921-c88d-4170-b456-a423f0b2f6b7","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:5980ce9b93f537483a3a759805ead282e594074a8b226887afbfd16e26255b5f","observation_id":"920c1d2d-78cb-4276-875b-5d5a1fc2ac90","resolution":{"observed_at":"2026-05-15T01:44:22.919372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12242","last_updated":"2023-03-15T17:52:27Z","snapshot_observed_at":"2026-07-06T13:45:31.237782Z","submitted_at":"2022-08-25T17:45:49Z","title":"DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation","version":2},"cited_work":{"arxiv_id":"2208.12242","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.12242","snapshot_observed_at":"2026-07-09T18:36:27.290071Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject- driven generation","venue":"cs.CV","work_id":"a531ae3d-a7d0-4cda-a38f-7ccb769014c3","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2208.12242","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:5b177583149d82ec0c8ecbaa6b331a17424ee154fda93043b9899a023d3ae749","observation_id":"c6899938-8966-40d4-87cb-2d95bea1aae7","resolution":{"observed_at":"2026-05-15T01:44:22.816531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lee, Jonathan Ho, Tim Salimans, David J","venue":null,"work_id":"1513473f-e851-47da-9bc7-f2e5964cc6b6","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:960880117d8a450f6989968873f2168949971bd2e754ff847725e7352e5e7f64","observation_id":"3af4c88a-4fd2-4506-9cbd-e30ea375f701","resolution":{"observed_at":"2026-05-15T01:44:22.923323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":"2205.11487","doi":"10.48550/arxiv.2205.11487","metadata_source":"pith","pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":"cs.CV","work_id":"af16442b-a46f-469d-8818-c37b53a504c7","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:a98719f1cc1e92a29d9b4e9020f494ffe33a35cce3a190018d631694cce9439a","observation_id":"df3b422a-a206-4ab5-9d3d-79c9aa46e8cd","resolution":{"observed_at":"2026-05-15T01:44:22.819391Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fleet, and Mohammad Norouzi","venue":null,"work_id":"79f7ce4a-d18f-45ff-8b14-ff947a43920b","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:bbd12cc45da07ed38d869ec61a2c5e9eb491eaa20641e3de96de5c6fac5fa958","observation_id":"415e1820-afc6-429e-a54b-98e00fffdf7b","resolution":{"observed_at":"2026-05-15T01:44:22.927667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outra- geously large neural networks: The sparsely-gated mixture- of-experts layer","venue":null,"work_id":"00b097e2-31c4-4217-9dca-031c0a8a850c","year":2017},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:a4fc9feb1135dea3a544b6d9ec7317fdc5228a0edb065a48136eb089056ca362","observation_id":"198eaf8a-95d8-4731-9c4b-7bb03b700caa","resolution":{"observed_at":"2026-05-15T01:44:22.929930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02849","last_updated":"2022-10-02T11:55:59Z","snapshot_observed_at":"2026-08-06T04:16:14.037579Z","submitted_at":"2022-04-06T14:13:35Z","title":"KNN-Diffusion: Image Generation via Large-Scale Retrieval","version":2},"cited_work":{"arxiv_id":"2204.02849","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.02849","snapshot_observed_at":"2026-07-03T19:08:50.387530Z","title":"Knn- diffusion: Image generation via large-scale retrieval","venue":null,"work_id":"de1864b6-5643-4e89-9d34-ecfcaaff795d","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2204.02849","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:1ae033071d0fe8977803268882f4c9bcaf1cd9a67b929b65994a4b0570ad806f","observation_id":"0d66d0f9-f879-4097-9484-b421c240e8b2","resolution":{"observed_at":"2026-05-15T01:44:22.822983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:24be2df6a8899b1e968716a2bc4c0c318159d7e9411347c584f9a3a9824032a7","observation_id":"e39b488c-eccd-456b-8281-6d00da678cfc","resolution":{"observed_at":"2026-05-15T01:44:22.825951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D2C: Diffusion-decoding models for few-shot condi- tional generation","venue":null,"work_id":"dd3de003-9dfc-47e1-b7a3-f0620949f169","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:92c7f5a2b55ecbcca50f582d02459acc3be7d9ab7e90031ce19b3233bc0038b0","observation_id":"452e0530-c550-47c2-9f97-19943689359b","resolution":{"observed_at":"2026-05-15T01:44:22.946765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"b0d06a1b-52fa-4d5d-9782-dc1e4b383577","year":2015},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:ec30aee34ec721a8a51228fc93f9fc9563d1c8be4af46aaf2e79c6575534164f","observation_id":"3f9f7ccf-ec3a-4240-b9c6-efbd9771ad43","resolution":{"observed_at":"2026-05-15T01:44:22.950918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"c1088029-6fd7-4a7e-91f2-8b05b9d9672a","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:c8715ffda2787bd133de19809275eee62d08893f0eb7b3473f7253a33c96c5ca","observation_id":"8c80d55c-82f8-4570-865b-fc9202b48725","resolution":{"observed_at":"2026-05-15T01:44:22.955195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":"ccd08afa-80aa-4cac-aa39-e262eb95178d","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:2c13ce928400214bd690b62000061bf75bbc674bda83e7c04651191482a18455","observation_id":"8d08cc49-f07d-4211-92f5-374f0e6c9309","resolution":{"observed_at":"2026-05-15T01:44:22.961417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved techniques for training score-based generative models","venue":null,"work_id":"5be25ae6-8ab7-4ab6-9c66-95b99102c083","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:e6e6fc39b5a6629ae7e46d48fcf7ed0e9c3ca5d57b4912282ebf2fc74bac418a","observation_id":"6b1c8780-4eba-458e-b86a-16f2eeca1bee","resolution":{"observed_at":"2026-05-15T01:44:22.963488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kingma, Ab- hishek Kumar, Stefano Ermon, and Ben Poole","venue":null,"work_id":"a02435fc-bec3-455b-aaf0-b4a25029bd64","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:17345e667a7d725d94dc9144ab6aebea733896a7d6b8f26f1fddec3c15439324","observation_id":"88f112d1-d38d-43fb-8d7f-f0bc2c1fa45c","resolution":{"observed_at":"2026-05-15T01:44:22.968048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dropout: a simple way to prevent neural networks from overﬁtting","venue":null,"work_id":"604a1a94-fcde-415a-b361-278b39699727","year":1929},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:5d8adca2e240829f981d0caa4083e4b6bae71a1891695f728590451517d2461f","observation_id":"5277d88d-ccdf-4e1e-826d-b7a2dd0d7a7c","resolution":{"observed_at":"2026-05-15T01:44:22.970049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The bitter lesson","venue":null,"work_id":"365e887b-96a6-4db2-8f42-1731228f88ec","year":2019},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:3534d246c7b7016ca074d2e4ac4fc5df5dffecf9f45cce96cad98f540e44ac7c","observation_id":"7d90f67b-ba2b-44ce-a3c6-681d7f4cc254","resolution":{"observed_at":"2026-05-15T01:44:22.971860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CSDI: Conditional score-based diffusion models for probabilistic time series imputation","venue":null,"work_id":"5446799e-4bff-4f34-94b3-9082018a4b4c","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:56776cfbc643d1d2d6ecfadbc30d138c444b72eb862f7b22548539861d108f0d","observation_id":"5baae6ff-d428-4d40-8006-e86ca58acf5b","resolution":{"observed_at":"2026-05-15T01:44:22.973881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score-based generative modeling in latent space","venue":null,"work_id":"4f70d95a-9ed3-42af-ac50-f3a4fd5cabdd","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:c7e65f9bd03babc0689ef278fef2c64664a71d33cbe329ed122c1c84e87d84e4","observation_id":"342e8cff-4947-4942-a56d-729c3d89e244","resolution":{"observed_at":"2026-05-15T01:44:22.978808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09477","last_updated":"2023-07-05T12:35:29Z","snapshot_observed_at":"2026-08-06T11:50:28.315748Z","submitted_at":"2022-10-17T23:46:05Z","title":"UniTune: Text-Driven Image Editing by Fine Tuning a Diffusion Model on a Single Image","version":4},"cited_work":{"arxiv_id":"2210.09477","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.09477","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2210.09477 2(3), 5 (2022)","venue":null,"work_id":"6ba11092-4727-411b-81b9-c80548b9509d","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2210.09477","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:c8877c48e9f59ea178206d8d13a3127a7ac14a7fd5cb1cf1a300464fd2063749","observation_id":"a9f7fd8d-4c68-4c9e-b5e3-2e04744c01c3","resolution":{"observed_at":"2026-05-15T01:44:22.829358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A connection between score matching and denoising autoencoders","venue":null,"work_id":"af20a2e9-a8f2-488e-94ca-34c950e0c3d2","year":2011},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:91535deaf6d323f79aab4052e54aa282d2ad0fa4ecf92b5e105a53d04345fc47","observation_id":"9e3f2a95-7845-4716-b4ff-1c05bc9a62a1","resolution":{"observed_at":"2026-05-15T01:44:22.863126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12952","last_updated":"2022-05-25T17:58:26Z","snapshot_observed_at":"2026-08-08T08:58:05.637492Z","submitted_at":"2022-05-25T17:58:26Z","title":"Pretraining is All You Need for Image-to-Image Translation","version":1},"cited_work":{"arxiv_id":"2205.12952","doi":"10.48550/arxiv.2205.12952","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12952","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text- Guided Diffusion Models","venue":"arXiv (Cornell University)","work_id":"b9bf6ab6-d937-4831-b509-86e54cf8755c","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2205.12952","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:f6bfff84630cffa13335513a9896546fc70ac830e9ed3810e11e38054473d465","observation_id":"3760e796-4e4b-47ef-a88c-cce6884e56c7","resolution":{"observed_at":"2026-05-15T01:44:22.832639Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T20:52:26.683882+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T20:52:26.683882+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-ESRGAN: Training real-world blind super-resolution with pure synthetic data","venue":null,"work_id":"913f2841-f406-4545-a761-6dbd613902d9","year":2021},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:0f1b227b7f1b046ae4da99da63617e80640e9f9abca10afab8a7ae42e7bb4907","observation_id":"62778f05-d04d-49d9-8078-489c41f981c6","resolution":{"observed_at":"2026-05-15T01:44:22.871898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dimakis, and Peyman Milanfar","venue":null,"work_id":"9705ea35-6b65-4600-978c-eadfbd1fcfdf","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:13e2b134f13ae84e821666d59244d713e4a071c89db3ea5d7e79139213f19813","observation_id":"152cf2b8-490d-4b6f-b162-0d69e2541fb8","resolution":{"observed_at":"2026-05-15T01:44:22.890857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15611","last_updated":"2022-11-24T04:05:41Z","snapshot_observed_at":"2026-07-06T13:58:22.032846Z","submitted_at":"2022-09-30T17:35:53Z","title":"Protein structure generation via folding diffusion","version":2},"cited_work":{"arxiv_id":"2209.15611","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.15611","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wu, Kevin K","venue":null,"work_id":"0a580209-c170-4a63-ad37-b2c2b83f2f7e","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2209.15611","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:7791ddb5cd88e6dc12d2849e9af1932932a8fe5559dfd310aaed7a1a87ae943a","observation_id":"8cd0fa83-a0e7-493a-9b65-7d4d8154aac7","resolution":{"observed_at":"2026-05-15T01:44:22.835657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GeoDiff: A geometric diffusion model for molecular conformation generation","venue":null,"work_id":"45aadf38-b2ac-41ef-9411-a83e488ac86f","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:7e7cabcca4b21d7b551bf999c511db80802d8f21a7f82abbd04601ecbb15aa66","observation_id":"72a64218-e1bb-4176-99ec-85882330f20e","resolution":{"observed_at":"2026-05-15T01:44:22.921449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09481","last_updated":"2022-12-08T01:18:55Z","snapshot_observed_at":"2026-08-07T11:16:36.992883Z","submitted_at":"2022-03-16T03:52:45Z","title":"Diffusion Probabilistic Modeling for Video Generation","version":5},"cited_work":{"arxiv_id":"2203.09481","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.09481","snapshot_observed_at":"2026-07-01T06:55:28.792743Z","title":"Dif- fusion probabilistic modeling for video generation","venue":null,"work_id":"4f5d4c72-112b-4be1-8434-a59613cb8ca2","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2203.09481","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:9f7cc791f46c833e285d263c514c80c13bb6de4ca76c6ccc84445cd5a5411685","observation_id":"c891f352-0d3b-46b8-ab75-16738006d8c0","resolution":{"observed_at":"2026-05-15T01:44:22.838999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:a91515ddd339cec5dfa79576ba56522dfb4ceed7976954aed346f7bd866563b4","observation_id":"6dd858a3-a606-40fd-bb39-a89b27ce06c4","resolution":{"observed_at":"2026-05-15T01:44:22.842165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LION: Latent point diffusion models for 3D shape generation","venue":null,"work_id":"055967f7-2fb0-4f36-a792-b0c4ad4190b6","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:e9022c7deaa3f6ed0f7323e7db954d4e7fd93a81d68725ac2788e7a695d795bb","observation_id":"4d2f3bcf-a6aa-4f43-8c10-8f0b797880f0","resolution":{"observed_at":"2026-05-15T01:44:22.944745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling vision transformers","venue":null,"work_id":"107d20d3-5037-4c84-8723-66ce55e6db84","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:9a82980f1ee3ffa84ea74f47c836b1d7123cfb451fc683b48b703e2d2c93cb4b","observation_id":"1e7ef7f6-62a5-44a4-b540-44648fa5e924","resolution":{"observed_at":"2026-05-15T01:44:22.853588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.13902","last_updated":"2023-02-25T20:30:35Z","snapshot_observed_at":"2026-08-08T04:44:15.800508Z","submitted_at":"2022-04-29T06:32:38Z","title":"Fast Sampling of Diffusion Models with Exponential Integrator","version":4},"cited_work":{"arxiv_id":"2204.13902","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.13902","snapshot_observed_at":"2026-07-04T15:39:57.095359Z","title":"Fast sampling of diffusion models with exponential integrator.arXiv preprint arXiv:2204.13902","venue":null,"work_id":"1ead7a15-4ec3-4add-968c-6cb18b6ff768","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2204.13902","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:b7d8bd853525e45f93cac043cb1ebd7bc395e70a54fe92e0fa656cd337df4d95","observation_id":"031fa74a-c696-4365-b464-b82d94f367cc","resolution":{"observed_at":"2026-05-15T01:44:22.845483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05564","last_updated":"2023-03-23T11:50:36Z","snapshot_observed_at":"2026-08-01T22:04:45.629414Z","submitted_at":"2022-06-11T16:57:23Z","title":"gDDIM: Generalized denoising diffusion implicit models","version":2},"cited_work":{"arxiv_id":"2206.05564","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.05564","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"gddim: Generalized denoising diffusion implicit models","venue":null,"work_id":"5c25a98a-052d-4a40-9c73-5b9857412a5f","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2206.05564","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:e17cdf14a76824792c247b7d6056345cd48faa13bd7cc8b290e9cda342686f20","observation_id":"3e4bdd47-d64f-4f38-9cce-a3a1f5593f5d","resolution":{"observed_at":"2026-05-15T01:44:22.848754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3D shape generation and completion through point-voxel diffusion","venue":null,"work_id":"09f9314a-a51c-498e-b88e-439638dc9b63","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:ad749e78330b617717e363a24e1c74735746fd36c916fcdffb0a8fe30fb1e777","observation_id":"971c0b62-e323-4609-96c2-58b4c73c26b3","resolution":{"observed_at":"2026-05-15T01:44:22.925422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Network Architecture For our diffusion models, we modify the U-net archi- tecture proposed in Dhariwal et al","venue":null,"work_id":"3b3831f9-9465-486e-be75-9f7b387ababf","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:88832c783dddddd7a38f4d559876dae368893776168088ad2c760737647e3a78","observation_id":"afb422b1-8ad7-47cc-906f-8cc360ff0a23","resolution":{"observed_at":"2026-05-15T01:44:22.938163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Different from Saharia et al","venue":null,"work_id":"e2b6bf9f-ee44-4adf-89ad-56d7daaa5775","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:33a8dd14a8b5b598c833b88dc95ce4dbf97609757df633d8d88a6e2e06c80e48","observation_id":"12ca0ddc-b2df-431a-b2f4-aefd58adc67e","resolution":{"observed_at":"2026-05-15T01:44:22.865436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"[13], we add a cross- attention block to perform cross-attention between im- age embeddings and the conditioning embeddings","venue":null,"work_id":"5768767b-3d1e-4d42-b0ba-90a54f3199fc","year":null},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:97c7b2d60b50376327152478a1c3cecc54a13374897fa18441ad57db23bf09ac","observation_id":"2c0690b6-8a86-410b-bf9c-37c5d8a1c66d","resolution":{"observed_at":"2026-05-15T01:44:22.910752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":11,"parse_uncertain":1,"unresolved":3,"verified_exact":20,"verified_fuzzy":60},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 100 inbound Pith citation observations for arXiv:2211.01324."}