{"as_of":"2026-08-17T00:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e187d76bfe9dd09aee7c6b0cabf221c4e68f08bd97afe841b35876ed39b48080","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:35:35.506601Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.05619/citation-record","integrity":"/paper/2412.05619/integrity","json":"/paper/2412.05619/citation-record.json","paper":"/paper/2412.05619"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-16T16:15:18.101197Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-08-11T20:35:35.170866Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.170866Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:fffaac8c504b5c06f44d4c66dea9fc307773fb3e190458a4f3891aa4b07447c1","observation_id":"db3a6920-fcbc-4a6f-a2c8-c679f3d23b69","resolution":{"observed_at":"2026-08-11T20:35:35.170866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.177165Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.177165Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:abfcfaa65917a77a9b0b2419dc95c6ae41b941d1a959ff5a01d5b3a51180e7c1","observation_id":"5cfbc285-3400-4de8-a09c-fd3450bd1ba7","resolution":{"observed_at":"2026-08-11T20:35:35.177165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.874193Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"e9f2c85b-cc9b-4bc2-be28-68a0f4979dc4","year":2020},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.182726Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:83b6d4daa5a40aaf138fc228ed011a5cb189af258b16cbf47d853bb98f0b6115","observation_id":"0e918aec-f3a5-4939-813e-1ae817d7f511","resolution":{"observed_at":"2026-08-11T20:35:36.880607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.854282Z","title":"Viton-hd: High-resolution virtual try-on via misalignment-aware normalization","venue":null,"work_id":"348934f5-b259-444e-9a54-d078df5b4803","year":2021},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.187902Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:96b85e8654cddaf5c16034fb1f53c5e63d0c717ff5a54075c70916bc2cd2d857","observation_id":"78e2705d-4e39-4de0-bbc3-eab48dccc3ab","resolution":{"observed_at":"2026-08-11T20:35:36.860548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.194037Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.194037Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:646cc0aaae5c8e9105adf460fc29984d174f5396a62e753f6bb6d79850f507df","observation_id":"fa7efd9e-8ddd-40f9-a6c8-062afb7570c6","resolution":{"observed_at":"2026-08-11T20:35:35.194037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.812072Z","title":"Make-a-scene: Scene- based text-to-image generation with human priors","venue":null,"work_id":"038c32a3-de44-442d-9af7-af7617cdb81c","year":null},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.200150Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:6bc5e235b75b5279796bc823e8f4e15fcc2ef1745ab1fa80fce0227ca46a6667","observation_id":"8181d36a-a2cf-47f6-aefc-63c455ff987a","resolution":{"observed_at":"2026-08-11T20:35:36.821511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-11T20:35:35.206891Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.206891Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:828d70ec5986bd14a59beff4d84557e55df8880ac5e081a0c5cbe4ad15aa7b37","observation_id":"1066ad90-e5cc-4fda-bb70-1555ee2d27dc","resolution":{"observed_at":"2026-08-11T20:35:35.206891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15723","last_updated":"2021-06-02T12:41:36Z","snapshot_observed_at":"2026-08-16T18:54:55.170976Z","submitted_at":"2020-12-31T17:21:26Z","title":"Making Pre-trained Language Models Better Few-shot Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15723","snapshot_observed_at":"2026-08-11T20:35:35.214142Z","title":"Making pre- trained language models better few-shot learners","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.214142Z"},"links":{"cited_paper":"/paper/2012.15723","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:cce73d6a1192e0ed346453a70390eeec87044aa7dac9417e153d22ede42fce66","observation_id":"9fc890e7-ec6a-4ad4-af64-cbda6ccdc07a","resolution":{"observed_at":"2026-08-11T20:35:35.214142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18247","last_updated":"2023-05-30T08:54:42Z","snapshot_observed_at":"2026-08-16T15:28:36.315658Z","submitted_at":"2023-05-29T17:11:39Z","title":"TaleCrafter: Interactive Story Visualization with Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18247","snapshot_observed_at":"2026-08-11T20:35:35.220631Z","title":"Talecrafter: Interactive story visualization with multiple characters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.220631Z"},"links":{"cited_paper":"/paper/2305.18247","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:b4b8c5c7f8bdee1576e4a4d50886bbe7f20b614346027c8c5bcca5f3f30ea789","observation_id":"c2db7efc-fb81-4999-a38b-16b74239e343","resolution":{"observed_at":"2026-08-11T20:35:35.220631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.783810Z","title":"Vec- tor quantized diffusion model for text-to-image synthesis","venue":null,"work_id":"95caa81a-ed2a-4e9b-b9b8-3ffea3994356","year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.226937Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:7a633614b7ffc4f6bc001a7a8a3bc5bee58bfac27c219266459d05ea53287bd6","observation_id":"570f3637-1474-4382-adf5-9f924b2a5cac","resolution":{"observed_at":"2026-08-11T20:35:36.791412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.232247Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.232247Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:6e23fd952315bf7a0692663d7fcd7e38a8d3146423e0a4b49ec67ca7df84a431","observation_id":"1eb910d4-1ee0-4777-ad73-90975900b8a9","resolution":{"observed_at":"2026-08-11T20:35:35.232247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.741830Z","title":"Cascaded diffusion models for high fidelity image generation","venue":null,"work_id":"ed80411a-020f-40fb-a386-2f38a33282cc","year":null},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.237708Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:d7628e4abea1ed7d8bd8c7fc2577b48ec38426db2c7b87d4ea4c3f5bce07d7af","observation_id":"8983ecd6-9bc5-4a23-9f8f-4f36bd453748","resolution":{"observed_at":"2026-08-11T20:35:36.749374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.702549Z","title":"Stableviton: Learning semantic correspon- dence with latent diffusion model for virtual try-on","venue":null,"work_id":"5b205201-ba78-4d21-9035-8ab35555ccbb","year":2024},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.242936Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:0901ab5b4eaffb603b6edaa74d9fe185a0cc5bfff8d7f0bc4a6065c7215240c3","observation_id":"6fdd1597-6d2f-419f-99a1-d5d5f746a8e8","resolution":{"observed_at":"2026-08-11T20:35:36.722161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.674500Z","title":"High-resolution virtual try-on with misalignment and occlusion-handled conditions","venue":null,"work_id":"6d73112b-f7b7-4864-9056-7db110154c89","year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.248016Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:857d8f715bfbc377478cb78657f7fe5730846cbc0143d1625933bfaf12a6fce7","observation_id":"c8061cfa-58a6-441f-be25-8f91ee251d19","resolution":{"observed_at":"2026-08-11T20:35:36.681877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.653479Z","title":"Blip-diffusion: Pre- trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":"2d1cde87-8838-4013-8b89-821c0fc793bd","year":2024},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.252837Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:09d4a94202bdcc303e3a31f41f5ed7b0c30ced12ad4b80672103e9124fa93e19","observation_id":"443c4852-c067-4a8c-aedd-70023d53bdc0","resolution":{"observed_at":"2026-08-11T20:35:36.659395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.633001Z","title":"Controlnet++: Improving conditional controls with efficient consistency feedback, 2024","venue":null,"work_id":"59393ee4-ea89-4403-b587-0fc0076e2809","year":2024},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.257664Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:503d8e76994eeb1a221aa35c2a16bf9a0547e6bff79ea5c159bb963aca88e5bb","observation_id":"cc40dc17-c0d6-462a-a6bd-85ff35a889de","resolution":{"observed_at":"2026-08-11T20:35:36.639649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.263266Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.263266Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:6148aa557c34bdd31a67269a444b70eabbc11550167a8f1f4082e118868daaea","observation_id":"dc8c4438-0ff3-4bda-9ddb-222d4ad7fdf9","resolution":{"observed_at":"2026-08-11T20:35:35.263266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00973","last_updated":"2024-03-04T10:53:18Z","snapshot_observed_at":"2026-08-16T15:27:22.588870Z","submitted_at":"2023-06-01T17:58:50Z","title":"Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2306.00973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00973","snapshot_observed_at":"2026-08-11T20:35:35.832238Z","title":"Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models","venue":"cs.CV","work_id":"766cf9f8-4f7b-4dd8-8bb2-bf57f1af7e3d","year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.268470Z"},"links":{"cited_paper":"/paper/2306.00973","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:7765eb878b06ef9d0e43560e76ff67183b37f1f6333347839b0f5c4920df7b83","observation_id":"414b54d1-87c4-4335-9ad9-17a04e92d277","resolution":{"observed_at":"2026-08-11T20:35:35.841274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.591271Z","title":"Open-edit: Open- domain image manipulation with open-vocabulary instruc- tions","venue":null,"work_id":"7cb3ff1d-9056-4611-8a44-48168fbe679d","year":2020},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.274231Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:87511834ec42053239d289b9f262696dd41548c5d2d51725973f4faeeeeff4dc","observation_id":"bd8406eb-4c27-42f8-a811-0df26713b607","resolution":{"observed_at":"2026-08-11T20:35:36.599250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.566507Z","title":"P-tuning: Prompt tuning can be comparable to fine-tuning across scales and tasks","venue":null,"work_id":"41106640-a18f-46f2-abcf-6ba704ebfeeb","year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.279924Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:890a2ef1218de128a942cbe81aa8c3d9729654721a652fadae9ab5600bf6550f","observation_id":"5c0f5fbe-260e-4794-bf51-4e768859cd57","resolution":{"observed_at":"2026-08-11T20:35:36.573846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.544084Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models","venue":null,"work_id":"7518ab14-2084-4488-b92d-f1f97a0986d2","year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.287160Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:8ee552249c0be75f12c1b82d9592905bbe72c3c40813946f632f185cf0299215","observation_id":"490f10b2-03fd-42ec-89ca-b8e29a6470d7","resolution":{"observed_at":"2026-08-11T20:35:36.552194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.517747Z","title":"Peft: State-of-the-art parameter-efficient fine-tuning meth- ods","venue":null,"work_id":"654430ab-e117-4095-b544-2809ee7537e0","year":null},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.292932Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:57e8d7cbecc3fac4bcc2afd0e0b6a00ecf0a91b901b80f07791d94d660048521","observation_id":"2b64e61d-240a-45ea-ad19-e45cd8c3d944","resolution":{"observed_at":"2026-08-11T20:35:36.528109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.299419Z","title":"SDEdit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.299419Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:8791673a5c75f766f811c92c254344b1ed7ff299210b4c2872593c883c3f2e84","observation_id":"dd5935d4-721d-460a-8a42-86ea1840a614","resolution":{"observed_at":"2026-08-11T20:35:35.299419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13501","last_updated":"2023-08-03T13:51:22Z","snapshot_observed_at":"2026-08-16T19:20:26.757900Z","submitted_at":"2023-05-22T21:38:06Z","title":"LaDI-VTON: Latent Diffusion Textual-Inversion Enhanced Virtual Try-On","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13501","snapshot_observed_at":"2026-08-11T20:35:35.306833Z","title":"Ladi-vton: Latent diffusion textual-inversion enhanced virtual try-on","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.306833Z"},"links":{"cited_paper":"/paper/2305.13501","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:a0c42a3fe640569b3ef0be8758009f652ecd108da7c6a337806e75ea5e62c268","observation_id":"e542d542-0413-4290-9c1b-3f4de17638b6","resolution":{"observed_at":"2026-08-11T20:35:35.306833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.312489Z","title":"T2i- adapter: Learning adapters to dig out more controllable abil- ity for text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.312489Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:9b067001cd974492c829fa503405a5b3b052dabaa72183a00ab1b4bab580fc02","observation_id":"cb4f1fd0-2bd1-4fa4-b993-27cf956491cf","resolution":{"observed_at":"2026-08-11T20:35:35.312489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.317462Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.317462Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:5980b92618d3c719f703cb439740dcbd15318ba2f917530839d0020a3d4b07d3","observation_id":"83ce0e42-9717-44bc-9abd-8eebf94655ef","resolution":{"observed_at":"2026-08-11T20:35:35.317462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.440733Z","title":"GLIDE: towards photorealis- tic image generation and editing with text-guided diffusion models","venue":null,"work_id":"e532e151-a4c9-48c9-998d-83f4b7f342da","year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.322891Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:4bc93ab71c7b8751c92aeb9672ae1012912ff958cdd58c3115083afac4d2632e","observation_id":"dcb7ec94-c1ba-4a02-b6bc-371278c7d98b","resolution":{"observed_at":"2026-08-11T20:35:36.447938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.404207Z","title":"Glide: Towards photorealis- tic image generation and editing with text-guided diffusion models","venue":null,"work_id":"56578591-a031-4d4a-a1b3-e8b8ebf8a90e","year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.329447Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:2150b7f3859b3a2d1b6b91781912d1642a0772e6194c423ddf5125996678a9c1","observation_id":"4b30c706-484f-4164-8021-5c7e49977767","resolution":{"observed_at":"2026-08-11T20:35:36.423041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.335010Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.335010Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:c1d9ab059b959cc7139ab18ec984de2fc3fa61f1f68bb7193d1dd4b485b4d0af","observation_id":"a1fdaf0e-362b-467c-839f-14822c612260","resolution":{"observed_at":"2026-08-11T20:35:35.335010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T20:35:35.340357Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.340357Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:432039de1b8ee860130163e498195437f297acaece9cddc6ce0906ddbe65734d","observation_id":"d78d5fda-2843-4b40-b779-a247cf0727d9","resolution":{"observed_at":"2026-08-11T20:35:35.340357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11147","last_updated":"2023-11-02T17:59:06Z","snapshot_observed_at":"2026-08-16T15:31:56.064530Z","submitted_at":"2023-05-18T17:41:34Z","title":"UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11147","snapshot_observed_at":"2026-08-11T20:35:35.345745Z","title":"Unicontrol: A unified diffusion model for controllable visual generation in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.345745Z"},"links":{"cited_paper":"/paper/2305.11147","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:68614ac01bec671529a4878a4a3411f84c4ffdbf08acf7718d8594ca38ad2232","observation_id":"84ee5af5-af2f-4d68-b5d7-1b3afc3d14e4","resolution":{"observed_at":"2026-08-11T20:35:35.345745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.359848Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":"cd8ecad1-9208-4c3f-9db1-58cffb8cb417","year":2019},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.352931Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:d5fb12ec206232c9a5dcfdfa83c71f089cce99578a4986df947e926e875dfc05","observation_id":"28e76c5f-c6c4-4ef3-9c5c-a07e491ca861","resolution":{"observed_at":"2026-08-11T20:35:36.367113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.336877Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"4b451408-38c0-476d-83a3-72ab0ee01482","year":2021},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.359170Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:4549d472abaf04e364400a57bef2f57097c740969b7b34678484422b9f670f20","observation_id":"9c374a86-9f24-49a7-8dcb-1952cd346f73","resolution":{"observed_at":"2026-08-11T20:35:36.342608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.308489Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"0d370589-5a33-424f-8c27-844fa7cbec36","year":2020},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.365296Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:85fbce22716eb42c848ae49427ff63d28ea0bf7bb4cf5bb696eb95ed2356431c","observation_id":"8d3f1035-c9cd-41a3-86b9-7760e14257b5","resolution":{"observed_at":"2026-08-11T20:35:36.314913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.283094Z","title":"Make-a-story: Visual memory conditioned consistent story generation","venue":null,"work_id":"6320415d-d092-477e-be7a-8d091373b9fe","year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.370663Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:da5191e31725300eb4276910d342808213e3fe61b8ae00f92a461a2f26d58129","observation_id":"8717a37c-cea4-4831-adbe-b33510f593be","resolution":{"observed_at":"2026-08-11T20:35:36.291134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.261124Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"1b269dcd-6ded-4453-a250-228ab7dcb971","year":2021},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.376709Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:afa438e717e574e8c9109b53e5a4b8f74699fc7f0e4d010c78103a8a5f90053e","observation_id":"96142e50-8619-4a2b-8c64-5133b4cbdcf8","resolution":{"observed_at":"2026-08-11T20:35:36.269491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T20:35:35.381762Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.381762Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:a35534bfd7c44f1a1cc563666baeef68146c2b9882a1e3d88d33815c002d808d","observation_id":"6e69a5e8-1d97-45bd-b043-c7a153e31105","resolution":{"observed_at":"2026-08-11T20:35:35.381762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.387127Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.387127Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:205d5c8684c2a40ea50d345851936e0745237fa0655053288e7014501ff2d590","observation_id":"3273c662-0101-427d-bd6f-2773284318cc","resolution":{"observed_at":"2026-08-11T20:35:35.387127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.221520Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"653bacc2-aaf9-401d-b837-6ba5bbe6f7a7","year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.392317Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:964b0fd25d4c3deed293b42bc2edda6a5445e16c82f98fc687497d9662858b08","observation_id":"3fb80e19-7a73-4aad-bc22-5ad67d67c169","resolution":{"observed_at":"2026-08-11T20:35:36.229178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-12T12:48:35.419134Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-11T20:35:35.398099Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.398099Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:9cb902e7e28e7ffb8eb6a594ac1413c5cc7c3059a84e8d830b051b45e15d82e9","observation_id":"98b2f119-1d52-4f3e-abce-15a2bc0585fa","resolution":{"observed_at":"2026-08-11T20:35:35.398099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.403032Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.403032Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:6afb2fc3ed08384c4b628976e5b4ac9b800899bc7cd4f8f8ccd3b07d81237361","observation_id":"8c3036b4-42dd-4e0f-946e-cda6a825d48a","resolution":{"observed_at":"2026-08-11T20:35:35.403032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.179441Z","title":"Df-gan: A simple and effective baseline for text-to-image synthesis","venue":null,"work_id":"993f8983-53e7-422d-92b2-2a24224f886f","year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.409532Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:9cd92bb9d71fa7ba2e2cbad65f18f03285d16689350abdadde6d7d5374f9c718","observation_id":"381fbe4e-91bd-45df-aa3d-c735364fdc83","resolution":{"observed_at":"2026-08-11T20:35:36.186465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12959","last_updated":"2023-01-30T14:58:23Z","snapshot_observed_at":"2026-08-16T15:59:09.922767Z","submitted_at":"2023-01-30T14:58:23Z","title":"GALIP: Generative Adversarial CLIPs for Text-to-Image Synthesis","version":1},"cited_work":{"arxiv_id":"2301.12959","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.12959","snapshot_observed_at":"2026-08-11T20:35:35.652871Z","title":"GALIP: Generative Adversarial CLIPs for Text-to-Image Synthesis","venue":"cs.CV","work_id":"1476d152-8397-43cd-afdc-7ac72b8082ec","year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.415709Z"},"links":{"cited_paper":"/paper/2301.12959","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:77f4ba39d7fa457e93f46459dbc75e634f87d6e15427efd553658272fd905903","observation_id":"817ff40c-92d1-4c9a-9966-c94e2b68ccf4","resolution":{"observed_at":"2026-08-11T20:35:35.663300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.155289Z","title":"Storyimager: A unified and efficient frame- work for coherent story visualization and completion","venue":null,"work_id":"d8989e7c-5907-4217-9bd3-7f489edb812a","year":2025},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.422550Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:7b74455f8486af2e92172950b12fe2a066e8d941d2d993c9cadad8b9187a1920","observation_id":"4564569a-9564-414a-8169-afb469f22f5c","resolution":{"observed_at":"2026-08-11T20:35:36.164572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.432201Z","title":"In- context learning unlocked for diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.432201Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:6b1500b5749ac552e2ac207e08ebd75925b2f7e4145c69888feeaeb374612723","observation_id":"b33e32e6-7e3b-41cc-8d51-f424ea37b6ed","resolution":{"observed_at":"2026-08-11T20:35:35.432201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-16T13:17:46.268142Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-11T20:35:35.438936Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.438936Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:02e94b58cfc64a752ceb5fa0a82e6d17a1161794cdd6d486dbbb275d0944385d","observation_id":"b64a9855-fedc-47fb-a139-ab8619124d41","resolution":{"observed_at":"2026-08-11T20:35:35.438936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.114123Z","title":"Gp- vton: Towards general purpose virtual try-on via collabo- rative local-flow global-parsing learning","venue":null,"work_id":"ee135185-4f65-4158-b620-0072ecc93138","year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.444748Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:e7203297afaea2df1e090d3bef57a87ff606986bafe317f6e2b86e6a475ef385","observation_id":"dee15de7-871f-4109-83f6-04de902ec6b2","resolution":{"observed_at":"2026-08-11T20:35:36.121879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.090872Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":"569737ac-4a2c-46b0-a783-0f1d1a2ff623","year":2018},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.451396Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:72c98f1d1d0abfa6ccd06e37b13f75204554d9446a082e8da5406e935f86b7e9","observation_id":"4b820a67-c1a9-4e9d-83fb-60a656345199","resolution":{"observed_at":"2026-08-11T20:35:36.097451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T20:35:35.457387Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.457387Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:fb4e0024533f8efc5afd93af5ec97147d8667d42908836bc03013f4e11d97943","observation_id":"4c1ba89d-9e1c-442b-9053-2add82363d2b","resolution":{"observed_at":"2026-08-11T20:35:35.457387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-14T02:29:38.306439Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-11T20:35:35.465748Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.465748Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:b1834ac0581c1222881292a98fa1a774defe4a21531a150252750d03e8d91446","observation_id":"e9219d00-e942-4ce8-9e40-17ca8ca675a4","resolution":{"observed_at":"2026-08-11T20:35:35.465748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.063044Z","title":"Stack- gan: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":"e967b90d-7e63-4754-8d1a-389ea3a5a200","year":2017},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.473322Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:4d4dfd9611a31236b8582d8114ecee27d11efb6143b912f9ac3cdb1de231a096","observation_id":"4f84cdd9-e027-475d-a1e5-c3d5b68f35c1","resolution":{"observed_at":"2026-08-11T20:35:36.069884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.039980Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"838d1493-bf36-47c9-87a2-7dbd8e78ccc2","year":2024},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.481362Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:7570d789a4734d66d98b3685e6135b566940fa4e3e30956739a47e16c9c9c935","observation_id":"48f422f3-68b0-4d00-9aa5-c962bbaaaf68","resolution":{"observed_at":"2026-08-11T20:35:36.046849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:36.016858Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"b62916cf-ba00-4820-b1d7-528b8ed3aa01","year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.489152Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:f5892c2fdf150f21d316d9bf5159941d1829347f26f294bf243112475b4ea0c0","observation_id":"83d67812-8854-48b8-84b0-cd85c1403254","resolution":{"observed_at":"2026-08-11T20:35:36.023776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.499143Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.499143Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:a6c95479f0a3668ced8be8889cee5682e87bd9e6d6acbfb8ff2f0004a9d861a9","observation_id":"c861ebfe-9976-4840-8d8f-edf2b7528a53","resolution":{"observed_at":"2026-08-11T20:35:35.499143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:35:35.973247Z","title":"Dm- gan: Dynamic memory generative adversarial networks for text-to-image synthesis","venue":null,"work_id":"9ef0f5a1-7c2a-43f7-b125-1248d007a21b","year":2019},"citing_paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:35.506601Z"},"links":{"citing_paper":"/paper/2412.05619"},"observation_digest":"sha256:eecaaa6ea0a48aec121f7e6874d7823693e2567d9fa9b28b8105399b2efae5ba","observation_id":"a02a1900-0cd5-43e2-bef6-0a2eac227f01","resolution":{"observed_at":"2026-08-11T20:35:35.981003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.05619","last_updated":"2024-12-07T11:19:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T19:07:33.207105Z","submitted_at":"2024-12-07T11:19:32Z","title":"Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2412.05619."}