{"as_of":"2026-08-16T15:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2c7bd0c4ac8e24c148d04470b017441d943ac16986b5ce3b50c125d805d6ff3","coverage":[{"denominator":219,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:46:03.070172Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T05:30:32.163273Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T09:34:57.138862Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"cited_work":{"arxiv_id":"2505.05501","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05501","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0b6d39e1-5c52-483a-b5e0-cadeec0ec5c4","year":2025},"citing_paper":{"arxiv_id":"2604.08216","last_updated":"2026-05-18T11:20:22Z","snapshot_observed_at":"2026-07-31T19:05:02.577530Z","submitted_at":"2026-04-09T13:13:53Z","title":"MemCoT: Test-Time Scaling through Memory-Driven Chain-of-Thought","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:46:59.581486Z"},"links":{"cited_paper":"/paper/2505.05501","citing_paper":"/paper/2604.08216"},"observation_digest":"sha256:858768c3705d1ef7ad3d380574cb03c15893fa7b1ed1910e143d954ede6d65c7","observation_id":"f09b4bd0-cc60-4329-b3ee-9ccb02314bf8","resolution":{"observed_at":"2026-05-11T06:10:59.092148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"cited_work":{"arxiv_id":"2505.05501","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05501","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0b6d39e1-5c52-483a-b5e0-cadeec0ec5c4","year":2025},"citing_paper":{"arxiv_id":"2604.08216","last_updated":"2026-05-18T11:20:22Z","snapshot_observed_at":"2026-07-31T19:05:02.577530Z","submitted_at":"2026-04-09T13:13:53Z","title":"MemCoT: Test-Time Scaling through Memory-Driven Chain-of-Thought","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T09:34:16.292323Z"},"links":{"cited_paper":"/paper/2505.05501","citing_paper":"/paper/2604.08216"},"observation_digest":"sha256:eff663f7247b47f1e7c29300e750c8f19bc62eb9d21856119d7cc7e1699ab3d5","observation_id":"2727aeba-fb0f-4b09-af38-c50b6465e54c","resolution":{"observed_at":"2026-05-21T09:34:57.141773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05501","snapshot_observed_at":"2026-07-12T05:30:32.163273Z","title":"Preliminary explorations with GPT-4o(mni) native image generation.arXiv preprint arXiv:2505.05501, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03006","last_updated":"2026-07-03T06:39:56Z","snapshot_observed_at":"2026-08-13T19:25:15.693203Z","submitted_at":"2026-07-03T06:39:56Z","title":"PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T05:30:32.163273Z"},"links":{"cited_paper":"/paper/2505.05501","citing_paper":"/paper/2607.03006"},"observation_digest":"sha256:3898864d373bb1ec4ef67bf550fd48a7091c70dcb43e7be5fd9c35e5617c83eb","observation_id":"92c38713-8390-44c4-b780-4939cd4b66a9","resolution":{"observed_at":"2026-07-12T05:30:32.163273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.05501/citation-record","integrity":"/paper/2505.05501/integrity","json":"/paper/2505.05501/citation-record.json","paper":"/paper/2505.05501"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.638890Z","title":"Defocus deblurring using dual-pixel data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.638890Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:b685bed3215af251e892812be590d86d602a222bdb04f3597ac1037dab3e25c8","observation_id":"c2f74821-6a5a-413a-b5c7-9576da5ff7dc","resolution":{"observed_at":"2026-08-15T23:46:02.638890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.644112Z","title":"Learning to reduce defocus blur by realistically modeling dual-pixel data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.644112Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:198c8e177d08d4cc805eb9074423ec692da91666905ca2a5854ef7705af5589e","observation_id":"329d17a9-d9db-4cc5-ae02-d9f49f503222","resolution":{"observed_at":"2026-08-15T23:46:02.644112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.648456Z","title":"Ntire 2017 challenge on single image super-resolution: Dataset and study","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.648456Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:c83c20c373854bc03519704cac0e44fea665b73a38b8c03af2d5d3d4cf0710fb","observation_id":"00c433ad-b03b-4ad2-a622-27d6839b8735","resolution":{"observed_at":"2026-08-15T23:46:02.648456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.652848Z","title":"Dream360: Diverse and immersive outdoor virtual scene creation via transformer-based 360 image outpainting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.652848Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:6f0200068c2d903517384df276cc64fa6257a8c90836c27ed67deb9ad2cbf180","observation_id":"3aaddf03-7b7d-43ff-80ed-c46a7c64207d","resolution":{"observed_at":"2026-08-15T23:46:02.652848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.657073Z","title":"Single-image reflection removal using deep learning: a systematic review","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.657073Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:a44df67f37090f1ad82426621666d5b7c65dd031709161aea4771bdb84bea0db","observation_id":"edf06fe7-0192-412e-9f88-721dccf7e23d","resolution":{"observed_at":"2026-08-15T23:46:02.657073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.661347Z","title":"2d human pose esti- mation: New benchmark and state of the art analysis","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.661347Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:1d9751888f7eb04e42c9ae8d31315b8fc676b63bac23d73b4970f421f033c2f6","observation_id":"c13648ec-b1fb-479e-bdc2-850edac22983","resolution":{"observed_at":"2026-08-15T23:46:02.661347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.666252Z","title":"Change detection techniques for remote sensing applications: A survey","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.666252Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:b44e20b84fbd767d241c5a736562c435599e6aac74171b7e2cd06af322c28865","observation_id":"7ac9330b-c9ed-4d16-ac33-65b32d158f4d","resolution":{"observed_at":"2026-08-15T23:46:02.666252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.670557Z","title":"Rethinking inductive biases for surface normal estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.670557Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:6b4366786dbfdf59b01ebda44e5e1613f3a3348ee84aa6f13b3ceaf3b871f8d1","observation_id":"3ae4da77-3dd8-433d-b42d-94571df53b03","resolution":{"observed_at":"2026-08-15T23:46:02.670557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-08-14T15:56:28.920461Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-15T23:46:02.674974Z","title":"ediffi: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.674974Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:482a0e193cb1bc00d4ab31a08da5473eab03cba9eddaca19b4a90ca80d8de868","observation_id":"030a4bb0-bb52-4a85-a8a4-eb7fd7198e7b","resolution":{"observed_at":"2026-08-15T23:46:02.674974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08914","last_updated":"2025-06-25T17:32:22Z","snapshot_observed_at":"2026-08-16T12:59:08.277138Z","submitted_at":"2025-02-13T03:05:42Z","title":"Diffusion Models Through a Global Lens: Are They Culturally Inclusive?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08914","snapshot_observed_at":"2026-08-15T23:46:02.679724Z","title":"Diffusion models through a global lens: Are they culturally inclusive? arXiv preprint arXiv:2502.08914, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.679724Z"},"links":{"cited_paper":"/paper/2502.08914","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:2761b7914ea1f12d5a1c1b338b743a169cd2685a1a2ce4124930c3ec669964a9","observation_id":"d0518307-9150-49df-a996-025b8665ed12","resolution":{"observed_at":"2026-08-15T23:46:02.679724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.684520Z","title":"Adabins: Depth estimation using adaptive bins","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.684520Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:769d77ce441bfe21285819b887a5a4de6de4a199ed265e88e209fa73ee80d4de","observation_id":"dd4f7c4f-44d3-44d5-844a-01e6252cd2f6","resolution":{"observed_at":"2026-08-15T23:46:02.684520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.688621Z","title":"Ledits++: Limitless image editing using text-to- image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.688621Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:320cbaaeadd8f267adf42d68b8261fda87534334c68ad9df337dadf4bfaf6c62","observation_id":"d20c8806-8848-479d-becf-562849163015","resolution":{"observed_at":"2026-08-15T23:46:02.688621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.692633Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.692633Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:c1e359722c91a8090dcef57842865ecd2d3378cecf680994c03909c59e61c270","observation_id":"1099dc0d-9e68-429b-bead-154f303e1082","resolution":{"observed_at":"2026-08-15T23:46:02.692633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.696479Z","title":"Learning to generate realistic noisy images via pixel-level noise-aware adversarial training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.696479Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:366256695b8b8f01550da9d54576d20a17618566fab6dffe838143054abda39e","observation_id":"18e18725-8c52-4fe0-9862-9367d3146fb8","resolution":{"observed_at":"2026-08-15T23:46:02.696479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11826","last_updated":"2023-12-19T03:32:10Z","snapshot_observed_at":"2026-08-16T14:33:32.674398Z","submitted_at":"2023-12-19T03:32:10Z","title":"Decoupled Textual Embeddings for Customized Image Generation","version":1},"cited_work":{"arxiv_id":"2312.11826","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.11826","snapshot_observed_at":"2026-08-15T23:46:04.914033Z","title":"Decoupled Textual Embeddings for Customized Image Generation","venue":"cs.CV","work_id":"87e39fbf-2d96-4442-9ce4-57f817ff30dc","year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.700930Z"},"links":{"cited_paper":"/paper/2312.11826","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:91041f9cc09de8d58e66eebab7230ef53b5e75c11b97906aafe9779d20c7ea34","observation_id":"79f1762c-f203-41b7-b1d1-344874892682","resolution":{"observed_at":"2026-08-15T23:46:04.918935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.705414Z","title":"Controllable generation with text-to-image diffusion models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.705414Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:4f1fe6c5ef916fe8b4f861445d699228a42fc0295914fa9125cdd77a8c70bb99","observation_id":"1dd26251-8747-4f02-b62e-4449266e6874","resolution":{"observed_at":"2026-08-15T23:46:02.705414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.709903Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.709903Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:e27c75f08d1f959f74a243c9b558a9e778d4891762ece1c8654f0660821f5ff7","observation_id":"a28b3082-2557-4e4f-a468-60d249ca8477","resolution":{"observed_at":"2026-08-15T23:46:02.709903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.714366Z","title":"Generative novel view synthesis with 3d-aware diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.714366Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:ab42b8664243998484ffc3729654b1d3a149c4ebe1b6a6b7d3c9431e702febf5","observation_id":"fde5357f-4cf0-474c-a43b-7b0ad7bacbd5","resolution":{"observed_at":"2026-08-15T23:46:02.714366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.718644Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.718644Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:7f8df0dcf51d71797b0e05f6aa90ba43084b6b5c2c851d1af40e100c24d1b17f","observation_id":"adf74f5c-5fb7-462f-915c-658c64b779ec","resolution":{"observed_at":"2026-08-15T23:46:02.718644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02109","last_updated":"2024-03-26T12:28:02Z","snapshot_observed_at":"2026-08-16T14:37:46.053165Z","submitted_at":"2023-12-04T18:39:00Z","title":"ArtAdapter: Text-to-Image Style Transfer using Multi-Level Style Encoder and Explicit Adaptation","version":2},"cited_work":{"arxiv_id":"2312.02109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.02109","snapshot_observed_at":"2026-08-15T23:46:04.827379Z","title":"ArtAdapter: Text-to-Image Style Transfer using Multi-Level Style Encoder and Explicit Adaptation","venue":"cs.CV","work_id":"58d81fd5-0041-472d-b293-2a86835706a2","year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.722900Z"},"links":{"cited_paper":"/paper/2312.02109","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:07493a30a42b8ccdc1675900f9a462dbf3d2ae9f3cf37df8d5d66725009307d3","observation_id":"73c824a5-04fa-4b49-9113-54dc16c64d83","resolution":{"observed_at":"2026-08-15T23:46:04.832209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03374","last_updated":"2024-02-27T02:45:34Z","snapshot_observed_at":"2026-08-16T13:50:47.715494Z","submitted_at":"2023-05-05T09:08:25Z","title":"DisenBooth: Identity-Preserving Disentangled Tuning for Subject-Driven Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03374","snapshot_observed_at":"2026-08-15T23:46:02.727261Z","title":"Disen- booth: Disentangled parameter-efficient tuning for subject-driven text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.727261Z"},"links":{"cited_paper":"/paper/2305.03374","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:5b1223b1d38ab5e57bff445bba7bb8b5ff84909b43ae4000e1ca5a4801c3b9f5","observation_id":"ad939b62-f772-4283-b493-c7287b43361b","resolution":{"observed_at":"2026-08-15T23:46:02.727261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16465","last_updated":"2023-11-28T04:02:40Z","snapshot_observed_at":"2026-08-16T14:39:47.866845Z","submitted_at":"2023-11-28T04:02:40Z","title":"TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16465","snapshot_observed_at":"2026-08-15T23:46:02.731711Z","title":"Textdiffuser-2: Unleashing the power of language models for text rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.731711Z"},"links":{"cited_paper":"/paper/2311.16465","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:18452a7be9ffd1ea87aa58aecc237daef4b5c8a926f98017960c280a338fd556","observation_id":"59912438-66d6-4ff5-bb62-79e632c62f3d","resolution":{"observed_at":"2026-08-15T23:46:02.731711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10855","last_updated":"2023-10-30T06:33:01Z","snapshot_observed_at":"2026-08-13T11:39:36.864128Z","submitted_at":"2023-05-18T10:16:19Z","title":"TextDiffuser: Diffusion Models as Text Painters","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10855","snapshot_observed_at":"2026-08-15T23:46:02.736690Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.736690Z"},"links":{"cited_paper":"/paper/2305.10855","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:ad7c8a3f0046369d70243552ebbbc429f393d1b5b978d0dfe14807757be3374a","observation_id":"37680e1e-3a6c-4d2b-b740-7fd746b94214","resolution":{"observed_at":"2026-08-15T23:46:02.736690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.7062","last_updated":"2016-06-07T04:00:08Z","snapshot_observed_at":"2026-08-14T23:06:27.726818Z","submitted_at":"2014-12-22T17:18:33Z","title":"Semantic Image Segmentation with Deep Convolutional Nets and Fully Connected CRFs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.7062","snapshot_observed_at":"2026-08-15T23:46:02.741344Z","title":"Semantic image segmentation with deep convolutional nets and fully connected crfs","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.741344Z"},"links":{"cited_paper":"/paper/1412.7062","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:06a9d872a592967c4ca288b4360c621c285c924a5a37ac2c7129c29cd097d71d","observation_id":"d264e7f9-0cd0-4d58-bffa-56c9768eb36f","resolution":{"observed_at":"2026-08-15T23:46:02.741344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05979","last_updated":"2025-04-10T18:02:00Z","snapshot_observed_at":"2026-08-16T12:43:02.129478Z","submitted_at":"2025-04-08T12:34:36Z","title":"An Empirical Study of GPT-4o Image Generation Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05979","snapshot_observed_at":"2026-08-15T23:46:02.746041Z","title":"An empirical study of gpt-4o image generation capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.746041Z"},"links":{"cited_paper":"/paper/2504.05979","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:5382ee44a472a463bdd3bd5fccda0aacc404adc8901441b2fab7d508739917d7","observation_id":"144adc4e-f03e-4738-885a-6ecade1076d2","resolution":{"observed_at":"2026-08-15T23:46:02.746041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19303","last_updated":"2024-12-26T17:52:19Z","snapshot_observed_at":"2026-08-11T23:01:11.356357Z","submitted_at":"2024-12-26T17:52:19Z","title":"Manga Generation via Layout-controllable Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19303","snapshot_observed_at":"2026-08-15T23:46:02.750697Z","title":"Manga generation via layout-controllable diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.750697Z"},"links":{"cited_paper":"/paper/2412.19303","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:66ef3384d4397298869fb2f62481c74868f3fb853e79d4c2b8fed623278971f6","observation_id":"ad71bfe2-44f0-49f3-8971-e9aa8831e946","resolution":{"observed_at":"2026-08-15T23:46:02.750697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.755132Z","title":"All snow removed: Single image desnowing algorithm using hierarchical dual-tree complex wavelet representation and contradict channel loss","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.755132Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:5d7d77b3f2d95bca7a2db083577e17db27326e0e10752029d209f6cf233dff5b","observation_id":"1bf12b18-de75-432b-b3ff-dac921afb197","resolution":{"observed_at":"2026-08-15T23:46:02.755132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00300","last_updated":"2023-07-01T11:01:17Z","snapshot_observed_at":"2026-08-16T06:23:11.699281Z","submitted_at":"2023-07-01T11:01:17Z","title":"DreamIdentity: Improved Editability for Efficient Face-identity Preserved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00300","snapshot_observed_at":"2026-08-15T23:46:02.759651Z","title":"Dreamidentity: Improved editability for efficient face-identity preserved image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.759651Z"},"links":{"cited_paper":"/paper/2307.00300","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:3d1782a1185b5fea979d97a5700e592cd6e27e237854036e3d523e5201650061","observation_id":"0e070bc9-c686-4a74-990b-ba419fdfd1d0","resolution":{"observed_at":"2026-08-15T23:46:02.759651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-15T23:46:02.764185Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.764185Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:48eb9b8a2f68310052ab9ac8becd683f8e10986115898237e40abfb7b9562f36","observation_id":"771d326f-3b91-491c-8196-7d2d99db9355","resolution":{"observed_at":"2026-08-15T23:46:02.764185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.768725Z","title":"Snow mask guided adaptive residual network for image snow removal","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.768725Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:04f88d32ae39505de4c1612e54ef9f03da433b170457bb7b45af3f091fe47d13","observation_id":"c0a62679-c050-4b44-aeb2-565d6e1f5ac8","resolution":{"observed_at":"2026-08-15T23:46:02.768725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.773805Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.773805Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:1b142df48c31c771d8460432e8e5aa1e6d56586d8322b3c9da002b9006b3b666","observation_id":"81906c70-4c57-4731-9167-1584c2f88e7c","resolution":{"observed_at":"2026-08-15T23:46:02.773805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.778216Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.778216Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:2f5aac03e218389d8b0b8f8d538e649f980ebe27743e4f9ca7b9e00e8bab23a5","observation_id":"fb144973-a305-4ff1-9e7b-53ed587bd2a9","resolution":{"observed_at":"2026-08-15T23:46:02.778216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.782665Z","title":"Object counting and instance segmentation with image-level supervision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.782665Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:2ca977097c5ca37d347d39e990a504e1c14832a98edbc74f0dec656a5b5b8782","observation_id":"aa57dda6-cfb8-4972-822e-7452d1676e04","resolution":{"observed_at":"2026-08-15T23:46:02.782665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.787222Z","title":"Generating diverse agricultural data for vision-based farming applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.787222Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:ce4fd063b498a8904b7778683894a81d3173a2f453a3b3c4c7ca86674c799eaa","observation_id":"efb880de-d4ed-4f27-a38b-dd511d5a384e","resolution":{"observed_at":"2026-08-15T23:46:02.787222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.791409Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.791409Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:58241d6486e4589bb76d55d81c0eabef5459be90d6502ab57d1fe2672dbe7c09","observation_id":"842a30dc-5498-40c7-a371-30b5d1dfa2e1","resolution":{"observed_at":"2026-08-15T23:46:02.791409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.795343Z","title":"Latentpaint: Image inpainting in latent space with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.795343Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:7a712eca4da63eae2e3fb7903bec46b769d8747013032c62b0f8ea330e63e840","observation_id":"9dc81256-0f63-4a7c-974e-cb0e54898864","resolution":{"observed_at":"2026-08-15T23:46:02.795343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.799583Z","title":"Deep learning based 2d human pose estimation: A survey","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.799583Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:10fb979001e39899547277f92e83b0ddfaac525bf1713929afef6f7b3208ae6c","observation_id":"35d55de4-b92f-443f-b11b-34312494d835","resolution":{"observed_at":"2026-08-15T23:46:02.799583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.803714Z","title":"3d-aware conditional image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.803714Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:57bfc45db9a2c119bf8706380a569ef775bc53ee55522cbfdd58d3fa0775aada","observation_id":"c94acfc6-3603-4f26-b205-f1706bac0966","resolution":{"observed_at":"2026-08-15T23:46:02.803714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.808389Z","title":"Towards intelligent design: A self-driven framework for collocated clothing synthesis leveraging fashion styles and textures","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.808389Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:9c2fba0fe94d2c795573e7b3b69582da10ba715e0f0b4fee456c397331e47256","observation_id":"f1049d54-fde6-4363-9609-7d23088a7cec","resolution":{"observed_at":"2026-08-15T23:46:02.808389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11337","last_updated":"2025-01-30T15:13:01Z","snapshot_observed_at":"2026-08-15T12:28:29.108023Z","submitted_at":"2022-11-21T10:37:56Z","title":"DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11337","snapshot_observed_at":"2026-08-15T23:46:02.812799Z","title":"Dreamartist: Towards controllable one-shot text-to- image generation via contrastive prompt-tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.812799Z"},"links":{"cited_paper":"/paper/2211.11337","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:381caaa7881d591d07cc2b62bd13b3d8ea8b160da4a5cc974a807aa855d93766","observation_id":"b9e021c8-a6b4-42b7-9377-b0e7818556dd","resolution":{"observed_at":"2026-08-15T23:46:02.812799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.817421Z","title":"Discovering novel biological traits from images using phylogeny-guided neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.817421Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:7f410b3d85d429b521cc72a554befa224bd2896551bc7237cd811f05a30f9693","observation_id":"cc8644ff-a1cf-45ff-b6d1-c9264d3d3e35","resolution":{"observed_at":"2026-08-15T23:46:02.817421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.821802Z","title":"Everingham, L","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.821802Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:27a64a4210a39677f6edddcd439819cf1e1e663c2739a347e0d98f99219eed0e","observation_id":"3b902b97-9c4c-4c7b-9c9c-1dcb46892af8","resolution":{"observed_at":"2026-08-15T23:46:02.821802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.825899Z","title":"Everingham, L","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.825899Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:358acd68f88ef2d44e3cdf49923dfa68920098ae95a0ad5c609551da7d6d37a1","observation_id":"795e3154-f504-4469-86ce-559b3197ed52","resolution":{"observed_at":"2026-08-15T23:46:02.825899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17102","last_updated":"2024-02-05T05:04:53Z","snapshot_observed_at":"2026-08-16T14:56:35.056764Z","submitted_at":"2023-09-29T10:01:50Z","title":"Guiding Instruction-based Image Editing via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17102","snapshot_observed_at":"2026-08-15T23:46:02.830158Z","title":"Guid- ing instruction-based image editing via multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.830158Z"},"links":{"cited_paper":"/paper/2309.17102","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:91f1b89fb8684a0b7c7e889fe01bae587fb70baacec22310da79828e14614e58","observation_id":"cfea3f1b-a514-4cd3-814a-cfaa7b5a2dd8","resolution":{"observed_at":"2026-08-15T23:46:02.830158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-15T23:46:02.834485Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.834485Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:870a3e402c8d282d005e96b78a9e19274b8033cff85fa7d9505bf159a61dd562","observation_id":"3579c4b0-bea9-41da-a16e-4b22a62178bc","resolution":{"observed_at":"2026-08-15T23:46:02.834485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15235","last_updated":"2024-05-07T16:32:18Z","snapshot_observed_at":"2026-08-16T14:24:06.254061Z","submitted_at":"2024-01-26T22:59:51Z","title":"CascadedGaze: Efficiency in Global Context Extraction for Image Restoration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15235","snapshot_observed_at":"2026-08-15T23:46:02.838880Z","title":"Cascadedgaze: Efficiency in global context extraction for image restoration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.838880Z"},"links":{"cited_paper":"/paper/2401.15235","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:d5302b0228ea192fb12c9f244dc1fb923e87b008df03ce442b4fde3ee73805fc","observation_id":"7d6494be-079c-44b0-af90-c7f83bcdd069","resolution":{"observed_at":"2026-08-15T23:46:02.838880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.843410Z","title":"Fast r-cnn","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.843410Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:823c231f636be55b91689516a96bbed62c64a1c6fb268ae2ba8c2dfbab09ab4c","observation_id":"038a5edf-4984-4878-aae7-9146e0f93afe","resolution":{"observed_at":"2026-08-15T23:46:02.843410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.847545Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.847545Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:eaa01b30f8f528ab44431df8a89c4ce24f0fc17942740f111911ddb3620ea075","observation_id":"44601787-8338-494b-bfa9-f15a2d3eff96","resolution":{"observed_at":"2026-08-15T23:46:02.847545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.851631Z","title":"Talecrafter: Interactive story visualization with multiple characters, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.851631Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:47e80feced086183562a745b94c80817d318c07dc27c6eebe07b6110f4477386","observation_id":"f1bfd7b5-69d9-495f-abe3-3c61337ed373","resolution":{"observed_at":"2026-08-15T23:46:02.851631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08159","last_updated":"2025-01-23T17:08:57Z","snapshot_observed_at":"2026-08-16T13:10:36.203586Z","submitted_at":"2024-10-10T17:41:54Z","title":"DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08159","snapshot_observed_at":"2026-08-15T23:46:02.855641Z","title":"Dart: Denoising autoregressive transformer for scalable text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.855641Z"},"links":{"cited_paper":"/paper/2410.08159","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:72c08d001704de06d50b89dca975fda283bf596ffc64aaa9108cad56514b16d6","observation_id":"27b339b5-6703-467f-8f51-62bbc13b7210","resolution":{"observed_at":"2026-08-15T23:46:02.855641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12764","last_updated":"2023-05-18T22:30:48Z","snapshot_observed_at":"2026-08-16T15:12:37.895513Z","submitted_at":"2023-02-24T17:28:08Z","title":"Modulating Pretrained Diffusion Models for Multimodal Image Synthesis","version":2},"cited_work":{"arxiv_id":"2302.12764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.12764","snapshot_observed_at":"2026-08-15T23:46:04.624328Z","title":"Modulating Pretrained Diffusion Models for Multimodal Image Synthesis","venue":"cs.CV","work_id":"dad16e08-32b6-47f2-8890-7ce9a6f1a48c","year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.860484Z"},"links":{"cited_paper":"/paper/2302.12764","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:f2e6a80b56279327e3411ef9996db05f9fb605990092e031dc6cf3f6a5606c53","observation_id":"719a037f-9686-4e88-a9f5-1b7e6a4fe024","resolution":{"observed_at":"2026-08-15T23:46:04.628774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04431","last_updated":"2025-06-17T15:32:20Z","snapshot_observed_at":"2026-08-15T00:31:45.808844Z","submitted_at":"2024-12-05T18:53:02Z","title":"Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04431","snapshot_observed_at":"2026-08-15T23:46:02.864916Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.864916Z"},"links":{"cited_paper":"/paper/2412.04431","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:452c9030196dfa28a1a99974cda0cc2b8dadd7465238bdf1217172bbe2fe51da","observation_id":"da1b9c2a-45b8-49c6-920b-b19e59bd6b0c","resolution":{"observed_at":"2026-08-15T23:46:02.864916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.869304Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.869304Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:27aad224fe5e4f5107591c6643145279b5bfe56b75290e056ad2c4a328cb4e8d","observation_id":"530f8f8b-2a42-4e3a-af28-5c699994804b","resolution":{"observed_at":"2026-08-15T23:46:02.869304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.873445Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.873445Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:9fcf610918da42a391798e0b70950e524ac1d6b7c2b9cfd57e06c8c9b72e4c25","observation_id":"c14053b7-d2c7-4b55-8457-9cce2b8d67ad","resolution":{"observed_at":"2026-08-15T23:46:02.873445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.877554Z","title":"Dreamstory: Open-domain story visualization by llm-guided multi-subject consistent diffusion, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.877554Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:c37e3c6faf7b0ca1fd482a205ad0f3e7b9fc71f400f4f515957530f1cd7fa37c","observation_id":"1785a553-6d7c-464b-85fc-eb57d11e5020","resolution":{"observed_at":"2026-08-15T23:46:02.877554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.881449Z","title":"Styleposegan: Pose-consistent virtual try-on via pose-guided style transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.881449Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:f92b14371419d1f95435102732777788de48e163e67c7138e60b249416c6a793","observation_id":"37d306bd-4176-4657-add1-b92b5857256c","resolution":{"observed_at":"2026-08-15T23:46:02.881449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.885537Z","title":"Dresscode: Au- toregressively sewing and generating garments from text guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.885537Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:fbe09afe87500074427844c6bb3f49b27cabd1e3a13745dcbe259a5c06a98189","observation_id":"27fc4bf7-d9d2-4bfb-b952-2f079060611c","resolution":{"observed_at":"2026-08-15T23:46:02.885537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03505","last_updated":"2024-11-05T20:42:23Z","snapshot_observed_at":"2026-08-16T13:02:37.667640Z","submitted_at":"2024-11-05T20:42:23Z","title":"SynthSet: Generative Diffusion Model for Semantic Segmentation in Precision Agriculture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03505","snapshot_observed_at":"2026-08-15T23:46:02.889670Z","title":"Synthset: Gen- erative diffusion model for semantic segmentation in precision agriculture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.889670Z"},"links":{"cited_paper":"/paper/2411.03505","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:20597ef93c548b194c878207fa001aabd025b981b4781dc7d2238c147f3535e6","observation_id":"3b483f99-2dc4-4887-bb4f-0d86f3b9a311","resolution":{"observed_at":"2026-08-15T23:46:02.889670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00964","last_updated":"2023-06-01T17:55:32Z","snapshot_observed_at":"2026-08-13T11:26:59.436062Z","submitted_at":"2023-06-01T17:55:32Z","title":"Cocktail: Mixing Multi-Modality Controls for Text-Conditional Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00964","snapshot_observed_at":"2026-08-15T23:46:02.893977Z","title":"Cocktail: Mixing multi-modality controls for text-conditional image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.893977Z"},"links":{"cited_paper":"/paper/2306.00964","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:575505547c15f1bec4cf6d1505d8a1adfea96c7799cc9533755c0ec177b7733e","observation_id":"c3b79798-25d7-44b9-b6a9-eb4f08b76709","resolution":{"observed_at":"2026-08-15T23:46:02.893977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-08-16T13:14:48.648849Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-08-15T23:46:02.898202Z","title":"Com- poser: Creative and controllable image synthesis with composable conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.898202Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:ac4548c954c56965ddc735ec6a11ddb96fd9e49dc1d7a64c5810f4a703b75728","observation_id":"9cb529da-72ca-48b1-8cae-28ce021f1691","resolution":{"observed_at":"2026-08-15T23:46:02.898202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15841","last_updated":"2024-05-10T08:01:10Z","snapshot_observed_at":"2026-08-16T14:40:03.533050Z","submitted_at":"2023-11-27T14:07:13Z","title":"Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation","version":5},"cited_work":{"arxiv_id":"2311.15841","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15841","snapshot_observed_at":"2026-08-15T23:46:04.550873Z","title":"Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation","venue":"cs.CV","work_id":"f117bde1-5c56-4d3b-8c7f-915f7870ad74","year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.902399Z"},"links":{"cited_paper":"/paper/2311.15841","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:68c19dbef73a6260773ec5e16dcd8057916840fe0facf4f4ea88427a24096916","observation_id":"f996091a-1cd1-40ce-96fb-96f203d1ad48","resolution":{"observed_at":"2026-08-15T23:46:04.555542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09039","last_updated":"2024-08-28T14:49:26Z","snapshot_observed_at":"2026-08-16T13:23:11.117715Z","submitted_at":"2024-08-28T14:49:26Z","title":"AutoGeo: Automating Geometric Image Dataset Creation for Enhanced Geometry Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09039","snapshot_observed_at":"2026-08-15T23:46:02.906527Z","title":"Autogeo: Automating geometric image dataset creation for enhanced geometry understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.906527Z"},"links":{"cited_paper":"/paper/2409.09039","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:59717d9ca78a4c9caafb34f3c086945e4f0f8ad2a40f409b3bca8a7db77f962b","observation_id":"0659121a-ae89-4980-a33c-7b0621a351bb","resolution":{"observed_at":"2026-08-15T23:46:02.906527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13495","last_updated":"2024-12-01T14:04:22Z","snapshot_observed_at":"2026-08-13T12:18:12.541769Z","submitted_at":"2023-03-23T17:56:10Z","title":"ReVersion: Diffusion-Based Relation Inversion from Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13495","snapshot_observed_at":"2026-08-15T23:46:02.910917Z","title":"Reversion: Diffusion-based relation inversion from images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.910917Z"},"links":{"cited_paper":"/paper/2303.13495","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:5772979f4fed60061e6de258f38950f41acb0673a1bf1e095849a2fc86dc549f","observation_id":"da0625f8-2d9a-43a4-bd93-3b8c12fade59","resolution":{"observed_at":"2026-08-15T23:46:02.910917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.916052Z","title":"Liteflownet: A lightweight convolutional neural network for optical flow estimation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.916052Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:13212e568528b825222b83c3a541aa021ec6082fb9688e86de6654a01c7f0caf","observation_id":"8f837654-7f41-417b-a035-eea6134b0574","resolution":{"observed_at":"2026-08-15T23:46:02.916052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.920065Z","title":"Vision transformer in industrial visual inspection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.920065Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:c85d2dad2577b7a1186791afa41737de254752b635a8e047c8557f3d874e6db8","observation_id":"f9e57c1f-b25e-47a8-be60-48d7052a8e4c","resolution":{"observed_at":"2026-08-15T23:46:02.920065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.924276Z","title":"Flownet 2.0: Evolution of optical flow estimation with deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.924276Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:357bcb1ff9eec00c442274745ccda7807fcd92af2efffed0366d6bb448247344","observation_id":"63a02054-893f-420e-a2da-d9a46e4bf82a","resolution":{"observed_at":"2026-08-15T23:46:02.924276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.928240Z","title":"Desnowgan: An efficient single image snow removal framework using cross-resolution lateral connection and gans","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.928240Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:b7546369f0e3072617ea383ebcaa6b21d28264202156fee27a4bd4599ffa8816","observation_id":"5c9a6014-9305-4151-b7aa-9856591d1143","resolution":{"observed_at":"2026-08-15T23:46:02.928240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.932328Z","title":"Remote sensing change detection in urban environments","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.932328Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:0f5fa2029b65054f6cd86f10ad0a887e695fa293c9deea6182c40e1ea8cae538","observation_id":"bf5fb43c-4d2b-4f47-9e21-a10750de7164","resolution":{"observed_at":"2026-08-15T23:46:02.932328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16902","last_updated":"2025-05-17T07:34:44Z","snapshot_observed_at":"2026-08-16T12:55:50.310605Z","submitted_at":"2025-02-24T06:56:56Z","title":"Culture-TRIP: Culturally-Aware Text-to-Image Generation with Iterative Prompt Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16902","snapshot_observed_at":"2026-08-15T23:46:02.936502Z","title":"Culture-trip: Culturally-aware text-to-image generation with iterative prompt refinment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.936502Z"},"links":{"cited_paper":"/paper/2502.16902","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:7eab132615e82b80acb7c6203af795d3d7a16853effbd4f49c71b1e5e1215cfb","observation_id":"cb8dcaf4-c535-472d-b974-0afacab16b0b","resolution":{"observed_at":"2026-08-15T23:46:02.936502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10156","last_updated":"2024-03-13T12:16:20Z","snapshot_observed_at":"2026-08-16T15:07:16.582886Z","submitted_at":"2023-08-20T04:09:12Z","title":"SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2308.10156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.10156","snapshot_observed_at":"2026-08-15T23:46:04.489859Z","title":"SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation","venue":"cs.CV","work_id":"9b8d62d1-9255-4978-8835-57c4d2b0b75e","year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.940679Z"},"links":{"cited_paper":"/paper/2308.10156","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:6f67f9d5a3ca44dd2a97ad4de9fe38d24454c2c9d2a779d34644d9ee22691bf8","observation_id":"66f47646-64f3-4701-8919-89ac17e4823f","resolution":{"observed_at":"2026-08-15T23:46:04.494729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07304","last_updated":"2024-05-28T12:32:31Z","snapshot_observed_at":"2026-08-16T14:10:44.156939Z","submitted_at":"2024-03-12T04:13:45Z","title":"Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07304","snapshot_observed_at":"2026-08-15T23:46:02.945352Z","title":"Lumen: Unleashing versatile vision-centric capabilities of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.945352Z"},"links":{"cited_paper":"/paper/2403.07304","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:fc8ea4c90d6d3fb20e8d99e8b78f9dfee192104106cbbebea51558f605937d6b","observation_id":"c98d2440-8761-4f94-aacc-064690ab2357","resolution":{"observed_at":"2026-08-15T23:46:02.945352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06863","last_updated":"2025-01-20T11:02:52Z","snapshot_observed_at":"2026-08-16T13:35:47.144042Z","submitted_at":"2024-07-09T13:50:43Z","title":"Beyond Aesthetics: Cultural Competence in Text-to-Image Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06863","snapshot_observed_at":"2026-08-15T23:46:02.949916Z","title":"Beyond aesthetics: Cultural competence in text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.949916Z"},"links":{"cited_paper":"/paper/2407.06863","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:ad6a4c7bc5071c196d8bc82759a6d8a6e07ac4cdaca043670b91a16cb97653bd","observation_id":"7a29afa5-3cec-408f-99d2-d47299c4a2f5","resolution":{"observed_at":"2026-08-15T23:46:02.949916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.954334Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.954334Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:ac94ec14306473317a33123521a56790be21a00c35e3c21432e6a1742c9c885e","observation_id":"557623ef-19d9-4a24-aaf0-6202808f6732","resolution":{"observed_at":"2026-08-15T23:46:02.954334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15194","last_updated":"2025-08-26T04:40:29Z","snapshot_observed_at":"2026-08-13T11:34:25.521375Z","submitted_at":"2023-05-24T14:31:20Z","title":"DiffBlender: Composable and Versatile Multimodal Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15194","snapshot_observed_at":"2026-08-15T23:46:02.958763Z","title":"Diff- blender: Scalable and composable multimodal text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.958763Z"},"links":{"cited_paper":"/paper/2305.15194","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:2627cb4069fb81034430e6a8a0fb76c50ca8c597f3dcc398e140d1e90b471072","observation_id":"6a5b976d-9aed-453c-b850-aa770c613df1","resolution":{"observed_at":"2026-08-15T23:46:02.958763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.963353Z","title":"Probabilistic modeling for human mesh recovery","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.963353Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:2631d85020820b0690bc83a8bfc52ec3f0f14dc5301bd5800a884c33bcaa6b29","observation_id":"e722c22a-6969-44e7-8556-d2540879507f","resolution":{"observed_at":"2026-08-15T23:46:02.963353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.967398Z","title":"Raindrop-removal image translation using target-mask network with attention module","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.967398Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:2f9d6907e3115d37feb9d666af1a20aafc36caeb5b740f582f6506565d8b8eba","observation_id":"2a3ae3de-47d3-4b5e-850a-3139a0907cae","resolution":{"observed_at":"2026-08-15T23:46:02.967398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.971373Z","title":"Dicti: Diffusion-based clothing designer via text-guided input","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.971373Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:93ea36ce7062f5f1dbf596ae37f4db72ad995326a913749eee63a2320a70b72b","observation_id":"bc586949-05d3-4f58-a8c3-67e684898143","resolution":{"observed_at":"2026-08-15T23:46:02.971373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.975366Z","title":"Physics-based shadow image decomposition for shadow removal","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.975366Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:94ec9e5046e2610a6acf40e56e38bcc8fa12bae7ba4f756a9e67a5fe1fd59b50","observation_id":"5d7bd6e6-486c-4f55-ae82-b522f0b294ec","resolution":{"observed_at":"2026-08-15T23:46:02.975366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07429","last_updated":"2025-03-10T15:13:38Z","snapshot_observed_at":"2026-08-16T12:51:28.618848Z","submitted_at":"2025-03-10T15:13:38Z","title":"From Text to Visuals: Using LLMs to Generate Math Diagrams with Vector Graphics","version":1},"cited_work":{"arxiv_id":"2503.07429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07429","snapshot_observed_at":"2026-08-15T23:46:04.430308Z","title":"From Text to Visuals: Using LLMs to Generate Math Diagrams with Vector Graphics","venue":"cs.AI","work_id":"36b4bd4f-c8ed-49cd-b8e4-bd94016a93eb","year":2025},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.979690Z"},"links":{"cited_paper":"/paper/2503.07429","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:ed8e594af09ce033ca6488e8bf41caf343937a4537f6f048319603e762fa3f8e","observation_id":"60341660-f287-4588-858c-a35a363177c4","resolution":{"observed_at":"2026-08-15T23:46:04.434842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.984144Z","title":"An underwater image enhancement benchmark dataset and beyond","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.984144Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:2f15a1598df6875a93f528e1ac62406e51c042748c42fbe44fefe320ce77be55","observation_id":"9d49abaa-04a5-4f99-adba-a64617eb183d","resolution":{"observed_at":"2026-08-15T23:46:02.984144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.988400Z","title":"Real-world deep local motion deblurring","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.988400Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:bcad00545a50219eb57d2894db34987f5904f98a86822961add9672a75179a33","observation_id":"6c8fa3de-94c1-46cb-ae53-a46c538b7287","resolution":{"observed_at":"2026-08-15T23:46:02.988400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.992330Z","title":"Cheffusion: Multimodal foundation model integrating recipe and food image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.992330Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:b29618a65e98af0453cab7ba952b0be006d05c7169f2df8224d5f89190c23310","observation_id":"f4738e64-9a59-44a8-b5a6-8aa89ae0307a","resolution":{"observed_at":"2026-08-15T23:46:02.992330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:02.996386Z","title":"Image content generation with causal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:02.996386Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:79783278bea1eb970ec917fbdf04aa7c1380cd457ee0706c3592dfdd63873820","observation_id":"3c9fd2a9-a618-4930-9f8a-7e0113366c74","resolution":{"observed_at":"2026-08-15T23:46:02.996386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.000457Z","title":"Exploiting reflection change for automatic reflection removal","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.000457Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:c483e9e19581c5344ea6572aa19ea522cd578df53288b9ff10de698dc4b153e7","observation_id":"e0b3a3b6-8b60-4731-979f-4eb3fca83de0","resolution":{"observed_at":"2026-08-15T23:46:03.000457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17154","last_updated":"2023-06-29T17:55:14Z","snapshot_observed_at":"2026-08-13T11:05:51.685220Z","submitted_at":"2023-06-29T17:55:14Z","title":"Generate Anything Anywhere in Any Scene","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17154","snapshot_observed_at":"2026-08-15T23:46:03.004601Z","title":"Generate anything anywhere in any scene","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.004601Z"},"links":{"cited_paper":"/paper/2306.17154","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:5deef11e95e91db3f1d8c5a548da5e6bf3d549e4a1fa4fc6b52bcb2f37af43bf","observation_id":"ff29fc25-f131-4327-8a2c-6f0ede33dd9d","resolution":{"observed_at":"2026-08-15T23:46:03.004601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.009540Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.009540Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:ac6c355c1104cbc61fe63cbf5a69c9217a0de69f30a9f4b22d5fdeaa3e61229d","observation_id":"309c2a77-bd40-462b-9d10-8de4fcfb5d38","resolution":{"observed_at":"2026-08-15T23:46:03.009540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.013949Z","title":"Swinir: Image restoration using swin transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.013949Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:11c81b2c2fb90e274a192cc7de6a4f4c94bdb3f4ea6cd2cf2debfbc462d7a91d","observation_id":"17d7d127-b48e-41a2-818d-979823c3d95e","resolution":{"observed_at":"2026-08-15T23:46:03.013949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05993","last_updated":"2021-12-11T14:22:05Z","snapshot_observed_at":"2026-08-13T01:18:26.992548Z","submitted_at":"2021-12-11T14:22:05Z","title":"Object Counting: You Only Need to Look at One","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05993","snapshot_observed_at":"2026-08-15T23:46:03.017973Z","title":"Object counting: You only need to look at one","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.017973Z"},"links":{"cited_paper":"/paper/2112.05993","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:8a67e143121c495000bb6fef091815912f0df69c958b87e14d72a7bb5b454ffa","observation_id":"3dcaaf6c-f497-4a4b-b579-c84e6b9b14f9","resolution":{"observed_at":"2026-08-15T23:46:03.017973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.022186Z","title":"Phys4dgen: A physics- driven framework for controllable and efficient 4d content generation from a single image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.022186Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:c9ba7cb0227e28dda72bfcd677ef345a93b60c2831c4c0d6980f1027ca4baaac","observation_id":"ae60a7ab-10be-4e17-ae25-0d380b23dc62","resolution":{"observed_at":"2026-08-15T23:46:03.022186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.026366Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.026366Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:e302214feab5f0ba3633b265caf490a73a9c4c060b109ff50efb10144b22a7b7","observation_id":"be5619c1-a47e-42dd-b6c4-f69a150adc2a","resolution":{"observed_at":"2026-08-15T23:46:03.026366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.030724Z","title":"On the cultural gap in text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.030724Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:169f2a5e1546347f7e9336cd6506c01a6cfb308ca3e4f851fb16942bce2f1aa7","observation_id":"630eb4f5-70be-4fbf-9da6-1b9f6b190442","resolution":{"observed_at":"2026-08-15T23:46:03.030724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-08-10T18:47:01.186615Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10928","snapshot_observed_at":"2026-08-15T23:46:03.035004Z","title":"Generative physical ai in vision: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.035004Z"},"links":{"cited_paper":"/paper/2501.10928","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:b7d5352fab25ef72c849b1186576afb51a58b4ca7df23d2caaf9f2e2683c75e2","observation_id":"dfce535c-f1ea-494f-9e9e-cffa8163f5d0","resolution":{"observed_at":"2026-08-15T23:46:03.035004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00330","last_updated":"2024-09-12T06:50:53Z","snapshot_observed_at":"2026-08-16T14:38:36.179170Z","submitted_at":"2023-12-01T03:53:21Z","title":"StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00330","snapshot_observed_at":"2026-08-15T23:46:03.039629Z","title":"Stylecrafter: Enhancing stylized text-to-video generation with style adapter","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.039629Z"},"links":{"cited_paper":"/paper/2312.00330","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:780db9492c1d9143b44314931304c822a016e29d2ecb3a575402c0b4a737c7b6","observation_id":"e2282a71-9935-46f7-a685-e1547c4a58b8","resolution":{"observed_at":"2026-08-15T23:46:03.039629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.044224Z","title":"Structure matters: Tackling the semantic discrepancy in diffusion models for image inpainting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.044224Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:e9c5b04200c71b5b9bdb1313014c31ea095a76a9f24f82e91d51233d3bd9da10","observation_id":"b3e7ee1f-17d1-4baf-a65f-e0c854a84b01","resolution":{"observed_at":"2026-08-15T23:46:03.044224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.048723Z","title":"One-2-3-45: Any single image to 3d mesh in 45 seconds without per-shape optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.048723Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:e58ed03356877de4dc4d4e0d0e7e2b7d0396daceb18cad6688bbd14b30ecb488","observation_id":"54215261-fb6c-42ec-a503-37627b0ccd0b","resolution":{"observed_at":"2026-08-15T23:46:03.048723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.052810Z","title":"Git-mol: A multi-modal large language model for molecular science with graph, image, and text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.052810Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:78e68c2b82101fb6f3ad0bd2d2de62235484ae7e541349ff5253cb1508df2ae1","observation_id":"c419dc49-cd53-4dba-b0cd-23f047d9b483","resolution":{"observed_at":"2026-08-15T23:46:03.052810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10562","last_updated":"2023-05-03T16:36:38Z","snapshot_observed_at":"2026-08-15T19:03:45.383227Z","submitted_at":"2022-12-20T18:59:23Z","title":"Character-Aware Models Improve Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10562","snapshot_observed_at":"2026-08-15T23:46:03.056819Z","title":"Character-aware models improve visual text rendering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.056819Z"},"links":{"cited_paper":"/paper/2212.10562","citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:fab2964809b8b9579e6b01be85c8f59a769d2f0dc60cfe23ccf40338a412e2f8","observation_id":"be9f98fa-9853-4479-ba25-35e94013e4ce","resolution":{"observed_at":"2026-08-15T23:46:03.056819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.061601Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.061601Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:30dbc77777613c795c636bd6d81f0ee26aa9aa4074ad335609b62c06838cb340","observation_id":"6a51503c-58dc-48ce-a7c9-8abaa2446b08","resolution":{"observed_at":"2026-08-15T23:46:03.061601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.065904Z","title":"Physgen: Rigid-body physics-grounded image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.065904Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:4f87faab4244b54e628f9890845e1c64cf6928f8655acdf34343259bf30baefc","observation_id":"eb0c1020-6dcf-4345-bf62-bd5e33e9411e","resolution":{"observed_at":"2026-08-15T23:46:03.065904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:46:03.070172Z","title":"Ssd: Single shot multibox detector","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T23:46:03.070172Z"},"links":{"citing_paper":"/paper/2505.05501"},"observation_digest":"sha256:48ccfa20427535dc8a8762bd090c4819a30496a197768bf054fc44666237e5c5","observation_id":"b08867eb-ef58-45ba-a0d0-4e02857f91d1","resolution":{"observed_at":"2026-08-15T23:46:03.070172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.05501","last_updated":"2025-05-06T19:35:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T12:59:54.201377Z","submitted_at":"2025-05-06T19:35:29Z","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":219},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 219 outbound references and 3 inbound Pith citation observations for arXiv:2505.05501."}