{"as_of":"2026-08-10T07:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f916473441546145cc65fc4e19c428b18e6d883e5b255ac34888a495e1451f40","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:45:11.810244Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.09949/citation-record","integrity":"/paper/2508.09949/integrity","json":"/paper/2508.09949/citation-record.json","paper":"/paper/2508.09949"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:19.160880Z","title":"Cross-image attention for zero- shot appearance transfer","venue":null,"work_id":"cf205bd9-178f-4365-b6a5-01a2f697822f","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.514302Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:e5cda2be461b2e7193b4c89752e5936e29617d6f1e9f40daeedcbd3ae2a988cb","observation_id":"ea0e9fe5-1447-49a4-81bf-e1c267cba23c","resolution":{"observed_at":"2026-08-05T20:45:19.260996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.983269Z","title":"Sequential modeling enables scalable learn- ing for large vision models","venue":null,"work_id":"bab00e38-a7a2-44c5-8ee0-7b152b0f12c9","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.596299Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:ffb0d310894782216e027e85cdae7a3ea1528e1b2c09e982106402a9c8d3e194","observation_id":"4ea1ad37-8362-43e2-b517-aca312ee46cb","resolution":{"observed_at":"2026-08-05T20:45:19.059029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.810807Z","title":"Visual prompting via image inpaint- ing","venue":null,"work_id":"eb6b303c-ba51-480c-a02f-b115f99e0f30","year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.653433Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:1c30b7451e557b88ae40acf76dc01031177ddd4206d611ae1b23274dedb82b2e","observation_id":"0c78c0da-cb8a-450d-9ceb-40e3db54a21e","resolution":{"observed_at":"2026-08-05T20:45:18.879570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.649696Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"ae2e9172-b516-4268-b520-540b81c60e0e","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.727032Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:66889b7ddc5d763eedab6db2e7e77a2cbfd7029fd7d19ac48b3f323fe8481400","observation_id":"279f86f4-f708-4a88-972a-89722b9a1430","resolution":{"observed_at":"2026-08-05T20:45:18.714494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.491517Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"7f03822b-62d9-4723-8fe4-0986bf095bde","year":1901},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.783552Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:4492956b4d9f3b328c810ab645b3254f600019755f78bb48d33d50c4d62b418f","observation_id":"1e441169-98af-43af-926c-38ff8468b4f1","resolution":{"observed_at":"2026-08-05T20:45:18.540437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.294929Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"e3a2ee30-a2e7-4b22-bd72-aec5db427562","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.843136Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:490f2da3b711e60747daeff8b8923048dd68dd83377f88e0061d68532e32c89e","observation_id":"ab96f64c-7e4f-47b6-bbcb-ef99c54e959f","resolution":{"observed_at":"2026-08-05T20:45:18.392573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:18.117373Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"3db0e7c8-9958-4d55-a405-152946b09ea3","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.920859Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:39be7a038704af0411e4658e5fa8f7f9528868136e14c73e7038f26e661da842","observation_id":"20da4964-ea57-4fca-96e3-d14d20015449","resolution":{"observed_at":"2026-08-05T20:45:18.194866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.908874Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"a2c7060d-be43-449f-9628-210412e61958","year":2016},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:07.986102Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:1efc09bd44563e514f3d510913d7b706e5af3d717b6565865b4ab2e43a825469","observation_id":"a6019d4b-ae55-475a-a205-e86bb6897692","resolution":{"observed_at":"2026-08-05T20:45:18.005280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.812579Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"ae02cbed-9880-4e0b-89fe-a43700299e60","year":2021},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.078082Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:ca559da64c32f7cf63b206cbf1d812eb8a244d7273c7528febbe9d88760fa21b","observation_id":"a37b9586-9823-497a-b435-ef0d4c998b6f","resolution":{"observed_at":"2026-08-05T20:45:17.840449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.609565Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"673aa0fc-fd1f-4502-9f02-70cf6b3e2d58","year":2021},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.157184Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:b7d0ca6365c8727bb830d21307cd596e610ccd3ea52cddfe7b02273790809855","observation_id":"fe7acafe-8409-4c76-a38a-6fefa71c9c5c","resolution":{"observed_at":"2026-08-05T20:45:17.711926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.430092Z","title":"Explore in-context learning for 3d point cloud understanding","venue":null,"work_id":"b514b046-159d-4ad3-ac94-5a76855d939a","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.221200Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:f03c957480bc3092e8d650c248e71228209aeb734dec801e072f8d8ee2beb435","observation_id":"92968a93-2f4c-4d58-866e-094b743fbdac","resolution":{"observed_at":"2026-08-05T20:45:17.523814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.255520Z","title":"Openllama: An open reproduc- tion of llama, 2023","venue":null,"work_id":"b727a552-119d-4f3c-8972-7bae705520b0","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.272090Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:10d3d11675a6c9f6fab4bce3ff818326c842dac0dfe216b3e0bb027c2aeecd18","observation_id":"bdb00826-7da4-4ba0-9f21-afa5a1913ce3","resolution":{"observed_at":"2026-08-05T20:45:17.333844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.06336","last_updated":"2022-06-13T17:34:22Z","snapshot_observed_at":"2026-07-06T13:20:17.627012Z","submitted_at":"2022-06-13T17:34:22Z","title":"Language Models are General-Purpose Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.06336","snapshot_observed_at":"2026-08-05T20:45:08.328312Z","title":"Lan- guage models are general-purpose interfaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.328312Z"},"links":{"cited_paper":"/paper/2206.06336","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:0aa9f0e9fd3d89c2a1ece1b4e869f08a413cf24d62724ee1c886033c93db0ea8","observation_id":"0a76cdf3-950e-41c2-86d4-2c52527f4881","resolution":{"observed_at":"2026-08-05T20:45:08.328312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:17.048526Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"e12c2429-400f-4c33-9c31-6da9d112e1ce","year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.399731Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:f4b2261a435862fa5a4c0965e053e4d7076c10e469df3c552257dc23a4221539","observation_id":"3f09f22a-d9ee-4c88-abfb-07858b1c03c5","resolution":{"observed_at":"2026-08-05T20:45:17.143042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.898763Z","title":"Unsupervised keypoints from pretrained diffusion models","venue":null,"work_id":"5cbaa59d-ebfc-4b6a-82b1-11cf0c5d198c","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.476205Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:502cb7c9a3aa2b6482f053e79bddb4472c3ee3039f95fa89d33008086bbff428","observation_id":"e22ed390-084b-44ea-91cb-b7913bfe02e1","resolution":{"observed_at":"2026-08-05T20:45:16.981249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.742732Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"db755ca5-f6ab-4575-aba7-0a8feb41d4ba","year":2017},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.585457Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:4e0a924efad480799a1f438332aebed9515cd636e33023c7eb6220bfec6abb01","observation_id":"e14efd6c-fdb3-4f5a-881e-5ddbcbf6248d","resolution":{"observed_at":"2026-08-05T20:45:16.797606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T20:45:08.698082Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.698082Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:494289eb03234361e07213a15a99c11822812599798758574ac9537e80af00f7","observation_id":"21b0b5c6-4357-4d7c-87a8-2d63a06ef7dc","resolution":{"observed_at":"2026-08-05T20:45:08.698082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.629386Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":"6815002e-4520-4166-99b8-d860e0fb07d0","year":2017},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.762078Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:f1a4f003e3b41ad5dcca7831582cc1a9126e3864276b347932f91d9c25faabb4","observation_id":"f1032768-867f-4539-a491-87c2d55c1be7","resolution":{"observed_at":"2026-08-05T20:45:16.700582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.423435Z","title":"An edit friendly ddpm noise space: Inversion and manipulations","venue":null,"work_id":"34137bb1-95d4-4bdc-a8e0-b96c4c01b9ed","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.820187Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:42398b9e30acb546e3965adf3aa6e5a1d326ca37a6b33720e17538fcab767c08","observation_id":"097e27bf-7126-4538-8307-7a9c084f15fc","resolution":{"observed_at":"2026-08-05T20:45:16.517854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.275357Z","title":"Fss-1000: A 1000-class dataset for few- shot segmentation","venue":null,"work_id":"4139d0d3-0b39-49f2-a399-d30b94b8c81c","year":2020},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.873462Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:53390b963cf7212e37d580c4bca1cade443d65208b143a04fc8aaefa0163aa87","observation_id":"e65fa974-f178-4267-b48a-ee822bf7af11","resolution":{"observed_at":"2026-08-05T20:45:16.356034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:16.123448Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"f43a3fb3-cc27-4e26-87b4-c74f6bea3af9","year":2014},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:08.938454Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:b265dc323ed7db4a702bfb9cb4d60645290a0874f999fe748af19ee565ff7735","observation_id":"ff2ed0fe-3963-4cfa-acfc-fb9a47cfdbb5","resolution":{"observed_at":"2026-08-05T20:45:16.187764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.927097Z","title":"Explicit visual prompting for low-level structure segmenta- tions","venue":null,"work_id":"14f5a3cb-5e1c-4461-b9df-3ad95b5ee189","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.036719Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:25e558bd4c09dedf40593ca97944c84ae146ad17f859895a66ce080915536f19","observation_id":"2d64a71a-81f3-4847-83dd-4cf2f1126cd6","resolution":{"observed_at":"2026-08-05T20:45:16.037748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.736831Z","title":"Instaflow: One step is enough for high-quality diffusion- based text-to-image generation","venue":null,"work_id":"3c979518-efcf-4c11-bd63-d4fc6620f4e0","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.124066Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:68ed0f8bcdfbbec0100277f392bd273aecd32966d75730b7a4756c25cee5266a","observation_id":"616c6738-5689-4846-bde1-91441c31a463","resolution":{"observed_at":"2026-08-05T20:45:15.817633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.552040Z","title":"Deepfashion: Powering robust clothes recognition and retrieval with rich annotations","venue":null,"work_id":"28026821-667b-4b3c-b814-4ea9214fe34e","year":2016},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.199623Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:93cf199a0701428823782ac31fadedf1f2ad7608ad0a75e56a3dfcd578719338","observation_id":"49ae3865-0d90-47ca-8dd0-929f6ed843fa","resolution":{"observed_at":"2026-08-05T20:45:15.617910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.417502Z","title":"Localizing object-level shape variations with text-to-image diffusion models","venue":null,"work_id":"137929e5-0a78-4897-872b-fabecc614344","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.275040Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:3506130b6a6717d34bd0b1e1580c6ac7284568e8a798dc21b3cab7e342f567f7","observation_id":"a7669b71-d91c-4ddb-b930-23a48fd25abb","resolution":{"observed_at":"2026-08-05T20:45:15.473594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:09.388248Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.388248Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:c2887b292d0d3caf80bbd9f10ed45fcc1797e66a9a5587dbf3e3529482e3380b","observation_id":"26bb486c-c1c8-4cf1-870b-acb41d9279cc","resolution":{"observed_at":"2026-08-05T20:45:09.388248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T20:45:09.443522Z","title":"Scaling language models: Methods, analysis & insights from train- ing gopher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.443522Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:75a17d51da2f01b0aa712c25894479c7c198eea0edc962390e1cda218c4ab7c2","observation_id":"971880ba-b9bd-4a29-8caf-3a2ec646574e","resolution":{"observed_at":"2026-08-05T20:45:09.443522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.218065Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"a782daf0-647f-47fd-8f53-aad8fec6fd64","year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.528641Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:f2ef84d37784bdcb8acfeef6afc247ec9194cd2e7489273d8f0c75a0a056a635","observation_id":"241695fd-c785-4c00-8cc9-d96f30560e88","resolution":{"observed_at":"2026-08-05T20:45:15.284617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:15.070472Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":"d7acd51b-47f0-41af-a127-2d04b45250a0","year":2015},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.586460Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:d444c86cae2e874b6ee7adb1513b194e0211b8fbd31e9ba6742be4ea25d6126e","observation_id":"d3ca2731-a12e-4c2d-8967-8821137393a8","resolution":{"observed_at":"2026-08-05T20:45:15.132089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:14.914621Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"295028d8-3141-4511-b51e-e21934f278bc","year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.630964Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:0e15a17b437f2af028026851bb2ea8454280de24f2f78d5b1b7d48f9b59b4858","observation_id":"fdc02c7e-29c3-4394-8e00-7d38d771fc7d","resolution":{"observed_at":"2026-08-05T20:45:14.965749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.03410","last_updated":"2017-09-11T14:34:58Z","snapshot_observed_at":"2026-07-06T05:59:03.911368Z","submitted_at":"2017-09-11T14:34:58Z","title":"One-Shot Learning for Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.03410","snapshot_observed_at":"2026-08-05T20:45:09.687821Z","title":"One-shot learning for semantic segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.687821Z"},"links":{"cited_paper":"/paper/1709.03410","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:dc76e49b09083e67e09805030c5f7f5baa81cb60eba420ceab8c1515cbd1044c","observation_id":"beb072df-3064-489d-a413-a39b42bd99bb","resolution":{"observed_at":"2026-08-05T20:45:09.687821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:14.770712Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"1b7df1f4-574c-491e-b9c8-a7641cc0dcfd","year":2012},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.772103Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:f1de92c48f7037c3eafd97912f55e41eac0a765f2066f61759ff4198709af102","observation_id":"c8f21ec4-1925-4b96-8948-9823c16e68d0","resolution":{"observed_at":"2026-08-05T20:45:14.831772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-05T20:45:09.834456Z","title":"Lamda: Language models for dialog applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.834456Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:5ad6d9d8ffa4b8478d34376e138856df016bd1dd8614f5de068912a994af0f7d","observation_id":"2347fc21-f0c2-432f-aaba-ee081af82a43","resolution":{"observed_at":"2026-08-05T20:45:09.834456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:14.584803Z","title":"Diffuse attend and segment: Un- supervised zero-shot segmentation using stable diffusion","venue":null,"work_id":"07b0a79c-ecd7-4152-ae40-e6524912d4b1","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.900414Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:4cfd12e085672fa9a5a0d0060149f4ec1a6839161076ee522e9bc3ff05418411","observation_id":"23bf833b-62e0-4108-a269-a7dd2ae6e9c3","resolution":{"observed_at":"2026-08-05T20:45:14.658644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T20:45:09.978506Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:09.978506Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:47ed59b5a258efb4175614717ab6e50557b246edf0c09cbded6661c94ebadd07","observation_id":"923b9bb1-eafc-4abe-b358-85ada635f178","resolution":{"observed_at":"2026-08-05T20:45:09.978506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:10.059580Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.059580Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:734eb0e88ba01ff131a6c58686a74d8d317e0a5fba836eae6c08ab506fee13b7","observation_id":"cb9f60f3-d965-4aa2-bb28-8fcc1c32aabf","resolution":{"observed_at":"2026-08-05T20:45:10.059580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:10.129900Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.129900Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:aa218939d8d126073e62ec74719cd46b8b2becc371367aabfa97441a61644da9","observation_id":"a0d20d56-4c9f-4965-a019-5c9ec8260765","resolution":{"observed_at":"2026-08-05T20:45:10.129900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:14.362202Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":"6f17517e-3dac-45f2-b12b-d34448f0b210","year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.206858Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:9d37c456ad1c6075fadcf56698534d6ea3075138afe5d5da1aed24f10f79cfd5","observation_id":"9de3235e-7d0e-4f19-8c58-7bede78fabf1","resolution":{"observed_at":"2026-08-05T20:45:14.460737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03284","last_updated":"2023-04-06T17:59:57Z","snapshot_observed_at":"2026-08-09T03:50:44.384164Z","submitted_at":"2023-04-06T17:59:57Z","title":"SegGPT: Segmenting Everything In Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03284","snapshot_observed_at":"2026-08-05T20:45:10.267368Z","title":"Seggpt: Segmenting ev- erything in context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.267368Z"},"links":{"cited_paper":"/paper/2304.03284","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:47a67e2b70b7f4141a3771311c6764ea08f412fb9148837f3c4e9e990596a160","observation_id":"d6743e03-b4d1-4a9f-ad12-21eb31c0a679","resolution":{"observed_at":"2026-08-05T20:45:10.267368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:14.030884Z","title":"Skeleton-in-context: Unified skeleton sequence modeling with in-context learning","venue":null,"work_id":"b825569d-7141-40a2-882d-d1cda2632bb3","year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.361851Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:baccee2334815f82902ef8bf6cc19dd1f34a24d564423dbe9d54fb2d44fb31d8","observation_id":"ea9b798f-32c4-4a78-b75e-c0e1fd9b19cb","resolution":{"observed_at":"2026-08-05T20:45:14.185823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:13.825010Z","title":"In- context learning unlocked for diffusion models","venue":null,"work_id":"a9dff6dd-4693-4199-a6e3-35239824cd03","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.441571Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:dc6c2dbfd36e5f887b7d097068c68f1d55d4f1f07217281b0293f3c70083a008","observation_id":"e35bfc9e-0305-4407-a16f-21226894854e","resolution":{"observed_at":"2026-08-05T20:45:13.929754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:13.414841Z","title":"Emergent abilities of large language models","venue":null,"work_id":"43e61a90-394a-41d4-9d1b-20858508ccaf","year":2022},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.625430Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:09fe559ea436a54acac7e77efd15bd510be3acec448b381bece26529f9c3371d","observation_id":"01c703b2-bea8-4173-874e-c1ffd15056a0","resolution":{"observed_at":"2026-08-05T20:45:13.481069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:13.223705Z","title":"Holistically-nested edge de- tection","venue":null,"work_id":"c51d618b-774f-4d4a-a69a-b551ae521790","year":2015},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.743864Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:fe941eb03f667a2b32e855838dd498b7b2cc641c2c34fc463d9dea730c449c95","observation_id":"baa751ca-64cb-49a5-bd05-07d8de37512f","resolution":{"observed_at":"2026-08-05T20:45:13.288223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01771","last_updated":"2023-12-04T09:48:29Z","snapshot_observed_at":"2026-08-09T19:51:51.113273Z","submitted_at":"2023-12-04T09:48:29Z","title":"IMProv: Inpainting-based Multimodal Prompting for Computer Vision Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01771","snapshot_observed_at":"2026-08-05T20:45:10.874525Z","title":"Improv: Inpainting-based multimodal prompting for computer vision tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.874525Z"},"links":{"cited_paper":"/paper/2312.01771","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:f04f6b0f5d99541dd46eab360ba9c93b61123aac4a9d79eaca8faa10df84eb83","observation_id":"f585997b-c4f4-4bff-a58f-7d6ab1a7d75f","resolution":{"observed_at":"2026-08-05T20:45:10.874525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14867","last_updated":"2024-05-24T17:08:32Z","snapshot_observed_at":"2026-08-05T03:51:41.162350Z","submitted_at":"2024-05-23T17:59:49Z","title":"Improved Distribution Matching Distillation for Fast Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14867","snapshot_observed_at":"2026-08-05T20:45:11.013444Z","title":"Im- proved distribution matching distillation for fast image syn- thesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.013444Z"},"links":{"cited_paper":"/paper/2405.14867","citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:771c61d13245e9a4582e3ce7d1c1c55e5b3d09ee622a6f5f2fc2a7af263c6f86","observation_id":"d8c56f9a-ba14-4fde-8add-e172b04bc932","resolution":{"observed_at":"2026-08-05T20:45:11.013444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:13.041615Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"061e357a-cbd9-4dde-b96f-0e67fc4b89c8","year":2018},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.193266Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:50a45d0a9672f2750279e23a8aa9a5590e747daabdf7ddc9569a59d51d1610e1","observation_id":"46c9168b-3274-4100-ab56-7067f4fc9e32","resolution":{"observed_at":"2026-08-05T20:45:13.143015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:12.923033Z","title":"What makes good examples for visual in-context learning? Advances in Neural Information Processing Systems, 36:17773–17794,","venue":null,"work_id":"1ae1772e-757a-4ecc-a912-0ae2d48572a5","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.248935Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:9207e41da8339edf81994d64a0a50f52441a8c6b3265555e3cf8a029ae838423","observation_id":"8a303289-20e1-4d0a-b51c-1dc3719dbed8","resolution":{"observed_at":"2026-08-05T20:45:12.966932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:12.772390Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"24f065d0-e08a-4411-b196-7a2c9e940c0f","year":2019},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.402783Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:5eefa12733d711a386a886dd303bf52288763631a5b81a150d7f2bebd570ba8d","observation_id":"bf780141-304e-4389-9986-410db0428342","resolution":{"observed_at":"2026-08-05T20:45:12.841015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:12.680860Z","title":"To accommo- date the different spatial scales, we apply Gaussians with smaller variance for facial keypoints, which are relatively finer, and larger variance for body keypoints","venue":null,"work_id":"97843a1e-5050-4127-a58d-9457b8950232","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.506721Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:60231f8853f118a51b03a230a7b822c631ca8f2c8c047bfce24eb55f2fcb729a","observation_id":"1a9829e6-0b1f-4825-9430-44fad156dbf2","resolution":{"observed_at":"2026-08-05T20:45:12.718357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:12.365538Z","title":"We compute the LPIPS loss and the FID score [16] between the original colored image and the colorized prediction to evaluate the perceptual simi- larity","venue":null,"work_id":"127bc7a8-01b6-4f09-affa-061f1d5580d3","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.654332Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:67f5d8be5c3ff73ab2667213ea5cfc86564ef04de7539e5b2d31b0ecafbd3e7e","observation_id":"d4e52e8c-3d23-41ad-9ca7-58450e1771b1","resolution":{"observed_at":"2026-08-05T20:45:12.512074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:12.165357Z","title":"LAION5B [30]) that span annotated, unannotated, and sequence images","venue":null,"work_id":"f66d42ed-ec7c-4999-b06e-10369c4771d7","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:11.810244Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:13e761afe696874da24fdd7c5cff983c52556bf09496dfa348d67d463b3b133b","observation_id":"405de464-d3f0-4a4b-aa9b-a4de4ef4bbe3","resolution":{"observed_at":"2026-08-05T20:45:12.222950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:13.602884Z","title":null,"venue":null,"work_id":"829843d5-6110-48cc-8efb-1de2bd9bce8f","year":null},"citing_paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T20:45:10.502447Z"},"links":{"citing_paper":"/paper/2508.09949"},"observation_digest":"sha256:76e0c797078d97a63fcec04e952d9b1f81445bf36f068f0c4091352d73131420","observation_id":"baf02844-f133-45ce-9239-b9f829f1ea4e","resolution":{"observed_at":"2026-08-05T20:45:13.707769Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.09949","last_updated":"2025-08-13T17:08:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T03:51:17.101449Z","submitted_at":"2025-08-13T17:08:22Z","title":"Stable Diffusion Models are Secretly Good at Visual In-Context Learning"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":12,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2508.09949."}