{"as_of":"2026-08-13T17:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:38b56ebe82ca6b2bf754e8716f16c40ff73673534bd7783768bdf35d4993193a","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:50:49.398206Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.01027/citation-record","integrity":"/paper/2412.01027/integrity","json":"/paper/2412.01027/citation-record.json","paper":"/paper/2412.01027"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T04:50:48.985145Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:48.985145Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:42a32eac7348973de6f8dd6b2946891a2021b66b9c9ffe4c4972fbbc0b72e2ac","observation_id":"7e69f455-c992-483b-ab46-be8f0595c4d8","resolution":{"observed_at":"2026-08-12T04:50:48.985145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:48.990814Z","title":"Sequential modeling enables scalable learn- ing for large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:48.990814Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:b3d917eacba6a292dfa20e5a9a1e73cc459a403888f7904198a39492b6011917","observation_id":"9d2f5915-d586-40de-a0e7-a41625d08de3","resolution":{"observed_at":"2026-08-12T04:50:48.990814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-12T04:50:48.995942Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:48.995942Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:ef5456c8ebcedb087539a8226c60c397bfa742b9efde755c7cec61de0934b3f8","observation_id":"ae4f521c-72e1-4ffc-b918-45150b077c5d","resolution":{"observed_at":"2026-08-12T04:50:48.995942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.001081Z","title":"Towards in-context scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.001081Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:b3b7e0b85ee5606b3c56beb62c499596a6cff175ab1e825a67a07e5a092e6002","observation_id":"95e91657-7daf-4258-b0a4-c75ccbd95d39","resolution":{"observed_at":"2026-08-12T04:50:49.001081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.005923Z","title":"Visual prompting via image inpaint- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.005923Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:95ef331ec0204ce24c391c4fc31a43647f989c28230b1f45ddf5aeaba16d28e7","observation_id":"42e6cb1a-a23f-46b5-baca-f4b41ff54c40","resolution":{"observed_at":"2026-08-12T04:50:49.005923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.010710Z","title":"Ledits++: Limitless image editing using text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.010710Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:e81009e684ebff6b91f970bdc539abfe526fe70f4c8674f6e95b5fc8b5190749","observation_id":"d22faafb-1358-4135-8902-d8cf788066fb","resolution":{"observed_at":"2026-08-12T04:50:49.010710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.015800Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.015800Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:ac9ef4869bfe3bac4996bb83ad5941a57f0b9797b94a37fda645aa6af077f0fe","observation_id":"7a49f04f-0979-45c2-97aa-c8cc16113704","resolution":{"observed_at":"2026-08-12T04:50:49.015800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.020532Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.020532Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:72eaab982414f722f61e9ca87c8ab520ec7d98e6ad1be760ab1e37335ee1aef9","observation_id":"8130c734-becc-4001-bd83-1af3670e7756","resolution":{"observed_at":"2026-08-12T04:50:49.020532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.025163Z","title":"Enhancing diffu- sion models with text-encoder reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.025163Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:71c97f5fff8dc65aa9683b6c0bc1b003aaa4bb5c265c8782cde202f37db2f5e8","observation_id":"1e7c3b91-4bd3-47f7-8d94-840bdca509e8","resolution":{"observed_at":"2026-08-12T04:50:49.025163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.029662Z","title":"Gentron: Diffusion trans- formers for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.029662Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:d88205437f29fc551bc3d99fb64749d770f1ac5d20f1a23ceafd5699daeff0f7","observation_id":"1e27c92e-222a-4859-8811-1fca3d2f5128","resolution":{"observed_at":"2026-08-12T04:50:49.029662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.034521Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.034521Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:63416b7f9f90e33c78116e4a088df346393555bb261bf9e12fff35a60e601dc7","observation_id":"c69ae28e-a9a7-4e93-8545-cc077f0b27bc","resolution":{"observed_at":"2026-08-12T04:50:49.034521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.610439Z","title":"Diffedit: Diffusion-based semantic image editing with mask guidance","venue":null,"work_id":"5d22106c-84ae-40f8-ac2d-44f09454ece2","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.039271Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:74100fe206ce885de7be41b9fff7ce1bc934d176db6752caf7c08a5cf2f37607","observation_id":"efc84018-8926-49cf-8f07-46fa309446c8","resolution":{"observed_at":"2026-08-12T04:50:50.615935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-13T10:03:45.960823Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-12T04:50:49.043738Z","title":"Emu: Enhanc- ing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.043738Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:b63272a12467577bde237d0aa0f97960d457f2bd3d1c3c921a30c6cf670139a3","observation_id":"550ceb1b-35c7-4783-9eaa-5108a325a2e8","resolution":{"observed_at":"2026-08-12T04:50:49.043738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.593838Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":"aebb4153-1639-4981-af17-02e58b1bb9f3","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.048789Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:d1906d6fea462eacac3c6ab392360369ee42abbf8a9877e0546cab27f85ad681","observation_id":"7c932f14-a5b3-4d0d-b046-20c3371e2a7a","resolution":{"observed_at":"2026-08-12T04:50:50.598952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.577851Z","title":"Diffusion self-guidance for control- lable image generation","venue":null,"work_id":"f510a143-1033-4939-a51b-70ed5ba8e373","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.053140Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:d12e7a0e672d8791f5532f2b1b8ecc66153a988ae4c8902ab51b82796f043c78","observation_id":"da5df7ea-fe07-4d7d-8070-74cd828dd806","resolution":{"observed_at":"2026-08-12T04:50:50.582913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-12T22:20:38.948104Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-12T04:50:49.057722Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.057722Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:4c69aeb1fe0c1e267a59571a723afb12d4b1fb4d481200467c62077df4aefa60","observation_id":"b22b22d0-667a-4dff-addf-8933ab823dab","resolution":{"observed_at":"2026-08-12T04:50:49.057722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13861","last_updated":"2024-10-21T15:42:46Z","snapshot_observed_at":"2026-08-12T22:20:39.920409Z","submitted_at":"2024-10-17T17:59:57Z","title":"PUMA: Empowering Unified MLLM with Multi-granular Visual Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13861","snapshot_observed_at":"2026-08-12T04:50:49.062861Z","title":"Puma: Empowering unified mllm with multi-granular visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.062861Z"},"links":{"cited_paper":"/paper/2410.13861","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:00b8c6ec66d08f2b3d1e89085456050a75ddd9123bb07143d7b99744fa363f6f","observation_id":"e4aca15d-b16a-413f-9639-fba6578f3de1","resolution":{"observed_at":"2026-08-12T04:50:49.062861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.562632Z","title":"Explore in-context learning for 3d point cloud understanding","venue":null,"work_id":"19dd9f1d-ca61-428f-b69e-dd6adba551ed","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.067781Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:e99cfce76ef372d6c9b7c4aabc76b5489475edc2b0caad86fdac1bb80b2ee9b3","observation_id":"0978e7e5-8336-472e-ba08-de109ae41151","resolution":{"observed_at":"2026-08-12T04:50:50.567490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.546850Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":"42ee4e0d-4e53-4257-8702-ef50675719c7","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.072661Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:dbc25f29e39471dff399170373ed3cfd7ac74c332673b180956d4cb5f4a53775","observation_id":"02febbd3-042a-4d92-bd48-dc8c8dbdb870","resolution":{"observed_at":"2026-08-12T04:50:50.552297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-12T04:50:49.077160Z","title":"Seed-x: Mul- 9 timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.077160Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:d6c44e1a4108193c71c711d0d34a0b98a1c0ac98741b85865c023092378acafe","observation_id":"16045736-77d1-47c0-ad8a-fc08cf5b5d08","resolution":{"observed_at":"2026-08-12T04:50:49.077160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.531010Z","title":"Analogist: Out-of-the-box visual in-context learning with image diffusion model","venue":null,"work_id":"348c5305-1949-4d87-bfb0-f9d67d521fa6","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.081903Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:49e9a1a9cb5d187210f301e84444d22c38d4a4686e3c1c6ddcb08a91f7f743c0","observation_id":"22026619-52d2-4db6-b391-26cfe5f34d3d","resolution":{"observed_at":"2026-08-12T04:50:50.536033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11262","last_updated":"2024-10-02T22:33:08Z","snapshot_observed_at":"2026-08-12T23:41:24.267223Z","submitted_at":"2024-06-17T07:06:58Z","title":"Generative Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11262","snapshot_observed_at":"2026-08-12T04:50:49.086350Z","title":"Generative visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.086350Z"},"links":{"cited_paper":"/paper/2406.11262","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c461f3ead572d58f536556fd24dd7b9a05239adf5639346db9242fb20005b96c","observation_id":"2b57f07d-d7d7-415b-80c9-3d7dcee161b4","resolution":{"observed_at":"2026-08-12T04:50:49.086350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.091059Z","title":"Prompt-to-prompt image editing with cross-attention control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.091059Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:b3e43a94defbb25a6516ba130e237c1bee8d49927748fbdc942a397e605f9232","observation_id":"e5f45ef6-bc05-4496-9aa7-e15d5c82bc5d","resolution":{"observed_at":"2026-08-12T04:50:49.091059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.095686Z","title":"Lora: Low- rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.095686Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:02964721748d22957c7fc7913fa710b9e6864d003482c5671f2338091b562af6","observation_id":"be9aea8b-b3e5-4294-b858-41363877f6b8","resolution":{"observed_at":"2026-08-12T04:50:49.095686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15334","last_updated":"2024-12-20T01:24:51Z","snapshot_observed_at":"2026-08-12T23:37:19.817513Z","submitted_at":"2024-06-21T17:50:02Z","title":"Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15334","snapshot_observed_at":"2026-08-12T04:50:49.099961Z","title":"Multimodal task vectors enable many-shot multimodal in-context learn- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.099961Z"},"links":{"cited_paper":"/paper/2406.15334","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c45056d5c7c84a632c7c70ddb776ca7e838e71341ab1fa614e59028956d719a6","observation_id":"e06625a7-57d5-468d-8939-a0636341a180","resolution":{"observed_at":"2026-08-12T04:50:49.099961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01536","last_updated":"2024-10-28T17:02:28Z","snapshot_observed_at":"2026-08-13T00:15:58.042962Z","submitted_at":"2024-05-02T17:59:52Z","title":"Customizing Text-to-Image Models with a Single Image Pair","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01536","snapshot_observed_at":"2026-08-12T04:50:49.104649Z","title":"Customizing text-to-image models with a single image pair","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.104649Z"},"links":{"cited_paper":"/paper/2405.01536","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:9399d366665e58baaf91308a77e73667e8fbc685d5fd07b0a75e1f241a767b45","observation_id":"782fb5de-b79b-4345-9bcb-0a8a3b6f57dd","resolution":{"observed_at":"2026-08-12T04:50:49.104649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.496209Z","title":"Chameleon: A data-efficient gener- alist for dense visual prediction in the wild","venue":null,"work_id":"dfe04bb8-c475-41c9-8b01-170070e98d34","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.109457Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:9a3b3cc5053558b84279a8137afa1f8303f8bfafe5512af0f865fc1c37a83ab1","observation_id":"c42bbc05-7e5b-4236-9798-4f63002fa3af","resolution":{"observed_at":"2026-08-12T04:50:50.501147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.481018Z","title":"Gen- erating images with multimodal language models","venue":null,"work_id":"63f9b939-fb9a-4d41-a538-33b6b402fb72","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.113675Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:12a3752104efc6721d6607dac2433ffb8afab53586c17b8a5e75241c60a9c83f","observation_id":"b479fb83-eae8-4815-88a2-d4ab8d328711","resolution":{"observed_at":"2026-08-12T04:50:50.485953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.466075Z","title":"Lego: Learning egocentric action frame generation via visual instruction tuning","venue":null,"work_id":"c6852b08-3779-43bc-9509-28cb5fc88e7d","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.117972Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:f50057b05fe609002cf5c406ee735608354c8c34480d305d171fc417299b41dc","observation_id":"7fd27ea1-e316-4195-bbd3-ef813be05d1e","resolution":{"observed_at":"2026-08-12T04:50:50.470763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.450744Z","title":"Blip-diffusion: pre-trained subject representation for controllable text-to- image generation and editing","venue":null,"work_id":"c2ab5bc1-d9d8-45bc-9900-f144ef345622","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.122498Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:b2a8f598270cb39dd1a713119d9146933eee923b8677a5a96e9c966457a17ae6","observation_id":"8e1baba4-8a6c-4157-8c46-199fd945edae","resolution":{"observed_at":"2026-08-12T04:50:50.455767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.435636Z","title":"Visual in-context prompting","venue":null,"work_id":"432d8827-279b-4231-89cf-e3a08ab30a87","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.126956Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:2287af7301ee24d29032277cb2a5cc20107119fbac66fd9ecdc598eaac4c4b43","observation_id":"6680440f-6d9f-436b-b973-f0161e47a795","resolution":{"observed_at":"2026-08-12T04:50:50.440485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.419737Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":"5597070f-ab33-4169-aeb4-991a8ef15d3b","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.131506Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:23dad62fabf671a3efb95f01e36d6ce0acb7e6c4c4e2437a956520f3ef725a05","observation_id":"6de807b2-8fa7-47a7-ab82-3ec1cfa9b05a","resolution":{"observed_at":"2026-08-12T04:50:50.424744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.404378Z","title":"Visual atribute transfer through deep image analogy","venue":null,"work_id":"1db62425-686a-4383-8b43-61a3daf41386","year":2017},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.136146Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:5bb3447246f61b129f8096e475f2fff3d3d3fca6651db4b955cbac8f7c5e6b4b","observation_id":"dbc1076f-ff8f-4905-a479-35d3bbbdacdf","resolution":{"observed_at":"2026-08-12T04:50:50.409154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.387865Z","title":"Text-driven image editing via learn- able regions","venue":null,"work_id":"b80f78de-b911-4627-9b14-93a202deb9af","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.140731Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c0b0da5bc6d451c855b859a1dd2d4ab82491a2bac365fea6772397a67f98f5fb","observation_id":"341e4589-69d9-4d11-87f9-214e4e0fdfec","resolution":{"observed_at":"2026-08-12T04:50:50.393548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-12T23:08:15.908636Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-12T04:50:49.145289Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.145289Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:84c283791bee9f0f1767797b4b3586880876788695bec6834285d3f2cbd778ca","observation_id":"3ca134d0-1df1-47ed-b85b-00d74882ee49","resolution":{"observed_at":"2026-08-12T04:50:49.145289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.371642Z","title":"Glid: Pre-training a generalist encoder-decoder vision model","venue":null,"work_id":"de6d2595-5ec3-495d-a9c7-c4d98cd4e249","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.150110Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:a7546f37b93ed79be888171dbd3954e4b301492973171c4bb74e2228f80ad836","observation_id":"1d50a909-574e-4428-bcc9-dbf2571601a7","resolution":{"observed_at":"2026-08-12T04:50:50.376543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.355857Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"ff335d00-5122-43f5-84d9-054a4a4f4084","year":2017},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.154472Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:646aead98c08ead3e2bb817d521dc87784f06c3912eb600651818a7b74457c7c","observation_id":"990b57ef-10a4-4c2a-94c4-fcc155dc971c","resolution":{"observed_at":"2026-08-12T04:50:50.360890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.340356Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"b0abd553-781d-478a-9d02-0c236f2ef093","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.159126Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:ee0fca9457caa002901d5375b82ce24e2eff6364ea1f85a53dbef14249585881","observation_id":"d04cfc0d-8b61-4f46-8337-7be81cf38622","resolution":{"observed_at":"2026-08-12T04:50:50.345267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10797","last_updated":"2025-02-19T06:00:55Z","snapshot_observed_at":"2026-08-12T23:41:55.204742Z","submitted_at":"2024-06-16T03:45:45Z","title":"STAR: Scale-wise Text-conditioned AutoRegressive image generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10797","snapshot_observed_at":"2026-08-12T04:50:49.164789Z","title":"Star: Scale-wise text-to- image generation via auto-regressive representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.164789Z"},"links":{"cited_paper":"/paper/2406.10797","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:fd55e6c8a5b6b8afb0952ce51434c0836a06d3cb0b28256197c41d01dfa87439","observation_id":"5a2dbbc2-3bf4-42ed-a432-57ed16b64da5","resolution":{"observed_at":"2026-08-12T04:50:49.164789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.324998Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":"ae698091-8c09-4731-84aa-d0a7f5a6552a","year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.169597Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:cd53cb0dea1e08373ad9eebb1dfed118b28390ec0a577f79a4b8bcd822612a70","observation_id":"94eba859-1dda-4caa-81f4-cecbf18da7ae","resolution":{"observed_at":"2026-08-12T04:50:50.329938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.309278Z","title":"Watch your steps: Local image and scene editing by text instructions","venue":null,"work_id":"950001e0-9cb4-4a38-b1a8-61bf3b4c542a","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.174342Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:5dc401dbd67ac9b6e7d44ebd7991fe7dd8c6188745ce8495c2d731b3dd5aa265","observation_id":"4d7e444b-6c78-4263-bf1c-57d946bbedc4","resolution":{"observed_at":"2026-08-12T04:50:50.314971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.178909Z","title":"Null-text inversion for editing real im- ages using guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.178909Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:f27a5056d7f8ee5b346df54bce56f605edc2a827108dee1bc2574574e4ba438c","observation_id":"6c227a90-fd98-4521-8a7a-606aad5a5a62","resolution":{"observed_at":"2026-08-12T04:50:49.178909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.283440Z","title":"Visual instruction inversion: image editing via visual prompting","venue":null,"work_id":"e71e3200-b693-498e-af2e-933ac266ebb6","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.183702Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:aee97b87bf823830525c84a546b8fec19a96f8a7285d84856b668a2a4fbaf5e0","observation_id":"ccb5e8b5-db28-4486-919e-66f675d78a5a","resolution":{"observed_at":"2026-08-12T04:50:50.288670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.188120Z","title":"Swiftbrush: One-step text-to-image diffusion model with variational score distilla- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.188120Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:e0572abbf7be91d8bb45e13be1a4b985f70bc6d0fb9d406ef8b973d5aa299d4d","observation_id":"77e8225d-7c1d-4ba5-b992-fbc5bbb713b4","resolution":{"observed_at":"2026-08-12T04:50:49.188120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-12T04:50:49.192908Z","title":"In- context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.192908Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c393d48e0dd074596ef4f2f4065c5106a5ce10f2f289af8519efdc40dc7cb3ff","observation_id":"5dc0784b-50d1-486c-acb5-ac55f5d3facf","resolution":{"observed_at":"2026-08-12T04:50:49.192908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.255596Z","title":"Editing implicit assumptions in text-to-image diffusion models","venue":null,"work_id":"de938b8d-5ab2-4f94-baec-06c654975ec2","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.197556Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:40d040318957c0d5a764872acb01a88674bc350870448275ba40dc949d0506a5","observation_id":"6f38064d-7310-4111-a58d-0d1f9968d45f","resolution":{"observed_at":"2026-08-12T04:50:50.260748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.239764Z","title":"Effective real image editing with accelerated iter- ative diffusion inversion","venue":null,"work_id":"01ea2105-b2b6-4e5a-af2f-b20dbe9fe104","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.202106Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:a58ac2e80f0f639bbf2f6682c0b1660e218c01d36356d0a51b08dc638453fd06","observation_id":"c1c4d7f9-2ec4-40e2-b938-2aa0045c72af","resolution":{"observed_at":"2026-08-12T04:50:50.244675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.223432Z","title":"Precisecontrol: En- hancing text-to-image diffusion models with fine-grained at- tribute control","venue":null,"work_id":"52f30ebc-51ae-4572-8f06-aae23930be9c","year":2025},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.206707Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:1d1d05f54adedf96b60674804ce23252b0951776ea0169a9e85fd1a948d2a7ba","observation_id":"61b9e750-79d9-442d-ab5b-15f9306eeb80","resolution":{"observed_at":"2026-08-12T04:50:50.228279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.208020Z","title":"True few- shot learning with language models","venue":null,"work_id":"0250ef2f-ca6c-4b2f-b99f-25e8ce1e5336","year":2021},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.211022Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:4e41cd0eb2b30de2c6209b3a2d06206e3a98f476869be54559337cbcd983ff69","observation_id":"6f51dc45-e4e1-46f9-be90-46257cbfcb66","resolution":{"observed_at":"2026-08-12T04:50:50.212993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.192064Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"eb449cab-4c55-4fff-bf71-47f22dc7e1db","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.215637Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:1a525e11a845e9480f55ea5a8d90bc287f63319e1b563cc619dd746d80861ae9","observation_id":"d09ed24f-437c-4b2a-bb06-4cbe5fa00ce2","resolution":{"observed_at":"2026-08-12T04:50:50.197379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.220494Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.220494Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:24182b430dd40fd232b09243f1e0ff15b684d4efb36f85382e74173b298bb64f","observation_id":"5f95d10b-3589-4797-817a-56ad676ca7e0","resolution":{"observed_at":"2026-08-12T04:50:49.220494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.225121Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.225121Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:8df68a3e812274984b47cdf18c0b49d0b9de89490b3f41d34e06571df165fde3","observation_id":"f2811d2f-f15d-4fdf-9682-c18b7ecaf352","resolution":{"observed_at":"2026-08-12T04:50:49.225121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-12T04:50:49.229740Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.229740Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:e952187d9fad29ec022e7674e8804e5a69333d5ba965d742d97ec7d70eb812cb","observation_id":"dff739f4-a601-4e43-8cba-790e15407c08","resolution":{"observed_at":"2026-08-12T04:50:49.229740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.234585Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.234585Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:a92a0dd445d5869b761fa03184ebcd4b31786740133ff473563de441c7ab31b6","observation_id":"1d16b7d2-e0b5-42c5-9c07-e62aec1fb9c7","resolution":{"observed_at":"2026-08-12T04:50:49.234585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.239163Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.239163Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:a7a72c3965aadf46c437ddca39e98e2e855926d59b76fb31d91af0caff90fef1","observation_id":"ed47628d-45e0-4c27-9934-2039ed92315f","resolution":{"observed_at":"2026-08-12T04:50:49.239163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.137062Z","title":"Towards more unified in-context visual un- derstanding","venue":null,"work_id":"36aa2429-bdf5-43c4-a1c1-d46995965d24","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.243734Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:4643b462c41f6c409132a5717dd0a4e0ec868e1cc7d3bb49a274d2dd6834c770","observation_id":"b029c63b-4561-4006-9a52-1c8300393e3b","resolution":{"observed_at":"2026-08-12T04:50:50.141887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.121585Z","title":"Emu edit: Precise image editing via recognition and gen- eration tasks","venue":null,"work_id":"3bda2601-7e60-47cc-ab8f-e0241887a2a3","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.248312Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:e057463570ce617dc53a6209944f4140cf91a9c06df8d005fa64c14b4de3df9a","observation_id":"bed095a8-98d4-401c-a9ea-37c7e6087eeb","resolution":{"observed_at":"2026-08-12T04:50:50.126573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.106794Z","title":"Diffusion image analo- gies","venue":null,"work_id":"9fcdeff9-96f4-4955-bf16-31898f944c82","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.252807Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c590c146e0d45517b3143266086815f18bf3276a33b3fc23a55db5f877f8b7c7","observation_id":"c5eba021-39b3-46fa-a73a-2238c59c071e","resolution":{"observed_at":"2026-08-12T04:50:50.111422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-12T17:57:54.262483Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-12T04:50:49.257448Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.257448Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:b9e4dc91f9a94c41bd7e9017d60b529807421a30cfda627d22f1f64d9c0215ac","observation_id":"cc3b2b50-102f-47c8-8c2d-aebe6a17deb0","resolution":{"observed_at":"2026-08-12T04:50:49.257448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.091831Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"b5660b6a-4b84-46a6-8e25-70eb6f1ec2c5","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.262189Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:76ad02199486e2b0d169d665cb9c0f9627f0f0675047e24ab141e5e2b62c41a3","observation_id":"5aef0648-b7cb-447d-b6b1-6cae5e0746f9","resolution":{"observed_at":"2026-08-12T04:50:50.096723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.075541Z","title":"Generative multimodal mod- els are in-context learners","venue":null,"work_id":"0e3123d1-7f18-4aa3-9b47-aec247def0a1","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.266610Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:f51d8828a928519a171681b2ca579d436200a3ccff138a56fc40df1764c9e173","observation_id":"dc8e0ac2-4975-4b76-8973-798f14f1054c","resolution":{"observed_at":"2026-08-12T04:50:50.080487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.060423Z","title":"Imagebrush: learning visual in-context instructions for exemplar-based image manipulation","venue":null,"work_id":"70893f9b-73a3-42a9-8f7a-fbf5e8a45ef7","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.271112Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:63876e3c6d40ca11095674998321ade3f57883e66bf7e07864646348975f8747","observation_id":"f09ff6ce-4aba-4aa8-b7c7-a14a61329b2d","resolution":{"observed_at":"2026-08-12T04:50:50.065599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.044774Z","title":"Rethinking and improving visual prompt selection for in-context learning segmentation","venue":null,"work_id":"25b5e235-90f8-44b3-a3ef-eebf20b732b6","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.275744Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:6030de8c0575911884d581579ada07ea6c1b5af2aad910f5bd144f55a0f8b639","observation_id":"2cd2823c-4bb5-486f-8f16-e4e0ba6f4c13","resolution":{"observed_at":"2026-08-12T04:50:50.050054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.028506Z","title":"Cognitive load during problem solving: Ef- fects on learning","venue":null,"work_id":"1f030d05-9a61-4ab5-9504-bf652af84d63","year":1988},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.280195Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:cb2afafef8c9ae71e20fc877c99a268bea5596e5fc75074d7cc8d93a9959076b","observation_id":"9d92ecdb-2ea9-4f87-ae6d-f81c3459b945","resolution":{"observed_at":"2026-08-12T04:50:50.033456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:50.013033Z","title":"Codi-2: In-context inter- leaved and interactive any-to-any generation","venue":null,"work_id":"b13346ea-0f3f-4d8c-a348-eafd7b30d3f0","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.284699Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:83166e6466a8a1f8885d2efb3bdabab07fccabc04a7245d22e1d18663a8b7dcc","observation_id":"1f9602eb-e4d2-4d8a-b9d5-c1c61eaac87b","resolution":{"observed_at":"2026-08-12T04:50:50.017976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-12T04:50:49.289474Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.289474Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:8f4edf11607d994e4b2856e84b384780dad68a63d134e74e896556f0e357476d","observation_id":"1957869c-cf8d-4da1-b66c-63aa5d54a2cb","resolution":{"observed_at":"2026-08-12T04:50:49.289474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.996942Z","title":"How to grow a mind: Statistics, structure, and abstraction","venue":null,"work_id":"6a946fc5-b68e-4c55-a0fa-a42066848349","year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.294581Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:454816cab62d9a457989b479cca880321389cc5b437d570dab4aee88dc3a421e","observation_id":"b9d81c44-c1b1-422c-ac07-1ce507fa7d5d","resolution":{"observed_at":"2026-08-12T04:50:50.001965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.981048Z","title":"Visual autoregressive modeling: Scalable image gen- eration via next-scale prediction","venue":null,"work_id":"f0a2596e-6c5e-4d44-b9b2-123d19cfe8d5","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.299257Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:ca3915594ab2f72b7424b7985983dbd3e95d666c16ce5903ba8d87d0bee7c2bc","observation_id":"2e155071-68fc-4fc6-9c3c-0fb851ccc12d","resolution":{"observed_at":"2026-08-12T04:50:49.985962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T04:50:49.303712Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.303712Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:8c42a995ee257a9d6dd10557e39304c0f1243ab152fd8c7e4032d2df039d0874","observation_id":"7c8a8970-2b8f-4d8b-8592-aa571bb076a8","resolution":{"observed_at":"2026-08-12T04:50:49.303712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.966053Z","title":"Edict: Exact diffusion inversion via coupled transformations","venue":null,"work_id":"41e3b5aa-1f39-4cb8-ac16-c05ff3a32e49","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.308288Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:21d06f2951cfec138b2e37217a7daed2119f943d22ffcda02bf3f253936f0183","observation_id":"b9840747-8159-45c9-b350-76927afe851f","resolution":{"observed_at":"2026-08-12T04:50:49.970856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09616","last_updated":"2025-03-09T11:58:01Z","snapshot_observed_at":"2026-08-13T00:54:03.402440Z","submitted_at":"2024-03-14T17:52:31Z","title":"Explore In-Context Segmentation via Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09616","snapshot_observed_at":"2026-08-12T04:50:49.312831Z","title":"Explore in-context segmentation via latent diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.312831Z"},"links":{"cited_paper":"/paper/2403.09616","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:9d29f5099b188b7a740d9c0e0294d5b44106d3dfd669d5ac67ce1a9052e1afd3","observation_id":"7fb96bbf-4a92-49ee-a45e-24395db5a77a","resolution":{"observed_at":"2026-08-12T04:50:49.312831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.317769Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.317769Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:07bd87bc2479f0f023c825f398da4ea51c5fa462365fe6bcab70e9265b041696","observation_id":"c3e57cf5-eebc-4bb1-a4c6-e553d7fa561f","resolution":{"observed_at":"2026-08-12T04:50:49.317769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.940807Z","title":"Seggpt: Segmenting ev- erything in context","venue":null,"work_id":"3d83d9c3-d980-4dd5-8d7f-8c36a12d7c55","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.322422Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:6c190236cd0889f2c2942e60c49dbc4ceabb11de083fb5a4eb73cd4124559f13","observation_id":"33a61fbc-7a86-473b-a7ac-a61bddb8f924","resolution":{"observed_at":"2026-08-12T04:50:49.945690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-12T04:50:49.327105Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.327105Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:26dc3e05c90ba10d2dadf98da7f1bacce35e64b2c5bb68acd397e9d5d9798b13","observation_id":"2c0cfb8f-7b2a-4747-ad94-f0d3891f471d","resolution":{"observed_at":"2026-08-12T04:50:49.327105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.923963Z","title":"In-context learning unlocked for diffu- sion models","venue":null,"work_id":"f6eb1efb-119d-4b1f-80c8-47564a8afbd5","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.332100Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:10f43300f984de89a2bf33b584638b6ff96c725b0ab9255f28b8a2f048ccc1c6","observation_id":"3999a648-31b7-4ea8-8165-4f370addb7fd","resolution":{"observed_at":"2026-08-12T04:50:49.929550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.908166Z","title":"The learn- ability of in-context learning","venue":null,"work_id":"6d55f262-1c63-45dd-857e-37b1470b79b3","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.336569Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:8f2a2aa9caae6ec377bfc5aa34bd5619b9ac62bea3ce787bad34e44bac7615b9","observation_id":"8dd952f5-0926-4001-a046-19c665053bf9","resolution":{"observed_at":"2026-08-12T04:50:49.912859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-12T22:43:04.703395Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-12T04:50:49.341022Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.341022Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:ff37fa9353dfafb0bc7bb5e27ff813616955506592412857d932beeee7b2bf13","observation_id":"5566c6a6-e839-49b2-853b-3f927c3c0fa1","resolution":{"observed_at":"2026-08-12T04:50:49.341022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-12T04:50:49.345818Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.345818Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:421e9294f4438742f435d7f2ac79374ca7946b0629fa0a3708c8109aa2960b43","observation_id":"d7961126-1edb-46f5-88ce-2ef177b4b95b","resolution":{"observed_at":"2026-08-12T04:50:49.345818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.892839Z","title":"To- wards global optimal visual in-context learning prompt se- lection","venue":null,"work_id":"a1431709-a294-4842-91de-b624241a55cc","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.350813Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c0229a85b8dc535bce08182140129a22a40d8a875ea261d796ecf872ce3bcdc7","observation_id":"1e10c7fc-137b-467a-aea1-660224a9b7f0","resolution":{"observed_at":"2026-08-12T04:50:49.897644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.877238Z","title":"Improv: Inpainting-based multimodal prompting for computer vision tasks","venue":null,"work_id":"97c2d6d1-fc53-4659-824d-0b189aeb163a","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.355291Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:4b6e449d2c0793da342e2c6f3058af8091e348bc19c5aa1c695f500f2ab8c6fc","observation_id":"a35469e6-92ec-4cb9-9e69-aa868b5fec94","resolution":{"observed_at":"2026-08-12T04:50:49.882072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.861693Z","title":"Prompt-free diffusion: Taking” text” out of text-to-image diffusion models","venue":null,"work_id":"6ec0d2ae-5f21-4952-be29-155ffc6ceaa3","year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.359799Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:b68131d6bb5d0aa632bc86f6e90809dbe6bac4de45a02833578537bfc1a5e878","observation_id":"34e43b7a-a490-4f44-87bb-17f9d9b94885","resolution":{"observed_at":"2026-08-12T04:50:49.866525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-08-13T04:15:20.480186Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-12T04:50:49.364318Z","title":"Anygpt: Unified multimodal llm with dis- crete sequence modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.364318Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:82420a5045128562c6a8adabae983035efd962c1a9ea5a65c155c4ec6decc87a","observation_id":"d883f07f-3acf-4ee2-83ae-83f1320fcc67","resolution":{"observed_at":"2026-08-12T04:50:49.364318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.846440Z","title":"Magicbrush: a manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"3d2e634b-c7b6-41c3-9958-aa2a52ff0eb9","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.369597Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:3d39a4a89b65a0bb07a55fb2be045b85852e780ef2d0e0bd570bc81165ab6c7e","observation_id":"409eb0b5-e82f-4c9b-91aa-d84bfe430e23","resolution":{"observed_at":"2026-08-12T04:50:49.851446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.374025Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.374025Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:9842b4c942eab3ddc29cc5e2ca989b6aded4ea49748eb68a047955a624849a9f","observation_id":"9b9caa51-1566-411b-a6cb-ca3cfa8ee9af","resolution":{"observed_at":"2026-08-12T04:50:49.374025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.820569Z","title":"What makes good examples for visual in-context learning? In Proceed- ings of the 37th International Conference on Neural Infor- mation Processing Systems, pages 17773–17794, 2023","venue":null,"work_id":"1928f0d7-ebe3-4820-ae94-a80325e67a79","year":2023},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.378517Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:de87e37d4ebd17d03edf2149e8976455bfe996f86fcf57ab4068dca489338b79","observation_id":"338b89d5-f98c-44bf-8b3f-3f69f603271a","resolution":{"observed_at":"2026-08-12T04:50:49.825502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18660","last_updated":"2024-03-27T15:03:38Z","snapshot_observed_at":"2026-08-13T17:03:42.584339Z","submitted_at":"2024-03-27T15:03:38Z","title":"InstructBrush: Learning Attention-based Instruction Optimization for Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18660","snapshot_observed_at":"2026-08-12T04:50:49.383104Z","title":"Instructbrush: Learning attention-based in- struction optimization for image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.383104Z"},"links":{"cited_paper":"/paper/2403.18660","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:c84409d7b5b7531b5c842af568dd9793719cb7a32879c9d1ed5e68aefc89d0d0","observation_id":"cc003e2c-a4eb-4b79-81de-68521e201cc2","resolution":{"observed_at":"2026-08-12T04:50:49.383104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.804612Z","title":"Calibrate before use: Improving few-shot perfor- mance of language models","venue":null,"work_id":"f452659d-2a76-4ccb-bf43-584b81385d3d","year":2021},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.387913Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:212baf9a6e3ad66ee3089057df8f7dbceef275f47b3f6e84cf59fbc0eaf8763c","observation_id":"6e70062c-9bd1-4171-859c-82d4f202e702","resolution":{"observed_at":"2026-08-12T04:50:49.809961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-12T04:50:49.392554Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.392554Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:a0459498adc27caf5eba7a12fd5e4df50f3602e3a6cfb288d82ffc905c71100d","observation_id":"af8c770f-4c1f-4ab4-9229-7a16fef69820","resolution":{"observed_at":"2026-08-12T04:50:49.392554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:50:49.786788Z","title":"As a baseline of text-guided image editing model, InstructPix2Pix is trained only with textual instructions","venue":null,"work_id":"387a2a78-7fbe-4604-8102-41fe01f09a30","year":null},"citing_paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T04:50:49.398206Z"},"links":{"citing_paper":"/paper/2412.01027"},"observation_digest":"sha256:69df9da7a83a5c7e0cd71452786f72e1cbbb7131d8a65bb3da35c92f15bfac2f","observation_id":"63076f3f-b888-4aae-8263-6352e5166f4c","resolution":{"observed_at":"2026-08-12T04:50:49.793577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01027","last_updated":"2024-12-03T03:32:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T06:31:20.649320Z","submitted_at":"2024-12-02T01:19:21Z","title":"Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2412.01027."}