{"as_of":"2026-08-09T11:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54c9baa18a21e2ed0deefb946e42df52ae97d3bb1249d905055ef9121ad5ea28","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:36:29.720331Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.07544/citation-record","integrity":"/paper/2602.07544/integrity","json":"/paper/2602.07544/citation-record.json","paper":"/paper/2602.07544"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.478436Z","title":"On the effectiveness of ViT features as local semantic descrip- tors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.478436Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:4dedcd8d020fa8ff120c87731c62d13b79e3ef923423cee4b87cf3b51018be41","observation_id":"d237e5a2-c2b6-4e77-adc9-d14e8e39ca9b","resolution":{"observed_at":"2026-08-03T03:36:29.478436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-07-06T07:30:18.170401Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-03T03:36:29.483883Z","title":"Burgess, Loic Matthey, Nicholas Watters, Rishabh Kabra, Irina Higgins, Matt Botvinick, and Alexander Lerchner","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.483883Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:f744b4d6bbbee628d44505e645efa3cfc64c95e1b22564f156bb36f511b176e4","observation_id":"05ac3a7b-0a74-4eab-b736-d4573292f149","resolution":{"observed_at":"2026-08-03T03:36:29.483883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11829","last_updated":"2024-10-15T17:55:22Z","snapshot_observed_at":"2026-08-02T22:25:06.603967Z","submitted_at":"2024-10-15T17:55:22Z","title":"MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11829","snapshot_observed_at":"2026-08-03T03:36:29.489126Z","title":"MMFuser: Multimodal multi-layer feature fuser for fine-grained vision-language un- derstanding.arXiv:2410.11829 [cs.CV], 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.489126Z"},"links":{"cited_paper":"/paper/2410.11829","citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:462e8a9870d833859bb0b498e42b940fed4ee6dc4e19ce500552124eb133bedf","observation_id":"00fdf60d-60db-47f4-903e-d5d4a14d023b","resolution":{"observed_at":"2026-08-03T03:36:29.489126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.494340Z","title":"Unsupervised learning of visual features by contrasting cluster assignments.NeurIPS, pages 9912–9924, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.494340Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:aa31e499a5c79204f115ef08e91ee5174e24e6d234a3cb127c247cff480efb2a","observation_id":"d09ef0cf-36ce-4b03-adfd-741dc4a4e588","resolution":{"observed_at":"2026-08-03T03:36:29.494340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.498724Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.498724Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:e63aa76f5ccae4f1de5164e644935a4a2d392adcbe7aaa642fad95b5339c13db","observation_id":"25225bf7-016e-4bbd-a9c7-567f37ac0508","resolution":{"observed_at":"2026-08-03T03:36:29.498724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.503207Z","title":"Learning phrase representations using RNN encoder–decoder for statistical machine translation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.503207Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:bf0d9f1eed19bbe026ed2c64b33064c7a75a6342eb03a3c09945ba35e4412298","observation_id":"97fdf7e7-d4f6-480c-b014-6f93ffba95ce","resolution":{"observed_at":"2026-08-03T03:36:29.503207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03326","last_updated":"2024-01-08T21:19:30Z","snapshot_observed_at":"2026-08-01T14:23:46.656339Z","submitted_at":"2024-01-08T21:19:30Z","title":"Slot Structured World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03326","snapshot_observed_at":"2026-08-03T03:36:29.508268Z","title":"Moerland","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.508268Z"},"links":{"cited_paper":"/paper/2402.03326","citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:e687f3d358bcbc778a9164d39f0e8e1323f1b7b1d944c9f253ee202c42bf831d","observation_id":"96dd4671-e4e5-4e5c-8401-2cf03b91ad53","resolution":{"observed_at":"2026-08-03T03:36:29.508268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.512996Z","title":"Zero-shot object-centric representation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.512996Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:9716e327649b07d57da64597e5c8391c5c75d230bc79b5f87e06881ccf025592","observation_id":"6e134d80-8702-4a1e-bde5-9255c1e27474","resolution":{"observed_at":"2026-08-03T03:36:29.512996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.517482Z","title":"General- ization and robustness implications in object-centric learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.517482Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:78e419389de355202c4613dfaace6923636376cda77cf6917d3feefdf900467b","observation_id":"ca580e3b-67cb-4703-b8e8-90ad2638398c","resolution":{"observed_at":"2026-08-03T03:36:29.517482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.521745Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.521745Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:51645d487a73c7667c2e402d514b12847aa63cbc9999208eb517e6ad23bddd6e","observation_id":"433913a5-2bae-4a6f-b9ca-1d2e17e79d15","resolution":{"observed_at":"2026-08-03T03:36:29.521745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.526643Z","title":"Kosiorek, Oiwi Parker Jones, and Ingmar Posner","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.526643Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:cc8d55a626aa7c1f46a168f9288393d92b64d879eb40520231a11117681916b7","observation_id":"ed7242d6-c7cd-4f23-abca-2251b671d85a","resolution":{"observed_at":"2026-08-03T03:36:29.526643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.531389Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.531389Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:ddd03796cacbbcbe8f39cb9b012cdbf23a5a4a450a588707cbbbea94808686cd","observation_id":"98c6798d-ed60-4a41-abaa-c21bcca685f9","resolution":{"observed_at":"2026-08-03T03:36:29.531389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.535816Z","title":"Williams, John Winn, and Andrew Zisserman","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.535816Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:bb5890e74915fbf0fca2d99edb98f813eaa368e3121801dad3a90b51acd7a255","observation_id":"5606e3d4-aa7e-46e2-b993-f726363d8b54","resolution":{"observed_at":"2026-08-03T03:36:29.535816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.540019Z","title":"Vision meets robotics: The KITTI dataset.IJRR,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.540019Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:930c2b34ee1c62dc2a8d856907cfbacfcd2b5d5bead9cd5e514a976008dc5bf2","observation_id":"d43dd27d-0187-4700-87d6-f4f00a8b76d1","resolution":{"observed_at":"2026-08-03T03:36:29.540019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.544301Z","title":"Multi-object representation learning with iterative variational inference","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.544301Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:adf6c771218a2ea5b521732a9f9b39d1f36e8376af3353b2e73f5cca417cbaab","observation_id":"dab43100-a02e-44c2-8bd9-d5f06fb1fe0e","resolution":{"observed_at":"2026-08-03T03:36:29.544301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.549050Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.549050Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:74e1861ca97d58499d88aef197be67904d10b10f199ccfd25ada7a34c0039541","observation_id":"16d0b308-6dc0-4c5e-99cc-3a8eb3b3c70c","resolution":{"observed_at":"2026-08-03T03:36:29.549050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.553100Z","title":"Fuchs, Ingmar Posner, and Andrea Vedaldi","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.553100Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:d83f732b4c12aa6dabc3bcedcc69511f5593da6a02a4092a4ebeb7369ba630ab","observation_id":"fe37d488-5106-495c-a56f-7358dd9b37f9","resolution":{"observed_at":"2026-08-03T03:36:29.553100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.557413Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.557413Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:c3a3732d434acf77fe55daa1c148030d5337eff1278015b6ef947f635763dd68","observation_id":"7d709c26-d2ec-4bd4-91f7-ace85abbbdba","resolution":{"observed_at":"2026-08-03T03:36:29.557413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-03T03:36:29.561584Z","title":"Bridging nonlinearities and stochastic regularizers with Gaussian error linear units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.561584Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:cfb66fa8c8d750ae3be23fa516af796c2c46fc555458f62d3cf4ccc0107a242e","observation_id":"6b00d2fc-5484-4e45-bc88-3f95c478b556","resolution":{"observed_at":"2026-08-03T03:36:29.561584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.566548Z","title":"Visuomotor control in multi-object scenes using object-aware representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.566548Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:8efa4a3feef230b31fb864655cfba5efbbbb88ee9d77a79f00d2e13361ec44a5","observation_id":"205903df-d635-4ca2-8a70-301f03f9234c","resolution":{"observed_at":"2026-08-03T03:36:29.566548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.570580Z","title":"Improving object- centric learning with query optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.570580Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:ad76fe86767b14f8d7158046060988e5f26f6cde1a08ba589a02cfcc4c72dea6","observation_id":"8c96dd62-a8ac-476e-a352-865f8c3662db","resolution":{"observed_at":"2026-08-03T03:36:29.570580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.574822Z","title":"Scalor: Generative world models with scalable object representations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.574822Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:29a11293e76a6af7c10aa0502d3a633b162da52b398e62e844adfdad82533dd7","observation_id":"016493b4-becb-4f66-89be-e4302fb16408","resolution":{"observed_at":"2026-08-03T03:36:29.574822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.579400Z","title":"Object-centric slot diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.579400Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:dd8c249a60b33a6ec4bdb2679401a363afacc927fd9008a4f61ffcc84a5e4348","observation_id":"0703ee58-4b4d-4764-83ec-aaf9d0a6bd16","resolution":{"observed_at":"2026-08-03T03:36:29.579400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.583993Z","title":"Denoising criterion for variational auto- encoding framework","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.583993Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:dac5cf47e5b2699596dce3cca80c5511c6adb655f3b11019289c30d3d1206971","observation_id":"2493fb3d-80ea-43c8-aec9-f29923163d63","resolution":{"observed_at":"2026-08-03T03:36:29.583993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.588643Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.588643Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:3de159bd26d7da153a34641572c09681da1558feea62434fdc08db66b7f75def","observation_id":"48b1c2bd-ecf6-4b93-a0b2-8e014e7d50ce","resolution":{"observed_at":"2026-08-03T03:36:29.588643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.593132Z","title":"SPOT: Self-training with patch-order permutation for object-centric learning with autoregressive transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.593132Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:61ab4965facc82ad4dd86beba6136ee4f1bc400fa853f6f2d722524675c6ba26","observation_id":"d59ca423-642a-41e6-8200-34b9b3a83564","resolution":{"observed_at":"2026-08-03T03:36:29.593132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.598786Z","title":"Clevr- Tex: A texture-rich benchmark for unsupervised multi-object segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.598786Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:6ddb957bfaedb53dd689da5ba1cc2b4c7d6c1e0d44570f3914f76615483f0865","observation_id":"4e21eef9-c25c-4c81-b781-13b83e637d0c","resolution":{"observed_at":"2026-08-03T03:36:29.598786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.603921Z","title":"Bootstrapping top-down information for self-modulating slot attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.603921Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:b3024e8cc5bda9d4442478769df8c6d314bd08ed68dfaf436e9d4b1dc147c715","observation_id":"5035bd08-cb61-493a-bfee-1d39018fed93","resolution":{"observed_at":"2026-08-03T03:36:29.603921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.608452Z","title":"The perception of hierarchical structure","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.608452Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:9ce36cd948216146b0ca551f986ce96d82220d7eeb69b95ce5cfb2c92a123b2f","observation_id":"bf66e2d0-d1d0-4105-8e37-fffdf283ac03","resolution":{"observed_at":"2026-08-03T03:36:29.608452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.612681Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.612681Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:26ed9cb47fe8da3718e1d873604f8d1aa340d24cb61e6bb278162e7e7d9bf3c3","observation_id":"1b8b10e4-024e-45ab-aea9-43e453886bb3","resolution":{"observed_at":"2026-08-03T03:36:29.612681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.616869Z","title":"Elsayed, Aravindh Mahen- dran, Austin Stone, Sara Sabour, Georg Heigold, Rico Jon- schkowski, Alexey Dosovitskiy, and Klaus Greff","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.616869Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:fa2267a5c0a16e05edb03f10288de65b76b5fb9bf6b16870ac395268c3022f8a","observation_id":"0a286c3f-ce50-4f85-b4a5-b9b899bdc238","resolution":{"observed_at":"2026-08-03T03:36:29.616869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.620976Z","title":"Sequential attend, infer, repeat: Generative modelling of moving objects.NeurIPS, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.620976Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:b7f80be8434e7c73b78b52d8c1ac9d87f5932bfa56303d5dc98267de23da2233","observation_id":"476c0b41-3e07-468d-be45-12e3cd0c4386","resolution":{"observed_at":"2026-08-03T03:36:29.620976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.625125Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.625125Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:866cf9955bb916ca61b008e43950adfbd60bef217c31411af12870450baaa2c8","observation_id":"039cff75-4b4b-42d4-8dd6-dc250d6b7314","resolution":{"observed_at":"2026-08-03T03:36:29.625125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.629484Z","title":"Scouter: Slot attention- based classifier for explainable image recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.629484Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:f8859d6d363433dbe11b34733ae9079094855430591c1257df1461c7aea12de9","observation_id":"7e2a513b-ef41-4415-8ac5-b47b55956acd","resolution":{"observed_at":"2026-08-03T03:36:29.629484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.634070Z","title":"Learning object- centric representations of multi-object scenes from multiple views","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.634070Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:80f835137f9286fec8f16b1071695a1100576ae90b7ff6a850a9b2174d0eaddb","observation_id":"8a43763a-38c6-4aa1-a5fd-fc499f0ce37b","resolution":{"observed_at":"2026-08-03T03:36:29.634070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.638477Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.638477Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:a4cbdf4c92fe4da2de89f2bee5d47f49ad73196e12ef564a99b1d88c9eea5cb5","observation_id":"0862e2d0-aa7d-40a5-924e-dc822c242a07","resolution":{"observed_at":"2026-08-03T03:36:29.638477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.642618Z","title":"Improving generative imagination in object-centric world models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.642618Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:0a41def79909012ccb30f0d2db56033f88b77b1b5a5e5b293d53d30fe0da1690","observation_id":"33cc9c76-d519-4dff-8c7e-ee4409c26de2","resolution":{"observed_at":"2026-08-03T03:36:29.642618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.647662Z","title":"Space: Unsupervised object-oriented scene representation via spatial attention and decomposition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.647662Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:d21e72e0e686b5268a7dda61fba36708c5686137a0c8901f6b97cf8e571caa4a","observation_id":"94d51749-d6c4-4af1-9760-af33b48a0154","resolution":{"observed_at":"2026-08-03T03:36:29.647662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.651987Z","title":"StructDiffusion: Language-guided creation of physically-valid structures using unseen objects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.651987Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:084acd6048859a78c8c58633f081a86e6e1f7a28b79056aaac3cd36f35564743","observation_id":"23b5db1c-1e54-4657-8c01-5a045f4e8e0a","resolution":{"observed_at":"2026-08-03T03:36:29.651987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.656623Z","title":"Object-centric learn- ing with slot attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.656623Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:01213ba12b2d5d4198fc2cdb89ef6e0c461c91a6bc89f6e6fa7516e3ca17a69a","observation_id":"ff9b2701-6954-41db-ac6f-fbbe88edea0d","resolution":{"observed_at":"2026-08-03T03:36:29.656623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.660841Z","title":"Diffusion hyperfeatures: Searching through time and space for semantic correspondence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.660841Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:8b1751c57cd3004751d9cbcc4f21c983719a9b83fa972cc9e490e5756c235554","observation_id":"d4e4c104-6d54-4934-a5ee-21fddd4f7749","resolution":{"observed_at":"2026-08-03T03:36:29.660841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-03T03:36:29.665042Z","title":"DI- NOv2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.665042Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:42bff64bf14f1f28e099a7e92d0345e3e6d9f29325a6f105595d9918247dad2b","observation_id":"7c1609e1-7114-42f2-906d-142d05c00a4f","resolution":{"observed_at":"2026-08-03T03:36:29.665042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.669635Z","title":"Barron, Ferran Marques, and Jitendra Malik","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.669635Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:fb0fb1103d2f08638b1dd6dcbc3caf71d090b4bbc42c1d3d4ae24f1a23cafcab","observation_id":"eb9dcc3d-d739-4e6d-9578-7421b06a8558","resolution":{"observed_at":"2026-08-03T03:36:29.669635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.673888Z","title":"Do vision trans- formers see like convolutional neural networks? InNeurIPS, pages 12116–12128, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.673888Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:f86cf6e8eae84bfc64a5cbd0c89c4c6b28da2221f6c1fd49451e4e723adabac1","observation_id":"135d78db-a92d-4bc1-8c49-f88112e1d008","resolution":{"observed_at":"2026-08-03T03:36:29.673888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.678373Z","title":"Bridging the gap to real-world object- centric learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.678373Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:3153e39837bb3cf23f9b121d5a7e326094a2b55d7236fb66fbe9f319f976a6e9","observation_id":"38f227af-4e3f-487c-bae9-9c73bb638a2f","resolution":{"observed_at":"2026-08-03T03:36:29.678373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.682553Z","title":"Illiterate DALL-E learns to compose","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.682553Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:3b14369b787affee9bac47601b03552d4eead7758b2db51dab5304c479de50ce","observation_id":"2e6d0bf2-7a86-4c9b-96bf-7e7a135c3bfc","resolution":{"observed_at":"2026-08-03T03:36:29.682553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.686745Z","title":"Simple unsu- pervised object-centric learning for complex and naturalistic videos.NeurIPS, pages 18181–18196, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.686745Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:b34302049f4eb0426caa6aae4783c8042ddc70fc459f6da862b98322d9b25fb6","observation_id":"20c93127-9a83-44fe-b365-c241e852d92d","resolution":{"observed_at":"2026-08-03T03:36:29.686745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00463","last_updated":"2024-03-21T14:57:25Z","snapshot_observed_at":"2026-08-01T20:56:40.460589Z","submitted_at":"2023-12-31T11:38:50Z","title":"Analyzing Local Representations of Self-supervised Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00463","snapshot_observed_at":"2026-08-03T03:36:29.690771Z","title":"Analyz- ing local representations of self-supervised vision transform- ers.arXiv:2401.00463 [cs.CV], 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.690771Z"},"links":{"cited_paper":"/paper/2401.00463","citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:88489912311901261f8b64c741e1d816ae91e5eaa12879a3f61adab75cdb4960","observation_id":"a48d8021-e74b-4205-b54f-005201879c35","resolution":{"observed_at":"2026-08-03T03:36:29.690771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.695199Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.695199Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:60e786a6c1d64fa06081e5a7e61d3c2cba33689b4b1a63cb1850910d044dfdb3","observation_id":"bb2ad601-4426-4d9b-89b3-7cb915f53d27","resolution":{"observed_at":"2026-08-03T03:36:29.695199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.699247Z","title":"Burgess, and Alexander Lerchner","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.699247Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:2dca21a951f712d3ddaf5c6f70b572923f166cffe0da24669676f7a6da47ed5b","observation_id":"c391a2bd-e935-4e42-b384-60093389dc42","resolution":{"observed_at":"2026-08-03T03:36:29.699247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.703396Z","title":"SlotFormer: Unsupervised visual dynamics simulation with object-centric models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.703396Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:d4a0eec87ebf1b2bc96e53d93e12877318d20e3a98f865a880fb6f0e0263cf45","observation_id":"98549afe-02ef-41b4-9c47-64f7b8263f38","resolution":{"observed_at":"2026-08-03T03:36:29.703396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.707807Z","title":"SlotDiffusion: Object-centric generative model- ing with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.707807Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:16558431fb636a608aec7af10bb2951a380a295756150650d14b19b4cf749481","observation_id":"a925545c-7097-4904-8627-4c7561ed2588","resolution":{"observed_at":"2026-08-03T03:36:29.707807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.711937Z","title":"Dense connector for MLLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.711937Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:31dd1b2cbe879e0f34c144f028df3b31a7c3ba56bb473040c6d00eba7f5a9074","observation_id":"b65d57fc-b766-4919-8e09-6834f43d3635","resolution":{"observed_at":"2026-08-03T03:36:29.711937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.716118Z","title":"Zeiler and Rob Fergus","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.716118Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:32cd5d2b1c2c9e7a260653f7793f4e6085e0ddcb7a35524eabd922df300abe46","observation_id":"531528f7-cb1c-42bd-8e6e-41a56708087a","resolution":{"observed_at":"2026-08-03T03:36:29.716118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:29.720331Z","title":"Implementation Details In this section, we provide a more detailed overview of the training and implementation details for DINOSAUR-M and SPOT-M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:29.720331Z"},"links":{"citing_paper":"/paper/2602.07544"},"observation_digest":"sha256:51dff4a0638d3689dd490c71fdf568c7453b368cef3f891b85ff87854796c04b","observation_id":"0a93b191-ac5f-4473-8ec4-49bd7a3c5b1f","resolution":{"observed_at":"2026-08-03T03:36:29.720331Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.07544","last_updated":"2026-06-17T14:58:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:04:56.352106Z","submitted_at":"2026-02-07T13:44:56Z","title":"MUFASA: A Multi-Layer Framework for Slot Attention"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2602.07544."}