{"as_of":"2026-08-09T11:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c13f9abace31a92be90a6fabd14eb18231f8bfc4b233cecd6fe1975ad72496e9","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:43:16.407110Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.09171/citation-record","integrity":"/paper/2510.09171/integrity","json":"/paper/2510.09171/citation-record.json","paper":"/paper/2510.09171"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:10.416880Z","title":"Augmented reality meets computer vision: Efficient data generation for urban driving scenes","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:10.416880Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:1323e41cc299ec8ff923c0f9c8aec1535efea5be9150b67a9c36d2c652c05dc8","observation_id":"d0030d60-c284-45d2-b568-2f9343a319cd","resolution":{"observed_at":"2026-08-04T10:43:10.416880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:10.489008Z","title":"Unicom: Universal and compact representation learning for image retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:10.489008Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:135d603097f6115db9f9dcc005683f0c72180b2ee98498501dd21ccd303a43cd","observation_id":"96ffab71-e94e-424b-a320-890cc29b481c","resolution":{"observed_at":"2026-08-04T10:43:10.489008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:10.555705Z","title":"This dataset does not exist: training models from generated images","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:10.555705Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:a274b5cb3f2406dc5d212c4a64b3ee1ebf3c5311921cec1f01d3331bec3e1ecf","observation_id":"02ac6ad2-5f73-4f9c-825b-4732c761d861","resolution":{"observed_at":"2026-08-04T10:43:10.555705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:10.646441Z","title":"Large scale gan training for high fidelity natural image synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:10.646441Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:00321103728ce547432b7c976f91ce44f47e0f555ccf7ce5627af4d2cc648c91","observation_id":"7139e9be-8bd5-432d-b8ae-b742cee7bda7","resolution":{"observed_at":"2026-08-04T10:43:10.646441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:10.678942Z","title":"Ove6d: Object viewpoint encoding for depth-based 6d object pose estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:10.678942Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:fb9dfad1c8f2f0eb2de6c308280aa86c548b2713ebb8b36e8302d35696c635bf","observation_id":"aa17a730-d1cb-4150-ae83-6c217830a664","resolution":{"observed_at":"2026-08-04T10:43:10.678942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:10.781167Z","title":"Unifying deep local and global features for image search","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:10.781167Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:2ac4341dc1426d6da0537d685aa526a1576f9f568f5c0fc1b7b15391621241ee","observation_id":"72c352ae-f7e6-40cf-b527-03e96a0b45ac","resolution":{"observed_at":"2026-08-04T10:43:10.781167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-07T11:28:03.211074Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-04T10:43:10.822158Z","title":"Shapenet: An information-rich 3d model repository","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:10.822158Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:5251082fac5893b9abc671cadf35e3068b1849000200b6d3fb1e7bd0a8edc3bc","observation_id":"d4e97668-46f9-4976-9d2b-75ae81eba570","resolution":{"observed_at":"2026-08-04T10:43:10.822158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:10.871455Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:10.871455Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:95a0d791fa77979fdc748d62079f6e026d94294946976d18b2c2e43b72e1061a","observation_id":"d3de06a8-4c09-43a5-aa59-7ac8138cff9d","resolution":{"observed_at":"2026-08-04T10:43:10.871455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:10.960558Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:10.960558Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:ef1a2d3d662ee305264e0ad8641f8fd943f9b4c52feadaf5dcca6989edb4f21b","observation_id":"92571c47-3be7-4458-b353-2f2bb04d9985","resolution":{"observed_at":"2026-08-04T10:43:10.960558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.000326Z","title":"Learning semantic segmentation from synthetic data: A geometrically guided input-output adaptation approach","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.000326Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:c4d37368afde9f38a8f2444dc65300226d59268ccc4bff2123ae2339a397cbd2","observation_id":"55a6289e-6b3d-4a33-b67c-fe809d5e317d","resolution":{"observed_at":"2026-08-04T10:43:11.000326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.081077Z","title":"Learning a similarity metric discriminatively, with application to face verification","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.081077Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:cdc9731872929e56e3043ace6626cebfd2de20c13aaf8a47e111443196b04eac","observation_id":"53f18c40-aaa0-4b65-b906-bd293be4ec28","resolution":{"observed_at":"2026-08-04T10:43:11.081077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.146297Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.146297Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:b5428c95cf90f7e7cf71f591e52699af06902a0b79a68bc5ef99586c4defe0fd","observation_id":"36522683-9c1f-48bc-a9bb-dcc4af599701","resolution":{"observed_at":"2026-08-04T10:43:11.146297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.212769Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.212769Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:2eab21c6a2c51e830c53bb61ffde75fcfe7c15eefefb4720af018f898defbd17","observation_id":"b7f9f8dd-f321-482b-919d-d337112f1b30","resolution":{"observed_at":"2026-08-04T10:43:11.212769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.299995Z","title":"ImageNet : A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.299995Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:facee002f6a56ced0932daedf7ac8884811e95eb892e715b0331605cbf629875","observation_id":"3703c512-0d4a-46f4-bb07-148d77f73a9c","resolution":{"observed_at":"2026-08-04T10:43:11.299995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.372304Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.372304Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:823e6c50e2e401bfac253f452bf693c839874f50d2ea6a3aef63d053b389427f","observation_id":"9cecbac1-bc71-463e-8940-bece37083d0c","resolution":{"observed_at":"2026-08-04T10:43:11.372304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.435953Z","title":"Cut, paste and learn: Surprisingly easy synthesis for instance detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.435953Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:c40f4f30caa4e62a5f59c101fff3b50c6507989ea752ccfec10021612a86c8d6","observation_id":"e4c5ec77-f5b0-4e44-bcdb-48ff74ef6fe4","resolution":{"observed_at":"2026-08-04T10:43:11.435953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.475914Z","title":"The group loss for deep metric learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.475914Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:5ba4e70d2c80b7660cd15000e51112525d7c6b640c97331297dd48fd9b97fc6d","observation_id":"098e2139-37f8-48fa-9caa-304b4c58f3bd","resolution":{"observed_at":"2026-08-04T10:43:11.475914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.555514Z","title":"Scaling laws of synthetic images for model training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.555514Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:c78c7a8989bd64b8eca3ff37895538cecf7f09cfaac7058ac26ad6fff85d93a1","observation_id":"5c61bcc5-6c99-4d1c-ad45-808cccd51558","resolution":{"observed_at":"2026-08-04T10:43:11.555514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.630100Z","title":"Instructdiffusion: A generalist modeling interface for vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.630100Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:34a9482baf587be7d3e820e9d47769182601fa99430ae3e1af2c99d672043350","observation_id":"aa7599fb-ef35-443c-bbf8-62485f6a30b1","resolution":{"observed_at":"2026-08-04T10:43:11.630100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.07836","last_updated":"2017-09-08T00:29:55Z","snapshot_observed_at":"2026-07-06T05:31:22.319094Z","submitted_at":"2017-02-25T06:04:42Z","title":"Synthesizing Training Data for Object Detection in Indoor Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.07836","snapshot_observed_at":"2026-08-04T10:43:11.736293Z","title":"Synthesizing training data for object detection in indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.736293Z"},"links":{"cited_paper":"/paper/1702.07836","citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:bff4fa19004b7085dbb4c3c683829790549f321a703dbaee8e4476138370f4e5","observation_id":"6df2a2f3-158f-4ba1-92c5-e119cf8b9f55","resolution":{"observed_at":"2026-08-04T10:43:11.736293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.807514Z","title":"Revisiting the fisher vector for fine-grained classification","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.807514Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:5c191809e07ec1fc81dc694962ee53e969a7af5ad3de6cd5fd0aebf44b7c97f4","observation_id":"01fd1472-ef12-4bb9-9103-66ec3782c742","resolution":{"observed_at":"2026-08-04T10:43:11.807514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.870084Z","title":"Dimensionality reduction by learning an invariant mapping","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.870084Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:b2b5d5bdf0e0184195d3904c7f27bcb086896023df3f434334e595696a56a7af","observation_id":"a3e0034e-8ec9-4883-b3f0-702bb6a40848","resolution":{"observed_at":"2026-08-04T10:43:11.870084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.923435Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.923435Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:e8bae00533c07387d3673dc9822866f238bc8ab19a242d8f4e850a476742a281","observation_id":"c968f2ed-e360-4961-803e-b8ba430b0933","resolution":{"observed_at":"2026-08-04T10:43:11.923435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:11.991038Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:11.991038Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:a12dcd1c8be23f88db1383c46b09c3c6d7039d3fcf7c67f5edf870a959b50bc5","observation_id":"8d0c8fc1-a737-4b63-9df1-18c4a2f240ac","resolution":{"observed_at":"2026-08-04T10:43:11.991038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.046262Z","title":"Local descriptors optimized for average precision","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.046262Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:1c242f4603b58c8bb52510b3e7a0a2af95630db34452b6f7fbe9c438b7412512","observation_id":"6176a15b-ebde-4e71-a371-b26811d0590e","resolution":{"observed_at":"2026-08-04T10:43:12.046262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T10:43:12.103216Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.103216Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:52d712e53f64172883157748ae97e5139fed1a14e50216dca00edc32d66433c9","observation_id":"2d44f649-29dc-4f19-9001-e7f8b6af1534","resolution":{"observed_at":"2026-08-04T10:43:12.103216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.180737Z","title":"Proxy anchor loss for deep metric learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.180737Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:212415d806c18ef5f4675b7bd0b9195893351114288fa1a3bd054ab3312375b8","observation_id":"e3d27429-0b7d-4911-8cb5-339911d7cfb8","resolution":{"observed_at":"2026-08-04T10:43:12.180737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.254844Z","title":"Self-taught metric learning without labels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.254844Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:010c2096afea4fab62921ed8c91e8c11b7cd8e62fc4b67a1184bbe13e65c514c","observation_id":"a42a7c18-79dd-4118-a9dd-2f190269a681","resolution":{"observed_at":"2026-08-04T10:43:12.254844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.333687Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.333687Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:10beb6144821078b430e5e6e6b8d81c1b6dd1537bfd781457f559245efee0f3d","observation_id":"894b2649-e8c7-40b7-b268-45c744cadde2","resolution":{"observed_at":"2026-08-04T10:43:12.333687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.390500Z","title":"ILIAS : Instance-level image retrieval at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.390500Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:673527847cf4c703bcd5c8f13d0959af7823c8032eb3528facf5c22ebcb1615e","observation_id":"f8de048a-74ca-46be-91b3-c013d12c4f70","resolution":{"observed_at":"2026-08-04T10:43:12.390500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.480406Z","title":"Cross-image-attention for conditional embeddings in deep metric learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.480406Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:23eea594b6bc7bc14f651379135f916f9b051f9f3ffff546029c56a11776fae8","observation_id":"d6530e40-5899-417d-ac89-db6e45548203","resolution":{"observed_at":"2026-08-04T10:43:12.480406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.539773Z","title":"Fine-grained recognition without part annotations","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.539773Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:3197cb1316288c7eb804c43b1a488e0d09b33e834822beceb2467299b517c910","observation_id":"fa83ba6a-386d-4c07-b4d9-acbc54963b9a","resolution":{"observed_at":"2026-08-04T10:43:12.539773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.621141Z","title":"Cosypose: Consistent multi-view multi-object 6d pose estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.621141Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:e71762664bccea42788ee7792d361572068d90cd17da51fd157e888a9cee7fcf","observation_id":"8d51e7bf-759b-4380-add1-b7ec12787f1e","resolution":{"observed_at":"2026-08-04T10:43:12.621141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.673338Z","title":"Correlation verification for image retrieval","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.673338Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:5ead0fc1f22de1012739fbdc8a23be9b28cfa8caa652da1dfdd32d5d85c476a3","observation_id":"f051707e-0d58-494b-b850-fa88469ca3e8","resolution":{"observed_at":"2026-08-04T10:43:12.673338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.761613Z","title":"Syncdreamer: Generating multiview-consistent images from a single-view image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.761613Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:2f5f5c21f0f15825f83b100d0eac448415d83633249c51a2e4919624f2a95e23","observation_id":"8cc7eaab-a97b-4430-a8ae-c1847e8ed834","resolution":{"observed_at":"2026-08-04T10:43:12.761613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.809684Z","title":"Deepfashion: Powering robust clothes recognition and retrieval with rich annotations","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.809684Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:3e9e1acc380f932787df5ab2cbbd1348121396cdefdf51baca809a2430e340b9","observation_id":"8ae932fb-ba44-496c-bfcf-fae9e8309f62","resolution":{"observed_at":"2026-08-04T10:43:12.809684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.878319Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.878319Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:bd655ade4607886e77f6f458adf63ed821e0bcc02bb19184be6dcc41c337eacc","observation_id":"0ba5e1e1-9f86-4421-a851-1210ff529b45","resolution":{"observed_at":"2026-08-04T10:43:12.878319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:12.932430Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:12.932430Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:e18c9c4e6559bf4f08dceabb73361484dc16e56398e6750016d03de340a4b092","observation_id":"e2029850-52ef-440e-8040-16feb8274693","resolution":{"observed_at":"2026-08-04T10:43:12.932430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:13.002981Z","title":"A metric learning reality check","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:13.002981Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:97f8ea1ce9d2e94efe1878b34d0439a1139b439d37c65dda6903432f3dca63f5","observation_id":"c56c7db5-6a3d-48ff-9033-4f797bb687de","resolution":{"observed_at":"2026-08-04T10:43:13.002981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:13.061672Z","title":"Deep metric learning via lifted structured feature embedding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:13.061672Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:82c6099332d72dfdace5b82c48ee34f8f37e84e5c388e4acb323ce2906971c1b","observation_id":"f34247f1-89eb-429e-9074-32189cf702bd","resolution":{"observed_at":"2026-08-04T10:43:13.061672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T10:43:13.134678Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:13.134678Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:3056bc8bb3124cd12238dc2a7ab8b61debb53128b21318f1c2416d9f515a8703","observation_id":"78f1f684-ff52-4a12-8213-c0e9197649c8","resolution":{"observed_at":"2026-08-04T10:43:13.134678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:13.197051Z","title":"Recall@ k surrogate loss with large batches and similarity mixup","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:13.197051Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:358a09e320aa1d1b18b0e6ad98ba643faa1bc481d4bf81edbfb8c83d9d7aefb5","observation_id":"c57194a1-8ae7-475a-967b-6ce2199449fd","resolution":{"observed_at":"2026-08-04T10:43:13.197051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12634","last_updated":"2021-09-01T16:21:13Z","snapshot_observed_at":"2026-08-07T10:00:45.682572Z","submitted_at":"2020-06-22T21:39:56Z","title":"RP2K: A Large-Scale Retail Product Dataset for Fine-Grained Image Classification","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12634","snapshot_observed_at":"2026-08-04T10:43:13.298458Z","title":"RP2K : A large-scale retail product dataset for fine-grained image classification","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:13.298458Z"},"links":{"cited_paper":"/paper/2006.12634","citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:8ea9c73f31a320a434df6c521f8ee436e1fdc918f94666b68b6ea0e7e805a520","observation_id":"465a7ab3-1335-42cc-99f4-a091974ca336","resolution":{"observed_at":"2026-08-04T10:43:13.298458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:13.467077Z","title":"Learning deep object detectors from 3d models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:13.467077Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:47970f047191a4c16a52644f7ddd0a94fc24c65b3d1eb52173b86a1a180dc596","observation_id":"1cc7f955-bf71-483c-aac9-612cab3e6b88","resolution":{"observed_at":"2026-08-04T10:43:13.467077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:13.582429Z","title":"Philbin, O","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:13.582429Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:4f0493d8c07b69c9223d032d55f7cfdd5ad07091dfa97bb49ee9595a44f4cc80","observation_id":"45283332-a9b7-457a-b4f4-0fcbebd4829a","resolution":{"observed_at":"2026-08-04T10:43:13.582429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:13.719605Z","title":"Philbin, O","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:13.719605Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:a3b6f995d105b2cacdef20c18a45c9e1a014f0742fce7079ff945f65dcbef32d","observation_id":"ce7dc826-90a6-4e03-9401-f47078a7ba91","resolution":{"observed_at":"2026-08-04T10:43:13.719605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:13.810401Z","title":"Softtriple loss: Deep metric learning without triplet sampling","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:13.810401Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:9040510e97138c5a7c021e95482b859b643ba314f7ecde7ae74b9870c89a9d7f","observation_id":"c3012e0e-ef2d-4de8-bdc3-6446186fc013","resolution":{"observed_at":"2026-08-04T10:43:13.810401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:13.960660Z","title":"Revisiting oxford and paris: Large-scale image retrieval benchmarking","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:13.960660Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:6a1f4adbc0b28a1f698986ae8f1fd6cfb763b8a2a61e31568cc660c2a63ffe4c","observation_id":"cb60489a-2da3-4d46-8c4b-2e9eda9240b8","resolution":{"observed_at":"2026-08-04T10:43:13.960660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.051826Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.051826Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:945b5567c13f7076c0e9c8f9771859df39f651555db0bd8f2015ca4cae365f70","observation_id":"e6d32c39-1b25-423d-aea8-ff141353ab1f","resolution":{"observed_at":"2026-08-04T10:43:14.051826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.137544Z","title":"Dreambooth3d: Subject-driven text-to-3d generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.137544Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:94af0486ee7097ff429eab4d0af062e535be742e89fc284aa7f26bcdabdf0fa2","observation_id":"db1d954c-8253-44e7-b99e-35fb3930aab4","resolution":{"observed_at":"2026-08-04T10:43:14.137544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.227786Z","title":"Robust and decomposable average precision for image retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.227786Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:71dc79a7f25aa1bc00bc14f9c222ecad41ec0cc7255dcdbac769c3cc42e4d383","observation_id":"6565ced2-c07b-4069-ae3b-ebb8835703d7","resolution":{"observed_at":"2026-08-04T10:43:14.227786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.286910Z","title":"Hierarchical average precision training for pertinent image retrieval","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.286910Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:3acd28eeec5058422558e442b01dd4a5a1be660d9245e2cede6016dddf86199e","observation_id":"2226bceb-4f96-49b6-bf40-23f2db637c69","resolution":{"observed_at":"2026-08-04T10:43:14.286910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.336127Z","title":"Learning with average precision: Training image retrieval with a listwise loss","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.336127Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:5c2f6d6f43c9d7b80aab7c6d8daca59ffca7bde39d8df449c702ea41a0f30e9a","observation_id":"0455821c-c82c-431b-a772-b5cffe9583e8","resolution":{"observed_at":"2026-08-04T10:43:14.336127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.412929Z","title":"Optimizing rank-based metrics with blackbox differentiation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.412929Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:5d2421ba9afd87068a5f2b4f8b8d5cde07250ce3b0abf3a66a2083b9196c1e46","observation_id":"1f75ffee-546e-4e32-83b8-d421b1fc1f0c","resolution":{"observed_at":"2026-08-04T10:43:14.412929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.496005Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.496005Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:f4a5cc125ff0a8b9a5ef6d337cbc692704201802968a3f945054fa0406110618","observation_id":"0e9060e0-eb04-4aed-9e98-3e9448ae27d1","resolution":{"observed_at":"2026-08-04T10:43:14.496005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.557783Z","title":"The synthia dataset: A large collection of synthetic images for semantic segmentation of urban scenes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.557783Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:e148db93f8204e334dd7eb79c558e068edd9d532032027cbfec3ec9a510c8bff","observation_id":"a039d120-d30e-4022-8f3a-6dd74828b00a","resolution":{"observed_at":"2026-08-04T10:43:14.557783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.661349Z","title":"Revisiting training strategies and generalization performance in deep metric learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.661349Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:a3d15fbd52d49d2d1846501a5559a48ffd62f8fd07e825f135915281e6ac4a86","observation_id":"c1682128-3613-4554-a015-cfd7444fc5c6","resolution":{"observed_at":"2026-08-04T10:43:14.661349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.757158Z","title":"On rendering synthetic images for training an object detector","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.757158Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:078450ed5b3bcedb1f8494eb548e48fa767a3e1c243a8bed4b5f12b1dc98979e","observation_id":"72fb6ddb-242b-4652-a40c-86f95769d44a","resolution":{"observed_at":"2026-08-04T10:43:14.757158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.833048Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.833048Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:11213f4c575810cdeba56b33921984ae9c5d577dd0bdb158fa61b5bf7046128d","observation_id":"dd24cec6-36a9-40d5-98d8-fd4e757c58dd","resolution":{"observed_at":"2026-08-04T10:43:14.833048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.886324Z","title":"Fake it till you make it: Learning transferable representations from synthetic imagenet clones","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.886324Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:187606288537fe76db2cfe1fdc2a572887479508a6d1efb2a9b47a393e4b6bd9","observation_id":"c9b8acf7-57fe-4bfb-8abf-fb01f5280c98","resolution":{"observed_at":"2026-08-04T10:43:14.886324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:14.957096Z","title":"Adversarial diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:14.957096Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:20094f6d5a68aaf9b82feaae595cf85c3f95ddbe67ccbfbfeb3365504f13de8f","observation_id":"89426161-e542-46f6-b2c0-23ce8dd32244","resolution":{"observed_at":"2026-08-04T10:43:14.957096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.032913Z","title":"Facenet: A unified embedding for face recognition and clustering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.032913Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:e4a6aba00ecbf2c8594b273b0d346bdb0d62973e7fbf5ad2cf25c32f86061203","observation_id":"d622a4d2-c55f-4085-ad4c-21bf4d474ba3","resolution":{"observed_at":"2026-08-04T10:43:15.032913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.101340Z","title":"LAION-400M : Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.101340Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:dc70d2fc221f60968f485f3b386012cd8e2fabc93384997a90ba867962784f12","observation_id":"51a95161-2016-419c-aed8-40e5ebd3d99a","resolution":{"observed_at":"2026-08-04T10:43:15.101340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.158255Z","title":"Learning intra-batch connections for deep metric learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.158255Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:38c872da3463489d7854a97b8ef302cf4a022d40c4a35a5056a9db83f28afc14","observation_id":"5baf8eb9-b1f6-45c5-aef2-810ef301a580","resolution":{"observed_at":"2026-08-04T10:43:15.158255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.257326Z","title":"Global features are all you need for image retrieval and reranking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.257326Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:5786fd4318c509b7a7eab68fcea4e9d4e7cf442b457f3b15779c3bbf3b546aa3","observation_id":"e2c42f50-af6b-4c19-8524-1400621ea81d","resolution":{"observed_at":"2026-08-04T10:43:15.257326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.352501Z","title":"Improved deep metric learning with multi-class n-pair loss objective","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.352501Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:b732a3ef26e1687879fdad2c0801e42fc36f540f21fdd8851df7b78963cb7e57","observation_id":"177dd14b-53b7-448c-8e05-cb51aca3acaf","resolution":{"observed_at":"2026-08-04T10:43:15.352501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.422976Z","title":"Ames: Asymmetric and memory-efficient similarity estimation for instance-level retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.422976Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:00c73899f9d62a4fcb32e7b4312bd0f136a4373c9af14a9279a84854938b857f","observation_id":"62e9646f-5376-4741-9732-c0b236c23c9e","resolution":{"observed_at":"2026-08-04T10:43:15.422976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.495687Z","title":"Personalized representation from personalized generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.495687Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:4fdb7addaad0875688a5b867517f560b6b890fc9cadbdfc58456ad892b07f1db","observation_id":"57db2dd2-9f7e-4b9e-9f3a-9b6ec1dee03f","resolution":{"observed_at":"2026-08-04T10:43:15.495687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.540301Z","title":"Proxynca++: Revisiting and revitalizing proxy neighborhood component analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.540301Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:ec73ecdacaffddd9310a3ac438b8dcecd7556cc3aba37ffe8bf38387742ccdfb","observation_id":"31001ae9-d604-49cd-a29b-9201ec892a7b","resolution":{"observed_at":"2026-08-04T10:43:15.540301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.645070Z","title":"Stablerep: Synthetic images from text-to-image models make strong visual representation learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.645070Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:fe1e57c61b34865e89802c24f12beee28be407c2b0c06ab556b402da6d49c8d6","observation_id":"d8dbe007-b240-4818-8bf8-2ec172df9273","resolution":{"observed_at":"2026-08-04T10:43:15.645070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.688126Z","title":"Self6d: Self-supervised monocular 6d object pose estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.688126Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:c7972e59e09b8c86a9a182b858573989f404768bb0209a2206d4bcd74988b945","observation_id":"026b78fe-3729-4693-892b-4f17c370346d","resolution":{"observed_at":"2026-08-04T10:43:15.688126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.758183Z","title":"Cosface: Large margin cosine loss for deep face recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.758183Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:db4b5d77afae382a75a0a58b3fc8e9ae83f7bc0b4c9edfc916f46b571d8ee8d1","observation_id":"0c5328fc-65b3-4b6f-b164-b5af9a5df196","resolution":{"observed_at":"2026-08-04T10:43:15.758183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.826357Z","title":"Instre: a new benchmark for instance-level object retrieval and recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.826357Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:dfa479c9c3094cf77086aa68385e31bd255df834108bff1eef82c862a8c7ea24","observation_id":"aa6b77c7-0fbc-440a-ba79-b889601c6bf1","resolution":{"observed_at":"2026-08-04T10:43:15.826357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.866310Z","title":"Google landmarks dataset v2 - A large-scale benchmark for instance-level recognition and retrieval","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.866310Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:b3a90826e7ac836f4f02e3c5e835dc4d3b6b56f645886935eefc67199bbad210","observation_id":"83c77028-0f75-4c43-9fdf-be753410c644","resolution":{"observed_at":"2026-08-04T10:43:15.866310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:15.928050Z","title":"Not only generative art: Stable diffusion for content-style disentanglement in art analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:15.928050Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:419b8b1748630a72dd6773e1c20294ce300df8521bb44725421bbe01e8b2b0bf","observation_id":"caf43ade-20c5-418d-8d0d-c82665e74c2f","resolution":{"observed_at":"2026-08-04T10:43:15.928050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:16.031851Z","title":"The met dataset: Instance-level recognition for artworks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:16.031851Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:bb9b79857082796232e18d43ed43810dd89d3bceadf32964832b510841ef1151","observation_id":"3e717f46-d36c-4beb-830a-2d51c44c0002","resolution":{"observed_at":"2026-08-04T10:43:16.031851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:16.098081Z","title":"Towards universal image embeddings: A large-scale dataset and challenge for generic image representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:16.098081Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:4f4f778b86c0504632f966b48eac5cfd7d4c032c0647dcacbc02aad38f3a5d3d","observation_id":"53cbe87b-390e-4417-8fce-af7257375f08","resolution":{"observed_at":"2026-08-04T10:43:16.098081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12649","last_updated":"2019-08-04T18:53:50Z","snapshot_observed_at":"2026-08-03T09:30:50.930779Z","submitted_at":"2018-11-30T07:21:25Z","title":"Classification is a Strong Baseline for Deep Metric Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.12649","snapshot_observed_at":"2026-08-04T10:43:16.164403Z","title":"Classification is a strong baseline for deep metric learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:16.164403Z"},"links":{"cited_paper":"/paper/1811.12649","citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:91efe76fc0ace8009a38d88191876129bd469bc01769f1c296a47371399b2db9","observation_id":"f60a5cc1-c3c5-4ca5-b5d3-5234a754ed17","resolution":{"observed_at":"2026-08-04T10:43:16.164403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:16.234610Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:16.234610Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:c7f3dc0551a96dd7058d884ba6f6a3979d1994ffb1319018293d1d8f2477f772","observation_id":"c1a12ad7-3bd8-435d-b4f1-ffe3e686a412","resolution":{"observed_at":"2026-08-04T10:43:16.234610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:16.333874Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:16.333874Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:b0cea0e0dbbd00eaa556c38553bcdb0968c1c73a613c0cfc4f51d03594004aaf","observation_id":"6e15c70c-377c-4780-949d-3eaef9378a18","resolution":{"observed_at":"2026-08-04T10:43:16.333874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:43:16.407110Z","title":"Scaling in-the-wild training for diffusion-based illumination harmonization and editing by imposing consistent light transport","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-04T10:43:16.407110Z"},"links":{"citing_paper":"/paper/2510.09171"},"observation_digest":"sha256:041984a58281842e02e8a624001e61b4c11be6263769d1d75eb6e87593cda3ef","observation_id":"435cad86-e8af-4480-8d62-d2ace0936b80","resolution":{"observed_at":"2026-08-04T10:43:16.407110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.09171","last_updated":"2026-07-20T11:02:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T02:56:17.633828Z","submitted_at":"2025-10-10T09:14:33Z","title":"Instance-Level Generation for Representation Learning"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2510.09171."}