{"as_of":"2026-08-10T09:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6fa0170d9b2146e8875476e735b40b62ea689a0ee0b6cfd29adc3d3e9d0bd288","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:12.272631Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19614/citation-record","integrity":"/paper/2505.19614/integrity","json":"/paper/2505.19614/citation-record.json","paper":"/paper/2505.19614"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:05.393365Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.393365Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:87c524eb730bca6d5f7d4eda5013830b2f0d931671155c11c2434267e88c93a5","observation_id":"88fcee8e-b536-4f23-83ed-61fc586f5465","resolution":{"observed_at":"2026-08-07T14:16:05.393365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.985384Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"6bee6d57-bdd5-48d2-b839-c9be8bcd4846","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.461560Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:8a8e827fef938bab953e2904bcd08a59e938a51a3b8266958a17e518fc6564f1","observation_id":"1a2feed3-2c2a-48c5-aad5-5a56d1975b13","resolution":{"observed_at":"2026-08-07T14:16:28.050920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.794997Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation, 2022","venue":null,"work_id":"ce6fce5e-bc99-41d7-81c1-4b485bd08406","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.566619Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:5b8fcec88c672d8112dac6055d2caff785876d0037b580ab46fb44233877a0dd","observation_id":"d31fb068-aa02-483f-8c6c-6df90c3e9834","resolution":{"observed_at":"2026-08-07T14:16:27.897788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.601771Z","title":"Visual instruction tuning.Advances in Neural Information Processing Systems (NeurIPS), 36:34892–34916, 2023","venue":null,"work_id":"9298d68c-f032-4be1-8af9-5ff3b17a717d","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.701492Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e51566863e8d34174d54b2e0deee49d9d0b9dd5b84c1713f09829fc9cc952baf","observation_id":"6cc936eb-e062-43a3-bdb6-1c687a1a83cb","resolution":{"observed_at":"2026-08-07T14:16:27.687236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.443252Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":"c563ee6e-ddfc-414d-82f3-a63da8d43541","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.774627Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:18dfc6407f3347a815c3ae5b68283ce208fb0c03aec6377e62c750065f624b22","observation_id":"c6f33397-522f-42cd-8094-c5cfab1360d3","resolution":{"observed_at":"2026-08-07T14:16:27.514038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T14:16:05.878432Z","title":"Do as i can, not as i say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.878432Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:8598c836f2077da6f08433057ca9cdfafcb5aaa6bd0b35605c82c38628c73a5e","observation_id":"5c4c8073-19af-4a27-b687-cff42eba5f52","resolution":{"observed_at":"2026-08-07T14:16:05.878432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.272035Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":"19a8798a-28e6-48b4-bb3a-c0dd8779ebea","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:05.950601Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:4513a5bc865ff312ac509e0c7f668b70b87f92e725d25a03338104f374899a03","observation_id":"9b56f72f-eea8-4795-abaf-b5d88fc79a24","resolution":{"observed_at":"2026-08-07T14:16:27.334741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T14:16:06.031371Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.031371Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e356675bff43fed9e56d023a1466d604832eac8b7fd383fc9c34e1a54fa54ff3","observation_id":"7dc6fdd1-c18e-4b37-8101-5201b6a14cb4","resolution":{"observed_at":"2026-08-07T14:16:06.031371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:27.051055Z","title":null,"venue":null,"work_id":"7ab3c76a-6c00-4026-ba78-4dbf2da4f038","year":1956},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.101633Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:239d0cf707ea490b3bb589e8636b56bbbbe6802c429c103d701d083dd8fd4341","observation_id":"f98bee01-7044-4b51-9a05-ba13b9253fdc","resolution":{"observed_at":"2026-08-07T14:16:27.119430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T14:16:06.169961Z","title":"Microsoft COCO captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.169961Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:6fcecbf1d9ec306999c99b0e32c633986420d6c2beb3d958b9660152955830a8","observation_id":"bb525eaa-311a-4eef-aec7-f4475c1724a4","resolution":{"observed_at":"2026-08-07T14:16:06.169961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:26.752681Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"3e9d0733-9b2a-4e1d-ad06-0f90b95f53cc","year":null},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.276324Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:d4b6d3176d6858c9b72854d91fe6653b81d0ad54c1b3178b2175a5b97e33d80a","observation_id":"dff39a45-fe4b-4fa8-8198-90a08189ac11","resolution":{"observed_at":"2026-08-07T14:16:26.911464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:26.511256Z","title":"Read, watch and scream! sound generation from text and video","venue":null,"work_id":"46cf090f-0840-4a11-ae3b-caa64951ba0a","year":2025},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.397674Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:591ea57df8546484ae3c62c7a9ac787bc472c9fce0589b90f93e72116ab9c690","observation_id":"142a3491-806f-4dc7-a033-8f7a8a3a199e","resolution":{"observed_at":"2026-08-07T14:16:26.588612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T14:16:06.500633Z","title":"Are we done with ImageNet?arXiv preprint arXiv:2006.07159, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.500633Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:32bb212cfe0196af8bfa0730b2cb3be677a356c37b55358264ff1b3656e7d8a0","observation_id":"b8ae5879-52e0-4302-b0dd-7353b7da03df","resolution":{"observed_at":"2026-08-07T14:16:06.500633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:26.308317Z","title":"Evaluating machine accuracy on imagenet","venue":null,"work_id":"dcf023cc-f177-4b6a-94cf-0276199d03b6","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.606651Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:c1f6c1e97e23e7a46ece45a717de851bd08177c9f61824737208a107c60fb3dd","observation_id":"2e4d0c3a-e70b-4d10-bbfc-6b85c3195bad","resolution":{"observed_at":"2026-08-07T14:16:26.404136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:26.146384Z","title":"Re- labeling imagenet: from single to multi-labels, from global to localized labels","venue":null,"work_id":"2ebb91ff-0695-4a07-b8d7-979f3eb14a4f","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.690804Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:5732cb44fdbb31dbfddd32af329461f9da422d966c624b3c72787f2fd782bcf1","observation_id":"0fff740e-d227-4abd-9ad4-e4e989bed8cf","resolution":{"observed_at":"2026-08-07T14:16:26.223810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:26.048010Z","title":"Models, reasoning and inference.Cambridge, UK: CambridgeUniversityPress, 19(2):3,","venue":null,"work_id":"7ee76921-f811-47a5-b2d2-6c7b031d76fc","year":null},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.811710Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:c956c49493331e9395e55513df7a05d22734c169d144df92567afabcbbe6ac30","observation_id":"9652c807-8017-4912-8362-afd002cc5401","resolution":{"observed_at":"2026-08-07T14:16:26.092597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:25.893790Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"00e33a94-3bec-40bf-bd38-edc47cb08025","year":2014},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.933915Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:6ea71e3c9163143a8de5fe5b9099e805c2615d1ecdb5ae61846cfbc0401cf123","observation_id":"b0d93ccc-3424-4853-ab96-60a1082ac02b","resolution":{"observed_at":"2026-08-07T14:16:25.948923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:25.697926Z","title":"Probabilistic embeddings for cross-modal retrieval","venue":null,"work_id":"49d2171e-1967-4404-a698-a878f7911363","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.028758Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:7b9bd1e20bc47cea914c94b315c55e716d04e76604c93552ac88f07ec80cadf6","observation_id":"7139b64b-5da4-44b6-b221-4861050926a7","resolution":{"observed_at":"2026-08-07T14:16:25.776407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:25.497907Z","title":"Oxford university press, 1990","venue":null,"work_id":"540635d0-093e-41f5-9f5e-1bf5e747657c","year":1990},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.093770Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:3be8549b5ba6d48fb94192aee7eb0ccf0fa1803488061c9ac3acbf69d73c4d22","observation_id":"4a85e4c9-76e1-4166-9392-0df686d5e03b","resolution":{"observed_at":"2026-08-07T14:16:25.561562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:25.312066Z","title":"Connecting vision and language with localized narratives","venue":null,"work_id":"6b1642fc-86eb-4195-a628-77a18344167b","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.201446Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:4d41a898da63ec99ece822aea1b38183d060d36f5abe8ed01530af0774a26730","observation_id":"cfe9893d-95d1-4852-964f-04aa0824699b","resolution":{"observed_at":"2026-08-07T14:16:25.415556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:25.108450Z","title":"Visualcomet: Reasoning about the dynamic context of a still image","venue":null,"work_id":"14920373-03a3-4222-805b-960add8a5350","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.262034Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e670de41096ee817c833b3338c3c29f494abfc3e97df62937e3cfa70e9f91749","observation_id":"29c3743b-6a58-4133-be19-750a60e8020f","resolution":{"observed_at":"2026-08-07T14:16:25.238817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:24.835338Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"afc4f102-6791-43c7-8f1b-f85ad01d340f","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.355020Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:a5130df2680373a122ec102743417946a6ded72c592910cc796363d74579ebb1","observation_id":"fe3fb05f-9d79-4172-968a-ec84917c188e","resolution":{"observed_at":"2026-08-07T14:16:24.983610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-08T04:51:01.052037Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-07T14:16:07.422341Z","title":"V oxceleb: a large-scale speaker identification dataset.arXiv preprint arXiv:1706.08612, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.422341Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:6ceba051a62cad480ce721c1da6d606d7fdbbb8d8f29eaf0790e600f240458b5","observation_id":"fe62f28c-1a6c-4369-a2c3-898356804cdd","resolution":{"observed_at":"2026-08-07T14:16:07.422341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:24.504501Z","title":"Visually indicated sounds","venue":null,"work_id":"11678b47-f3c8-4914-8f81-2d5629e00439","year":2016},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.517773Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:435df86bb41907cb956bdc9729190e4a0ef39a911392970bd74a5033a5d62e88","observation_id":"2f726f4f-0836-4d02-8c76-76efbc048ecf","resolution":{"observed_at":"2026-08-07T14:16:24.667638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:24.190254Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"d35b24d4-1dc8-4685-87fd-12d1778d9ade","year":2019},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.601271Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:ae6c3243756ecbe26fed211c09914e61109e50e4f8a570efa0ac95f523bcf05c","observation_id":"e8ede0a3-0f9a-4702-9f96-9313e1eefa83","resolution":{"observed_at":"2026-08-07T14:16:24.331459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:23.924083Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":"d01befc3-4949-4972-9367-91b6a07c7b25","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.663877Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:b0f7c2eb0201b2b87318bd9e6f35964b8e8cec735de8a860c2dce7066a222e39","observation_id":"ec61533e-39b9-41f8-ab92-dc5113647f6d","resolution":{"observed_at":"2026-08-07T14:16:24.049480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:23.674877Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"ab4a89e3-6d28-446c-9d85-6881431c4d8e","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.715195Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:7121611e535084c26419345bac835a9a4dfeed3a99faf995e7d387ee80b9b195","observation_id":"0b80c615-85be-452a-8e20-6740b123a55c","resolution":{"observed_at":"2026-08-07T14:16:23.801664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:23.367871Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"c07afa12-38dc-4c4f-8f28-5de5a20738a7","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.791555Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:3f648dd26d89aa2063dfe41af26bb2f117dde8ff9353db259493659e016bdce7","observation_id":"b3d608b0-59b5-4866-8b7f-7cddee563ae0","resolution":{"observed_at":"2026-08-07T14:16:23.496510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:23.050706Z","title":"RedCaps: Web-curated image-text data created by the people, for the people","venue":null,"work_id":"ea455948-34c8-4f42-baf2-c3a731cbcbcb","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:07.892764Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:fd08acbd2ed5bfc8861fcf3ba70fa09877162ae17a08f635d36194ec4ea13b81","observation_id":"2f78cc14-814a-4a25-b081-bc4cbb78fd77","resolution":{"observed_at":"2026-08-07T14:16:23.210366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-07T14:16:08.000380Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs.arXiv preprint arXiv:2111.02114, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.000380Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:2e4a450aabd82d7b304ae4a9b2fcd9c776a5c96f9b40a9d8c90743b29ce6f93c","observation_id":"937ad39b-8511-42b5-ac2d-ed3afa494e1a","resolution":{"observed_at":"2026-08-07T14:16:08.000380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:22.761857Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in Neural Information Processing Systems (NeurIPS), 35:25278–25294, 2022","venue":null,"work_id":"9f849563-158d-41b5-8f77-167b0f8612c8","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.082104Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:ed21fad0c0b0e69dfc0bce5304cabf50584926835cfda6950a637de6b1d985f5","observation_id":"9111481b-70bb-45ee-9e46-a7fefb0adf85","resolution":{"observed_at":"2026-08-07T14:16:22.890150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:22.485564Z","title":"Datacomp: In search of the next generation of multimodal datasets.Advances in Neural Information Processing Systems (NeurIPS), 36,","venue":null,"work_id":"3873207d-0fe9-40ad-8a24-70e59eef62bf","year":null},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.188692Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:c115db47db3843247f1af2e3c5ac78102b436ad0e743a5006343398c7fff3e37","observation_id":"bf47952b-83a7-4ee4-b559-7f76b20181d5","resolution":{"observed_at":"2026-08-07T14:16:22.628648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:22.250195Z","title":"VSE++: Improving visual-semantic embeddings with hard negatives","venue":null,"work_id":"38068879-1fc8-4fc5-afeb-4d7a80caddac","year":2018},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.264838Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:816fdbde78eb8b96e9e950bcc311d5f544aa0f545571386bba327cd0818f518c","observation_id":"dd90efe1-357c-4267-a0ee-cc6d119c435f","resolution":{"observed_at":"2026-08-07T14:16:22.345250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:22.085619Z","title":"Learning the best pooling strategy for visual semantic embedding","venue":null,"work_id":"748d215e-879e-4f86-a695-697759c27446","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.365444Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:5aa88f8c880d3741d40508c1555b16a9a18c2b619df776f12f551505dc2051c6","observation_id":"7e0c6622-3003-4019-92a1-741253ba847b","resolution":{"observed_at":"2026-08-07T14:16:22.200546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:21.881118Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning.Advances in Neural Information Processing Systems (NeurIPS), 35:17612–17625, 2022","venue":null,"work_id":"1b9bea4b-8efc-40f9-a5d6-877f65ca9f8c","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.462465Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e34b1d2fbae2b3789266d2df3f7ef9226420c8cd8aca8544c2f936d4656e1139","observation_id":"115bcd22-c773-4c82-99da-0461a4ef534e","resolution":{"observed_at":"2026-08-07T14:16:21.974675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:21.645074Z","title":"Boosting contrastive self-supervised learning with false negative cancellation","venue":null,"work_id":"b837e842-1403-4fd4-96bb-364307466f56","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.552516Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e86ce0129fd71d42d10cb6effdedcf758ce9e1df9a656b0af0f7b61d43aff9e3","observation_id":"d0a88a38-2277-43d7-a0a5-1935022173e7","resolution":{"observed_at":"2026-08-07T14:16:21.751468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:21.380276Z","title":"Mafa: Managing false negatives for vision-language pre-training","venue":null,"work_id":"f903d57d-3432-4e13-94c8-08d1ce25be14","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.621165Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:88d2ee2be116154bfebe2168db5bac203bceceabc334dca6e84a80a54b0e0397","observation_id":"f5a38849-a44d-4dd0-ac94-a2ba19fdad94","resolution":{"observed_at":"2026-08-07T14:16:21.466329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:21.183725Z","title":"Supervision exists everywhere: A data efficient contrastive language-image pre-training paradigm","venue":null,"work_id":"264584ad-587f-4480-8db3-e1ce93ec4f69","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.706697Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:823001c5da2b46c955af1b2aa7405c6e1c66a1c2f7bf40621818fb3057a0f167","observation_id":"72991341-5e02-4cdf-a121-5a421aa04c61","resolution":{"observed_at":"2026-08-07T14:16:21.286635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:20.982839Z","title":"Improved probabilistic image-text representations","venue":null,"work_id":"3891a708-0c45-4558-ab6d-36cd9f1aa44f","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.809784Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:614ced327f6acf17de994a97a5706b864e9e0af9100b4a9aaf7ef5a5f5d2219e","observation_id":"a9ab1f8c-4fbc-41ec-9e19-8a5ad39b8410","resolution":{"observed_at":"2026-08-07T14:16:21.060033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:20.779563Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":"5a0c74de-dd70-464d-a1a8-efbaced775e6","year":2018},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.911082Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:5561574d5e038653d996e949c8c9eca45bcb19878d3def0aca7a2c6a8f95812e","observation_id":"0a986dc8-3c61-44ad-982b-6e5fa6297429","resolution":{"observed_at":"2026-08-07T14:16:20.859342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:20.592260Z","title":"CutMix: Regularization strategy to train strong classifiers with localizable features","venue":null,"work_id":"c2793f07-8018-4b5c-b5a5-2f9efeb842bb","year":2019},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:08.991881Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:2485d6b02a0553d83b1bb76336c29d54dffed878d0ac7bb8058c81c3e99e264b","observation_id":"fbf3a614-dc65-4cf2-a544-6ae6407c82ac","resolution":{"observed_at":"2026-08-07T14:16:20.664206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:20.387178Z","title":"Learning with noisy correspondence for cross-modal matching","venue":null,"work_id":"d2fe166e-4b8d-417d-b815-02973be0f8d5","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.054473Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:d4dfa6d88c8217b0da3757097541b158d48a1dd127f54d2f102fc94e853b64f5","observation_id":"79beb560-2e5e-4200-a7c6-de599eb6a595","resolution":{"observed_at":"2026-08-07T14:16:20.473658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:20.185547Z","title":"Learning from noisy labels with deep neural networks: A survey.IEEE transactions on neural networks and learning systems, 34(11):8135–8153, 2022","venue":null,"work_id":"b1e50659-b48f-42e6-b7eb-71d90d62a657","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.118685Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:3af41bae35b3bf3ee6af52c77b290520ef1062fe6c8710ae1320291debd36368","observation_id":"2151e1d7-8984-4e74-8063-81f39327de5e","resolution":{"observed_at":"2026-08-07T14:16:20.252868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.965316Z","title":"Learning from positive and unlabeled data: A survey.Machine Learning, 109(4):719–760, 2020","venue":null,"work_id":"b8ebac9c-f26d-4ec4-baaa-6ee166ffc7ff","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.218339Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:144741405efa248347f9fcc19c9d14162c9a913f5ffb5d489d187c6803b321c8","observation_id":"86c4ac82-01ab-4dbf-9a7d-6d8be4e8a92f","resolution":{"observed_at":"2026-08-07T14:16:20.059181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.732842Z","title":"Polysemous visual-semantic embedding for cross-modal retrieval","venue":null,"work_id":"2437fc17-fa10-4fdf-856e-c56fcd21072b","year":1979},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.315824Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:8fd8a6d385ab552f95e9ce1349fdd8a8ba18ede4e8a769daf14c96045764e1a5","observation_id":"9aea5a1a-eeb8-4aaa-9c98-68305bb7741e","resolution":{"observed_at":"2026-08-07T14:16:19.844161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.592987Z","title":"Improving cross-modal retrieval with set of diverse embeddings","venue":null,"work_id":"ae470752-fd3d-4458-9649-e2a1e2ac1e38","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.372395Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:fd68269bceb89e3ca589560e742928a8d45e839569f5969f53e6a9ac1cd87918","observation_id":"b1512ce2-d6b2-4d52-86e1-04247c610a34","resolution":{"observed_at":"2026-08-07T14:16:19.667256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-07T14:16:09.462903Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprint arXiv:1701.06538, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.462903Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:eab11e120512a304bd4d0b509808fb935945fe70569694f820e47724e271746c","observation_id":"d4ae136b-7ad8-48e5-a63b-d41067ff60a9","resolution":{"observed_at":"2026-08-07T14:16:09.462903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-07T14:16:09.536726Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models.arXiv preprint arXiv:2401.06066, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.536726Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e3fce678b906e20c588d4813937e24d50defbe2f1ff918d29bdfa6a4f5523b9b","observation_id":"cfc0da8c-fb56-46d1-9058-d3d0baaa0108","resolution":{"observed_at":"2026-08-07T14:16:09.536726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.425508Z","title":"Probvlm: Proba- bilistic adapter for frozen vison-language models","venue":null,"work_id":"83a7379f-73b1-46da-a52f-398ca1cce599","year":1910},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.610413Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:79eb72e6514b2ba24e098060fd3864a110bb3bcabb10fa885cb50f1e74363950","observation_id":"0160d01b-cc0a-48ef-80eb-cb5f4677f591","resolution":{"observed_at":"2026-08-07T14:16:19.533611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.205334Z","title":"Prototype-based aleatoric uncertainty quantification for cross-modal retrieval.Advances in Neural Information Processing Systems (NeurIPS), 36:24564–24585, 2023","venue":null,"work_id":"97933751-814d-419b-882f-ff70d60115d7","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.655836Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:867050e033f9e37909729548cd534ca969d6c215c4167e999060cd79baf27afb","observation_id":"930f59d4-a35e-4388-9a72-397b8a0b5b4f","resolution":{"observed_at":"2026-08-07T14:16:19.301851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:09.747225Z","title":"Post-hoc probabilistic vision-language models.arXiv preprint arXiv:2412.06014, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.747225Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:0c910968946b98d547478352574fd0d658a991a870ce7cce47d52dc2a727fd66","observation_id":"3e149e25-a357-4f1b-9df8-7c57d2adcdc5","resolution":{"observed_at":"2026-08-07T14:16:09.747225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:19.013683Z","title":"Probabilistic language-image pre-training","venue":null,"work_id":"bc82f679-a80f-4140-ab10-0eafc4ed723a","year":2025},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.797960Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:0af76b836fbccce1b47b0f05bad744eab6397857609c4890121139ba412c2a36","observation_id":"b94099c9-1a2a-4588-93b1-d6f314d53663","resolution":{"observed_at":"2026-08-07T14:16:19.077995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:18.796764Z","title":"LongProLIP: A probabilistic vision-language model with long context text","venue":null,"work_id":"81586c3c-6fde-4894-a905-40cecd716f23","year":2025},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.872720Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:00ca3d6703c927559c594bfe50ffa5920f6b627fec3ba0f42d53fb52f3f1db84","observation_id":"3a7c1829-a0bd-4cd4-981c-b9f94ef1548c","resolution":{"observed_at":"2026-08-07T14:16:18.899901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:18.670643Z","title":"Seeing what you say: Expressive image generation from speech.Under review, 2025","venue":null,"work_id":"39385ea1-b94f-421b-b823-c2229112b3da","year":2025},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:09.938780Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:d00d7fce6459c18d83932edf6583b39cd54d38e4dc904f3a62927c5e44d7827d","observation_id":"f130cd30-0d9b-417e-a315-b0d5d9f36064","resolution":{"observed_at":"2026-08-07T14:16:18.723468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:18.481293Z","title":"Flaws of imagenet, com- puter vision’s favorite dataset","venue":null,"work_id":"80e2559b-c632-47e1-865d-8178bcfa8de8","year":2025},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.019342Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:991a8e0d21b6897b1094d2f4b76a3d1dc645b0cf47d7f7381fbbd28897e37180","observation_id":"aab51bfb-cf2e-4660-bb27-e1e0b7e248f5","resolution":{"observed_at":"2026-08-07T14:16:18.549313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:18.248336Z","title":"ECCV Caption: Correcting false negatives by collecting machine-and-human-verified image-caption associations for MS-COCO","venue":null,"work_id":"9488eada-08c2-4927-8612-35ee2be931ae","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.095597Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:50de8831a0b7763f6c227231513a4a6946a71697a0974285e84d0a74ca8dc8c4","observation_id":"a1611fd9-3d99-4cf0-af30-bcecd8896d65","resolution":{"observed_at":"2026-08-07T14:16:18.353786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:18.085129Z","title":"A metric learning reality check","venue":null,"work_id":"f1b0ee93-a2bc-4d63-9417-74b1148adebc","year":2020},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.176737Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:61b6e3d75ba34d18b25872326716b4181ca3fa5c2fdf397e262aa274ea686048","observation_id":"21230f8e-0a9e-440c-ad8f-371df56e56e5","resolution":{"observed_at":"2026-08-07T14:16:18.177846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:17.862725Z","title":"Holistic evaluation of text-to-image models","venue":null,"work_id":"059aa7d5-1c6f-4d35-bc37-11cd421a11b6","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.236474Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:67eacae7e5396dcd94b12d368f4929922ad880c979362e7b5f673b11456bf1b6","observation_id":"aec1ba88-db07-472e-b3dc-2d2a662d2d8f","resolution":{"observed_at":"2026-08-07T14:16:17.972297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:17.636815Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in Neural Information Processing Systems (NeurIPS), 30, 2017","venue":null,"work_id":"d36fce30-b9ff-4544-a4c1-abfceb3e6aa4","year":2017},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.323690Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:c23a3d93859b323f6505f39d1e722e8b869a875fc1f9fc4d178ec9381f14138c","observation_id":"139dfd9e-ff68-4140-b77f-e3d614e57d84","resolution":{"observed_at":"2026-08-07T14:16:17.717520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:17.458852Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"035e4b14-d567-444f-93e4-787164364569","year":2002},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.381784Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:766584869516a2c35efd03e26bf666d8ca549f8acc432e01ee3740ce3b550cdd","observation_id":"a6b36c31-f7bc-4be1-9e88-dcd69c13a0d8","resolution":{"observed_at":"2026-08-07T14:16:17.518665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:10.445461Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.445461Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:83baf7c75dcd9558a073df9b64a3f5f82827c44fc1da157c2a08250ed527b39e","observation_id":"6e859e9c-831e-4ccb-b2a7-0fb689c8239a","resolution":{"observed_at":"2026-08-07T14:16:10.445461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:17.218224Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"c49e0f36-013d-4015-9ecb-7dbea3120b60","year":2005},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.452537Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:e997f3fd56c816f38accf8c7ceaa855844507ab9febdcfaecc55c630049aeb58","observation_id":"3f19c540-9c5e-4908-857e-fd6e2f38542c","resolution":{"observed_at":"2026-08-07T14:16:17.327520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:17.077780Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"581d08e1-ec98-428f-86f4-26c1c23c07f5","year":2018},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.534178Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:586e2721f09e8c97803ad3ea3ba8ce574e6c77f0b3f010615372bebf8140e3d2","observation_id":"084c31fe-2b0c-492d-b952-a66bc4e0f290","resolution":{"observed_at":"2026-08-07T14:16:17.171214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:16.847356Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"72a1283d-c85e-4e8d-9f06-9184565091b2","year":1952},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.618233Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:65e98e36f4525e4e124ccb8569d35e38e47254e8e9d7283a50122f1b00594718","observation_id":"e0ea2121-3621-4b41-9bb0-e9bdce7a2395","resolution":{"observed_at":"2026-08-07T14:16:16.945964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:16.621541Z","title":"The Caltech-UCSD Birds-200-2011 Dataset","venue":null,"work_id":"c9386107-2bca-48e0-8b92-2fbc9d4926b7","year":2011},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.710456Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:3ddf8211dc2fd2de805fcc2ffd766d86398169e1fcec3c30ab0fbde4a8cc64c9","observation_id":"7f28daa8-e56b-4409-8b05-c120f18f9220","resolution":{"observed_at":"2026-08-07T14:16:16.724783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:16.278601Z","title":"On semantic similarity in video retrieval","venue":null,"work_id":"0b129025-11a6-47fe-8d33-eec315d4f31c","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.780954Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:f8247f52807abf1ca49181a3e3dee44bae6fd23eafc6cea3b405f846d3c781b4","observation_id":"1dfcf618-c394-44b3-9c31-dba4c45a9c59","resolution":{"observed_at":"2026-08-07T14:16:16.447933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:15.985612Z","title":"Crisscrossed captions: Extended intramodal and intermodal semantic similarity judgments for MS-COCO","venue":null,"work_id":"b3eedcac-bae0-47cd-99ee-e4d141bb874e","year":2021},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.873783Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:4135ac9daba3c4d41f68b726f90ecd65d8fa7231486b766f25505bcb44fe261e","observation_id":"9d49a3ce-90dd-43b9-8e1c-bf4e6a153432","resolution":{"observed_at":"2026-08-07T14:16:16.109279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:15.757214Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"a8bf817f-2314-4852-aae6-bb36c00f4fa4","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:10.984748Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:044111b144cc8aa40e7c951a23b1e2ffd313a8fce263bb2c0b2b331d6512646f","observation_id":"8dc0f6f4-9bac-471e-b39e-ba384511d26f","resolution":{"observed_at":"2026-08-07T14:16:15.833602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:15.458491Z","title":"T-mars: Improving visual representations by circumventing text feature learning","venue":null,"work_id":"3c994932-40d9-48b7-ab11-1b3f103716a7","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.114209Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:ff96e0a041018a96de9da74ea8e4c792883906fa891a41dd8b19deaa01243c53","observation_id":"73e8ebde-88fb-464c-9d2b-aef37f4a43a1","resolution":{"observed_at":"2026-08-07T14:16:15.603277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:15.212841Z","title":"Data filtering networks","venue":null,"work_id":"6ff256ca-51b7-4a85-adb4-8f7a7707060a","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.203201Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:f384c5bf8fd78fa4be5176c1e39b471fa191304706c401f25948ca97724b7fdb","observation_id":"9e67b893-2440-4618-9dd5-b1d381a2ab94","resolution":{"observed_at":"2026-08-07T14:16:15.312960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:14.974395Z","title":"Text-only training for image captioning using noise- injected clip","venue":null,"work_id":"5a792639-8e7a-433a-963b-9410cc3fd125","year":2022},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.250594Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:eba1217ab6633303943d84398573b97491502188c6befe357d5b692c0d93c55f","observation_id":"0fcd36cb-bf55-4e59-9dc4-9adbcde8eab7","resolution":{"observed_at":"2026-08-07T14:16:15.052907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:14.682647Z","title":"I can’t believe there’s no images! learning visual tasks using only language supervision","venue":null,"work_id":"47c2f5a8-2a5b-4479-8e93-2d0ddb37fadb","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.338200Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:53694693bf9096763678f75a02201d6097c64d91c229d54b0f240db68c42b882","observation_id":"28f0f437-fada-4eb0-a288-e6d5acb6a66e","resolution":{"observed_at":"2026-08-07T14:16:14.791979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:14.351186Z","title":"Decap: Decoding clip latents for zero-shot captioning via text-only training","venue":null,"work_id":"06aa994f-1aaa-4d83-b314-8b612c90f3b0","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.429970Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:2fab54468998e07a37ffb7bd008290300229a99fe4a3c78f22938dabcefe01e8","observation_id":"0f01aa81-1d49-455d-ab01-900f8926ee97","resolution":{"observed_at":"2026-08-07T14:16:14.504866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:14.164227Z","title":"Language-only efficient training of zero-shot composed image retrieval","venue":null,"work_id":"90cf3213-ea3a-4b92-9d3f-2424290ac550","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.525152Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:16cd8e40e082610e5825df6117c84fb277a01f5c8619013de1cbbe6c8aa724a0","observation_id":"b45afb86-ea2f-48b9-867d-829e06dd8dd2","resolution":{"observed_at":"2026-08-07T14:16:14.237872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15954","last_updated":"2023-09-27T19:10:43Z","snapshot_observed_at":"2026-07-06T16:24:34.528987Z","submitted_at":"2023-09-27T19:10:43Z","title":"The Devil is in the Details: A Deep Dive into the Rabbit Hole of Data Filtering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15954","snapshot_observed_at":"2026-08-07T14:16:11.606628Z","title":"The devil is in the details: A deep dive into the rabbit hole of data filtering.arXiv preprint arXiv:2309.15954, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.606628Z"},"links":{"cited_paper":"/paper/2309.15954","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:5cff643f52625b65545dfd78de1660bf2a88e797e338238db80cd841edc43f43","observation_id":"312dc320-60fe-457b-8e96-7256b5cfb945","resolution":{"observed_at":"2026-08-07T14:16:11.606628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:11.706817Z","title":"Icons: Influence consensus for vision-language data selection.arXiv preprint arXiv:2501.00654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.706817Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:f851c67aef2c49b7b8b37c80ba41de2848de3e989aaf6ad3bf17df0824c2dfdb","observation_id":"0ecaad2b-9a75-4fa0-9f55-103d82bdab4b","resolution":{"observed_at":"2026-08-07T14:16:11.706817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:14.001883Z","title":"HYPE: Hyperbolic entailment filtering for underspecified images and texts","venue":null,"work_id":"4cdb89f6-1285-4ff4-8b2d-62fb33b6cc8a","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.876698Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:1a067d683889dcaf12c281a6ca3f8437e511678712ec8360b1c564afe7cb7119","observation_id":"541a3817-2404-4547-a1fa-85460bdb1ed8","resolution":{"observed_at":"2026-08-07T14:16:14.068636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:13.836951Z","title":"CompoDiff: Versatile composed image retrieval with latent diffusion.Transactions on Machine Learning Research (TMLR), 2024","venue":null,"work_id":"2f560f64-4a60-4008-937d-00bda3f8037d","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:11.993785Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:1306776ff4d0faf1f38760f28467493ca81836de6bd23c2cec86ac15b889e093","observation_id":"90c3b615-9367-4153-990d-e42b3283cb62","resolution":{"observed_at":"2026-08-07T14:16:13.920023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:13.656818Z","title":"Toward interactive regional understanding in vision- large language models","venue":null,"work_id":"5673397a-f782-4d26-b7f0-31fcf2ca76bc","year":2024},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:12.044436Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:5f2f147bd9a9c69a3494230feb00e9acbc6ba718158e5d70e039602dffeba704","observation_id":"5b275adf-e4f9-41c6-9e98-b2c9742cd007","resolution":{"observed_at":"2026-08-07T14:16:13.737946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:13.471179Z","title":"Crepe: Can vision-language foundation models reason compositionally? InIEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 10910–10921, 2023","venue":null,"work_id":"a542b4bb-46f4-48f3-a86b-3a0ae3a9346f","year":2023},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:12.131779Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:8eb689a4c5ca80ee05451d0c7c9fa38889582c5ea319ce7c2360aa880ac6b5a3","observation_id":"17b406e2-2a86-4fc4-9ac5-03dd33e32755","resolution":{"observed_at":"2026-08-07T14:16:13.572416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:13.223641Z","title":"Large-scale interactive object segmentation with human annotators","venue":null,"work_id":"4cb8f215-7909-46f5-80d9-3756d8b504ad","year":2019},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:12.272631Z"},"links":{"citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:4fe343ba72c45de9d5c6a640f3c4c952ad6bd742f483d3e99e75010e5d30d228","observation_id":"1a411e0c-72d0-41a3-b175-3ab5af0fc8ef","resolution":{"observed_at":"2026-08-07T14:16:13.369741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":67},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2505.19614."}