{"as_of":"2026-08-09T20:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa61798d73fa365d152b8286e80b79c5ff7b7caf7c8e9e5e3f590803c93125e7","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:43:54.223613Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04870/citation-record","integrity":"/paper/2506.04870/integrity","json":"/paper/2506.04870/citation-record.json","paper":"/paper/2506.04870"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:02.621870Z","title":"and Soatto, S","venue":null,"work_id":"f0b1de58-b66a-42f9-88e8-49b860b6124c","year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.335384Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:7cf3a2c4269e31c9a67036a1c2b2c31f5c3426d1ca2d77bfc7f0a35e0844a2bc","observation_id":"1514e70a-e1c3-474b-a00f-f1f02bad1684","resolution":{"observed_at":"2026-08-07T10:44:02.676436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:02.491426Z","title":"and Soatto, S","venue":null,"work_id":"ff9f4467-7eb0-4d4d-b35a-b92388207aad","year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.395127Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:29ddbbc0bbc138aef2fb932b704b74d5c20865edcedbeb394f75f207e72dd82e","observation_id":"10dd87b3-f69c-43d8-a95c-a42e47136f6f","resolution":{"observed_at":"2026-08-07T10:44:02.552925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00410","last_updated":"2019-10-23T22:47:44Z","snapshot_observed_at":"2026-07-06T05:21:01.935928Z","submitted_at":"2016-12-01T20:12:40Z","title":"Deep Variational Information Bottleneck","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00410","snapshot_observed_at":"2026-08-07T10:43:46.492104Z","title":"A., Fischer, I., Dillon, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.492104Z"},"links":{"cited_paper":"/paper/1612.00410","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c2ddcb5571c3faba0250088f728b9c30a35ce3ac348a196f0abe564ce0ee5bd6","observation_id":"963e994a-9add-48c4-9d79-0b1bdd805b0f","resolution":{"observed_at":"2026-08-07T10:43:46.492104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:02.332519Z","title":"D., and Buchwalter, W","venue":null,"work_id":"c8094ad2-aa12-423d-8e63-b386a4659d8d","year":2019},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.566251Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:906059bfe989d2d3848b5e26619d7aec7fd060a1de589713325c9fb5e49ba123","observation_id":"151d5ac6-d09b-4eee-947a-c5f0056abd8a","resolution":{"observed_at":"2026-08-07T10:44:02.392838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:46.675735Z","title":"Revisiting model stitching to compare neural representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.675735Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:5ccdd6b380a1ce4eae9f15ae140dcee533b257944726711e19f930df485af1a6","observation_id":"316388a8-a272-4742-983a-62cb8c1be184","resolution":{"observed_at":"2026-08-07T10:43:46.675735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:46.752484Z","title":"Representation learning: A review and new perspectives","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.752484Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:5cf26430b7380b3d7738097462b1bd2660d2a6eea5a2f8a15185c332e397017a","observation_id":"c7011b2f-689e-4e4f-aaa8-7abbdf3d55d3","resolution":{"observed_at":"2026-08-07T10:43:46.752484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:02.102311Z","title":"and Kim, H","venue":null,"work_id":"1d7922ff-bbf6-4cdd-840b-7818331138e7","year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.841481Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:bda0c24b5e1d1713eb1e61b3b1e14472a3d21f3f7d3d3662e1e48f591cc1156f","observation_id":"d12ccdbb-57a1-48b4-b19e-7ee3b6432280","resolution":{"observed_at":"2026-08-07T10:44:02.231084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.967757Z","title":"F., Hong, H., Yamins, D","venue":null,"work_id":"ba68224e-ae22-40c6-92b5-f6067206e0b1","year":2014},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.918192Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:e62d309b09f40dfa9242ab172c359f106e8824fcd15cbcb229ae17a35a3259a2","observation_id":"65ca187c-4e08-4e55-98bf-275816b8eed1","resolution":{"observed_at":"2026-08-07T10:44:02.030824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.837718Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"7ff151a4-6508-4213-8fff-8ba753115f90","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.980846Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:0e588f928057e6860163a3a22568ffd469f60db2cfeeba0206322c4bf1fcd081","observation_id":"4cfc32e9-6b0b-4096-b34f-ddb985be20f6","resolution":{"observed_at":"2026-08-07T10:44:01.903333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.708104Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"84b4f317-c741-48c3-8dec-d026229dc575","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.032668Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:53cba21da237a162f3b7669399525377ba6abbb51189b7f3310048a23d25c140","observation_id":"4ea87a0b-5e68-4d2b-a44c-b3ec4e9dd690","resolution":{"observed_at":"2026-08-07T10:44:01.751830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.06743","last_updated":"2017-04-17T18:36:08Z","snapshot_observed_at":"2026-07-06T04:57:08.358661Z","submitted_at":"2016-05-22T06:15:31Z","title":"Inductive Bias of Deep Convolutional Networks through Pooling Geometry","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.06743","snapshot_observed_at":"2026-08-07T10:43:47.125611Z","title":"and Shashua, A","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.125611Z"},"links":{"cited_paper":"/paper/1605.06743","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:045b57dfaae593abe1597a1282abe2aa6dd59a9d89f9a0d3fd3f65cdc2f73a1e","observation_id":"ff32dee0-2856-41de-91db-93137fc609bc","resolution":{"observed_at":"2026-08-07T10:43:47.125611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.589132Z","title":"Algorithms for learning kernels based on centered alignment","venue":null,"work_id":"81f76b61-0c9f-4a8d-b0e7-5930e7aa4a0c","year":2012},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.223980Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:d0fd3dc30550f4e68cbd96315c6aa041a3f6b6d6ac484f740fafd17b761b40b0","observation_id":"3ad2dcf7-1378-4248-9cf9-e778dcfd265c","resolution":{"observed_at":"2026-08-07T10:44:01.645464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.480088Z","title":"On kernel-target alignment","venue":null,"work_id":"64d2c8e2-8136-4d9c-ac09-b47deec138ef","year":2001},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.305990Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:6847a02b161082542734acd4e6adfa0f12ceb6e5cc577940b53fa5698456bb41","observation_id":"7ed8345b-95e5-4ee6-a8d9-7edea89f4416","resolution":{"observed_at":"2026-08-07T10:44:01.528041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00685","last_updated":"2024-04-16T06:46:18Z","snapshot_observed_at":"2026-08-05T20:19:51.577573Z","submitted_at":"2024-03-31T13:30:12Z","title":"Scaling Properties of Speech Language Models","version":2},"cited_work":{"arxiv_id":"2404.00685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00685","snapshot_observed_at":"2026-08-07T10:43:54.622864Z","title":"Scaling Properties of Speech Language Models","venue":"eess.AS","work_id":"b6516efb-39b7-40b3-b534-898eb0119b0b","year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.376974Z"},"links":{"cited_paper":"/paper/2404.00685","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:da6fa4af1e64c40b2f06d5770c34486044d5666e10122f70b49370fd4899c100","observation_id":"c509a773-e901-4800-9ad9-c05f759a16d3","resolution":{"observed_at":"2026-08-07T10:43:54.710108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.327737Z","title":null,"venue":null,"work_id":"24fbe725-a0b8-4e6a-b0eb-2f7966adfd8c","year":2011},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.464929Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:945ad880bde0f112f0f8383ed2b7ea71b25ef0682510c6c4a460d1ed63315757","observation_id":"20f67dc9-5281-4867-acb0-9c2d22d7d845","resolution":{"observed_at":"2026-08-07T10:44:01.400066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T10:43:47.552783Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.552783Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:6d2fb5433ee3329c5831c99aa02c995a889d6b26470a832ba036c65d1d1087c4","observation_id":"698f00eb-8b4c-4cc9-aeb7-81cf1ef258a1","resolution":{"observed_at":"2026-08-07T10:43:47.552783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.048829Z","title":null,"venue":null,"work_id":"e4a336b7-a45e-4e74-9e51-e5b0d8d62929","year":1999},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.633790Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:87cfaaee409e8825a3e4acd0f0bf3acb60db01d27ea60afd7287219f3e5b1e6e","observation_id":"a05921e1-5bfe-4bba-85e7-29c0ef1fc3ec","resolution":{"observed_at":"2026-08-07T10:44:01.201441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T10:43:47.714903Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.714903Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:8275a0bfc1cd840f2358fb56fa0e5db4b22684207b9a4ae7737db3464ce385ab","observation_id":"160bde05-0e7c-4a30-a9c5-a1ca0e81c76e","resolution":{"observed_at":"2026-08-07T10:43:47.714903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18570","last_updated":"2024-06-06T20:29:21Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T20:28:07Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18570","snapshot_observed_at":"2026-08-07T10:43:47.806429Z","title":"Its not a modality gap: Characterizing and addressing the contrastive gap","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.806429Z"},"links":{"cited_paper":"/paper/2405.18570","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:6240dd4254a3f543322deea99d2edea1be5c7733ef9d5275c7b8c13e271b50da","observation_id":"df1243f6-3ad5-4bbe-b0d0-0b9a180d604c","resolution":{"observed_at":"2026-08-07T10:43:47.806429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:00.662986Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"f6277cc2-15e5-4fe6-8461-0bacee9933ae","year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.981890Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:85c85833b87281a58655accb74f861c6efe54d7761979ce581c7e3dc694e0d41","observation_id":"c7d62e14-2f05-4927-a3ea-14ba64886caa","resolution":{"observed_at":"2026-08-07T10:44:00.880988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07017","last_updated":"2020-02-18T09:47:50Z","snapshot_observed_at":"2026-08-08T02:55:09.960609Z","submitted_at":"2020-02-17T16:01:52Z","title":"Learning Robust Representations via Multi-View Information Bottleneck","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07017","snapshot_observed_at":"2026-08-07T10:43:48.098099Z","title":"Learning robust representations via multi-view information bottleneck","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.098099Z"},"links":{"cited_paper":"/paper/2002.07017","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:15782bf459db5c7aef6bb5e2c2cda6e5c0282aa88ef140f621d4364a38e1ee0c","observation_id":"eabf118d-8a0b-4e23-bae2-ba3d8541afaa","resolution":{"observed_at":"2026-08-07T10:43:48.098099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:48.191042Z","title":"Towards artificial general intelligence via a multimodal foundation model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.191042Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:805acd10e205efb47f628a19d81c1e6ba5eb17e1b228e4493c1a8e22ea1dc17f","observation_id":"270f7a22-ecd3-4e7c-bece-911581f96f2e","resolution":{"observed_at":"2026-08-07T10:43:48.191042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:00.466851Z","title":"S., Shlens, J., Bengio, S., Dean, J., Ranzato, M., and Mikolov, T","venue":null,"work_id":"c283b33f-95ec-4e3b-9f62-dffa54bd6890","year":2013},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.336776Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:ee6b48dfd8cf54c7d37d821ef2f12554157c36f1f6a080f43c899c6e87f4c9c5","observation_id":"2b68b1c9-4a3e-44a6-8736-dada4e0cfdff","resolution":{"observed_at":"2026-08-07T10:44:00.533407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:00.212594Z","title":"V., Joulin, A., and Misra, I","venue":null,"work_id":"578d2ea2-9d68-4d47-928c-76590bf52215","year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.475556Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:79ab0a212f8d807be18bd01289422fcbbaaaa60ea394ae9654cdfa9a537b4e6d","observation_id":"4548f864-a8e6-4121-8de4-4dccf28ccb31","resolution":{"observed_at":"2026-08-07T10:44:00.302658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:48.616471Z","title":"W., Wuthrich, M., Miladinovic, D., Locatello, F., Breidt, M., Volchkov, V., Akpo, J., Bachem, O., Sch \\\"o lkopf, B., and Bauer, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.616471Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:2be2ab4efc48cbdf9115e4a6a43dea5b6c0b8701d568b20cc505e3d17f1f4b13","observation_id":"d7707c1f-9cc5-491b-9f06-4cfec0c4212b","resolution":{"observed_at":"2026-08-07T10:43:48.616471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:48.792916Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.792916Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:8222bcefcdfcd6a844f720f2097776ba3f4e752ae69acfee1f04577e785898ae","observation_id":"874e159a-64a7-444a-9236-f3f5f89f4d6d","resolution":{"observed_at":"2026-08-07T10:43:48.792916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:59.930643Z","title":"Data-efficient image recognition with contrastive predictive coding","venue":null,"work_id":"04a055a6-ea70-4923-812a-7d871bf831eb","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.900329Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:295012faaa6800cf50f8d81a7a51f37c4921e7b9adc645803dbfb47fd957a022","observation_id":"7ef80515-c706-4db4-aca2-c786b375c998","resolution":{"observed_at":"2026-08-07T10:44:00.026223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06670","last_updated":"2019-02-22T18:38:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-08-20T19:52:51Z","title":"Learning deep representations by mutual information estimation and maximization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06670","snapshot_observed_at":"2026-08-07T10:43:49.036069Z","title":"D., Fedorov, A., Lavoie-Marchildon, S., Grewal, K., Bachman, P., Trischler, A., and Bengio, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.036069Z"},"links":{"cited_paper":"/paper/1808.06670","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:f45542b8715de113416fa4b31718fb50b4d3de75376c3571afc526b51f962b1d","observation_id":"0a512020-b3a2-41f5-bbf5-824e0b3f5143","resolution":{"observed_at":"2026-08-07T10:43:49.036069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-07T10:43:49.215329Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.215329Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:6810a7ebe01657a2d1f5cfa48667748f52ef3e5c958d9b8d1a19cf50f1d3b60a","observation_id":"1bbcdb1d-fcc1-4784-87f7-40b231187f8a","resolution":{"observed_at":"2026-08-07T10:43:49.215329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:49.347851Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.347851Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:139076893a91fe90f30136b715ed343f02b0b84adce9e8cc0fa36f1e5b0b1b56","observation_id":"d727041e-a611-4070-9a46-134a7a07a660","resolution":{"observed_at":"2026-08-07T10:43:49.347851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T10:43:49.457444Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.457444Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:b27879832ed987a90d5ccbb3ffb50105fee46eb2a20ca0e7ee22086e2b239356","observation_id":"be1423b2-541a-4db9-8811-a469f8706d33","resolution":{"observed_at":"2026-08-07T10:43:49.457444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:59.650734Z","title":"and Fei-Fei, L","venue":null,"work_id":"6133fd48-cc62-4121-9b7d-ed34c60db8f0","year":2015},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.606054Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:3b9d79aae33822e77f3bd3fbbd0490a343cea2c53f09c35be6b82fc46a156f5a","observation_id":"fe53ca34-dbc2-4294-814f-cded60e93e9c","resolution":{"observed_at":"2026-08-07T10:43:59.797740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06329","last_updated":"2025-04-09T12:54:43Z","snapshot_observed_at":"2026-08-09T05:07:05.480172Z","submitted_at":"2023-05-10T17:33:48Z","title":"Similarity of Neural Network Models: A Survey of Functional and Representational Measures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06329","snapshot_observed_at":"2026-08-07T10:43:49.704777Z","title":"Similarity of neural network models: A survey of functional and representational measures","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.704777Z"},"links":{"cited_paper":"/paper/2305.06329","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c7d29c59a6d7bbad844d4bb231cbd86bb0eab286b7d5c77b5870acb5c8fbfa18","observation_id":"f4677737-ea69-4695-b35e-b9960013d66d","resolution":{"observed_at":"2026-08-07T10:43:49.704777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:59.400509Z","title":"Multimodal machine learning in precision health: A scoping review","venue":null,"work_id":"a6c20f1c-7f6b-451a-8be9-445886b33f92","year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.859056Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:d4a0ad8d4df7bfb057ec6294bcd137b48ff7bb2ca56a9d1f48f03d604a2d4d6b","observation_id":"3a06bb49-fb7a-43d5-8a52-b8f2304489a9","resolution":{"observed_at":"2026-08-07T10:43:59.524293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:49.988853Z","title":"Similarity of neural network representations revisited","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.988853Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:b3f206336bad30d66ba7a467b7a982995d3b11e4061ab59050e2fa10eaf86b3e","observation_id":"3b7636c7-31dd-4674-8588-41f0704c3d7d","resolution":{"observed_at":"2026-08-07T10:43:49.988853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:59.165421Z","title":null,"venue":null,"work_id":"b462bb3e-3d6d-40d6-94a5-ba88daa4af3c","year":2015},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.099799Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:d607869a24b9dcce792056272f69cf7c3422bc36a5ebbd8a2dba4ceedd118db5","observation_id":"28c61840-82ea-4352-8c3a-14b92c2ce6a9","resolution":{"observed_at":"2026-08-07T10:43:59.247387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06037","last_updated":"2023-12-12T15:26:38Z","snapshot_observed_at":"2026-07-06T16:59:31.970458Z","submitted_at":"2023-12-10T23:32:55Z","title":"Multimodality of AI for Education: Towards Artificial General Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06037","snapshot_observed_at":"2026-08-07T10:43:50.212754Z","title":"Multimodality of ai for education: Towards artificial general intelligence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.212754Z"},"links":{"cited_paper":"/paper/2312.06037","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:6e870562811c4db3a3ac0abafd91f77da013cd2e684c72e4d828f1d6c3fe96b2","observation_id":"36fa3e8e-4ba8-479f-9bf0-dbec2a285164","resolution":{"observed_at":"2026-08-07T10:43:50.212754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:50.362608Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.362608Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:482269f81056c8fd33575fa25a4dba3ee543e999bfc6a1ab7806ae5a6e936c9a","observation_id":"4dd6bc00-54af-424e-8803-45f2e38014d2","resolution":{"observed_at":"2026-08-07T10:43:50.362608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:50.485083Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.485083Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:40a8ea8f54031893e9f6617b17cce1025d66c043207392b9ffdeb38a5c93867f","observation_id":"4fe12d65-a0ca-4a39-8999-5fd81d3c9909","resolution":{"observed_at":"2026-08-07T10:43:50.485083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:50.599256Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.599256Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:4d9fada721cff515c92f75f18aae9993c4069be65c3722284d7736a2f0f704dc","observation_id":"c375fd7d-65c9-41ed-9dfd-6203a1447be7","resolution":{"observed_at":"2026-08-07T10:43:50.599256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:58.828105Z","title":"W., Zhang, Y., Kwon, Y., Yeung, S., and Zou, J","venue":null,"work_id":"1af740ca-663d-484e-87f3-91295a60a8f9","year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.727904Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:08ae0e759eabdb289cb04496ea47d3b436de5d5932f3ebb921c1d6995d1e6194","observation_id":"83014337-f148-44a0-ab54-c895f621bc11","resolution":{"observed_at":"2026-08-07T10:43:58.974562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:50.897039Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.897039Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c39bf88e96a944f43970d84abde6349654acff1e377ade4ce55f1abc1548fdbd","observation_id":"68a7ea7a-8b4f-43f6-99d1-8d8da587e645","resolution":{"observed_at":"2026-08-07T10:43:50.897039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02893","last_updated":"2018-03-07T22:02:10Z","snapshot_observed_at":"2026-07-06T06:27:10.408557Z","submitted_at":"2018-03-07T22:02:10Z","title":"An efficient framework for learning sentence representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02893","snapshot_observed_at":"2026-08-07T10:43:50.968337Z","title":"and Lee, H","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.968337Z"},"links":{"cited_paper":"/paper/1803.02893","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:199747f8a99f6784890fdd2dc2f62cc9f8438e64f243e5305f9623ce560299c4","observation_id":"81cebd5d-5443-4752-a1a7-5172e172c8c2","resolution":{"observed_at":"2026-08-07T10:43:50.968337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:58.577351Z","title":"dsprites: Disentanglement testing sprites dataset","venue":null,"work_id":"a8c085a2-f917-4d1e-8b7c-6802551d8550","year":2017},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.087163Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:02cbef9af1b1860fc70f8ca728d7c19c5df70f81a8a4c5307cc81d35ef1e6e20","observation_id":"1c1fc2f0-b2cb-4e52-b00f-d5ead15ef354","resolution":{"observed_at":"2026-08-07T10:43:58.716592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:58.351009Z","title":null,"venue":null,"work_id":"79628aff-b778-4ecd-a88b-24d63d191394","year":2017},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.238149Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:dbc69bea1196594cc4c136b9c8437efa8edfa97ac3cae1364a638acb0383fb27","observation_id":"59104b35-e859-4568-b4fa-f06a06361f85","resolution":{"observed_at":"2026-08-07T10:43:58.444717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T10:43:51.373015Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.373015Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:0392967112a25c72cd6daff3d8d96cd7865d2b5907927f67238aabe31a97c2a8","observation_id":"ee5ad851-f58b-4567-9b13-fbbb8969d4e8","resolution":{"observed_at":"2026-08-07T10:43:51.373015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:51.448483Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.448483Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:cd91fd2473b054a3ab95c643e968bf7d6840b7b3351d14c3c6175f42f5ebe5d2","observation_id":"ec22d397-5de3-4705-9d60-db1bb1994bbf","resolution":{"observed_at":"2026-08-07T10:43:51.448483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:51.541369Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.541369Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:80ec9601e7de2a26545cca6c30abad861938b124146741271008166be6759ecb","observation_id":"2214f363-e5bf-4e0d-a0c3-835d3f6bad5f","resolution":{"observed_at":"2026-08-07T10:43:51.541369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:58.132540Z","title":"Svcca: Singular vector canonical correlation analysis for deep learning dynamics and interpretability","venue":null,"work_id":"424d2792-61ba-4edc-a36c-1a85144cf155","year":2017},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.636798Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:270627308e63d78a7c2f7032fab1079347b519a08a27fcb3094fa981f6dbd89e","observation_id":"1349164b-3004-4440-a5f5-f23ff71e7f90","resolution":{"observed_at":"2026-08-07T10:43:58.208963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:57.894147Z","title":"Do vision transformers see like convolutional neural networks? Advances in neural information processing systems, 34: 0 12116--12128, 2021","venue":null,"work_id":"cc4bd1ae-ab6f-449e-9fe0-4e30468905d3","year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.745091Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:3e69d188e070f83093d1d27eb86fda9048fa4920386afeb97d62e8ee19c76cbe","observation_id":"06818af3-0990-423d-8908-e3178ab625ac","resolution":{"observed_at":"2026-08-07T10:43:58.035135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:57.641371Z","title":"Accept the modality gap: An exploration in the hyperbolic space","venue":null,"work_id":"5d0e2344-3842-4f35-973d-e0d1f319d43b","year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.881919Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:6263814acc808e1e00e735be06fbf428452d5f0fb3f1cdd188619277379844ab","observation_id":"ff31bb90-5308-49fb-a9f0-eb47f0acfc3c","resolution":{"observed_at":"2026-08-07T10:43:57.781066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T10:43:51.990399Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.990399Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:b7901f47875088347d51ab79a352a6ac2c9967925e469ef3e88eeada9406e0b1","observation_id":"34b2ccff-159a-4dd4-9823-ffba2d623a6c","resolution":{"observed_at":"2026-08-07T10:43:51.990399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07983","last_updated":"2025-04-16T10:50:18Z","snapshot_observed_at":"2026-07-06T17:59:00.124173Z","submitted_at":"2024-04-11T17:58:06Z","title":"Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07983","snapshot_observed_at":"2026-08-07T10:43:52.101762Z","title":"T., Argus, M., Fischer, V., and Brox, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.101762Z"},"links":{"cited_paper":"/paper/2404.07983","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:7e857f8a56df9769ea045d6030a10049ad5bef3d3f215e3bc8e09e3f5b38f57d","observation_id":"0db09d49-9aa0-466f-8fe7-43051d776125","resolution":{"observed_at":"2026-08-07T10:43:52.101762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:52.260970Z","title":"Facenet: A unified embedding for face recognition and clustering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.260970Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:b3f3e8235d9552f404eab78e90553242df36878fc5409bd7a169a2ac9fefa8cb","observation_id":"0e00e42f-a7e5-45f8-adc0-50ab90b4bd2d","resolution":{"observed_at":"2026-08-07T10:43:52.260970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00810","last_updated":"2017-04-29T17:32:47Z","snapshot_observed_at":"2026-08-08T16:36:13.828301Z","submitted_at":"2017-03-02T14:53:14Z","title":"Opening the Black Box of Deep Neural Networks via Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00810","snapshot_observed_at":"2026-08-07T10:43:52.341489Z","title":"and Tishby, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.341489Z"},"links":{"cited_paper":"/paper/1703.00810","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:976a613eb0d10598112b03b7cd004875e36d47e5b1afbf0a8283467f702f5c97","observation_id":"c3efab6c-daf4-4a0e-9665-33ef5b4aa65b","resolution":{"observed_at":"2026-08-07T10:43:52.341489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:57.361033Z","title":"Human computer interaction","venue":null,"work_id":"2c7a67e0-4221-4db3-8c4b-5404b88f4230","year":2010},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.384067Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:693873ea8ad03ceb58276caa06633e940572c3f7ba3beb1fabca964cd5306d78","observation_id":"41dda261-ebe8-49c0-bc42-5d9d189c7b3b","resolution":{"observed_at":"2026-08-07T10:43:57.499813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:57.110527Z","title":"Contrastive multiview coding","venue":null,"work_id":"7114fe42-215f-4059-878d-2f8502d2fdd2","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.457484Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:4197e053f07410b48128af1e2c0626c9ad057322644b26a4ab03955e55cd6ee9","observation_id":"05550c4d-5d7e-4741-8c5a-d9a3f66ed150","resolution":{"observed_at":"2026-08-07T10:43:57.244198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:56.896580Z","title":"What makes for good views for contrastive learning? Advances in neural information processing systems, 33: 0 6827--6839, 2020 b","venue":null,"work_id":"f40883c9-ebfc-4927-b46a-f43d3136c2eb","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.513864Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:b229a885f2b27ea0898bc0a22fc879ce1184aa9d95e316ea938e31ef381036c2","observation_id":"32e8d6af-9389-4f4e-932f-8b61211d2c4e","resolution":{"observed_at":"2026-08-07T10:43:56.966682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:52.651924Z","title":"and Zaslavsky, N","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.651924Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:7192c311cf636150e870b161d42685da43ba72a5f048b24dd25237c0d1fbc2b0","observation_id":"539c845c-8aa8-417d-aaee-72957ed911c6","resolution":{"observed_at":"2026-08-07T10:43:52.651924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-07T10:46:08.274157Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-07T10:43:52.766923Z","title":"C., and Bialek, W","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.766923Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:46acb09e12101f14550008c953a3ecd72835644a172a42fa19062a39bd76d34c","observation_id":"ae5d9413-d508-4eb9-b504-1bf9d320994a","resolution":{"observed_at":"2026-08-07T10:43:52.766923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05576","last_updated":"2021-03-22T20:40:22Z","snapshot_observed_at":"2026-07-06T09:27:31.979054Z","submitted_at":"2020-06-10T00:21:35Z","title":"Self-supervised Learning from a Multi-view Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05576","snapshot_observed_at":"2026-08-07T10:43:52.837965Z","title":"H., Wu, Y., Salakhutdinov, R., and Morency, L.-P","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.837965Z"},"links":{"cited_paper":"/paper/2006.05576","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:0292320a17c18a0a538b168d56bc82c72fc4bd4c97225764ec8104fd5379afb2","observation_id":"47b54910-45b3-463a-a080-5b925a6afcd6","resolution":{"observed_at":"2026-08-07T10:43:52.837965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:56.613979Z","title":"Understanding and fixing the modality gap in vision-language models","venue":null,"work_id":"bb0629f7-845b-4c04-a6d3-a585d63030be","year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.915797Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:57fde31ece9cc588e70c52052e86629a136c43b02bf813a414db4a6cc023f692","observation_id":"db6bb444-ca00-4158-aed8-5e52c67975ef","resolution":{"observed_at":"2026-08-07T10:43:56.710884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:56.406914Z","title":"Ranking with ordered weighted pairwise classification","venue":null,"work_id":"1f344f55-04f6-4943-b8af-2a3c6ecbca6e","year":2009},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.975279Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:8bec44c81334284b17ce9319cfb69dd74cdda0054050f41b754f4ac9ce4f3ad3","observation_id":"b1cd255c-61ef-4cea-b98b-283d95136806","resolution":{"observed_at":"2026-08-07T10:43:56.503496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:53.034469Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.034469Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c88c2f5b1d86ea172c9d175029a569376a21c777c71331db0c177fcc5d746037","observation_id":"7571d6a9-6fe4-4cbc-b713-12541a4da7d7","resolution":{"observed_at":"2026-08-07T10:43:53.034469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:56.115990Z","title":"and Liu, H","venue":null,"work_id":"f5796fa3-76ce-474d-aa72-8a5c0fc8845c","year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.135692Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:5da9eccb2d50c862a8ec9fb03db2da89a8cc73202344a13cd691c6d68511a78b","observation_id":"201d5b3b-ef90-4609-97d8-0e10bc5204f4","resolution":{"observed_at":"2026-08-07T10:43:56.271112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:55.898041Z","title":"Rethinking minimal sufficient representation in contrastive learning","venue":null,"work_id":"65d13478-c80d-4226-bbae-0a183cb15412","year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.246203Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:918136f48401043a9cccd4d7d7f689e39016f6a7b70dfbe33f5b45d02cd5f730","observation_id":"5353f01a-b5bb-4167-bd6b-342b23a651ff","resolution":{"observed_at":"2026-08-07T10:43:55.983477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:53.333233Z","title":"and Isola, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.333233Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:3cdf4899261ae444f05f07729c11a71b93b7b6512475a39bf27f96996ee2437f","observation_id":"ec1373d0-d0a9-44f5-83eb-6b7116d18087","resolution":{"observed_at":"2026-08-07T10:43:53.333233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:55.741866Z","title":"Disentangled representation learning","venue":null,"work_id":"63b79dfa-5a24-454e-a4ce-d27fcaf6d89b","year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.431053Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:0ce7894654c3d2ae7914f03d62020aecae5873076acd7a713bfb138c2c522df2","observation_id":"133e3845-c0d2-438c-bba2-c5335b980b1f","resolution":{"observed_at":"2026-08-07T10:43:55.805732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:55.541884Z","title":"and Wu, L","venue":null,"work_id":"b18b38fd-1dd7-428c-a341-fb1ae575c757","year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.530973Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:64ac38b5dcf7a9901668e45d28fb3d2754ec00110087e9c5708ebb9578813c26","observation_id":"d2438757-e2ee-401b-9a22-87b6b39c630f","resolution":{"observed_at":"2026-08-07T10:43:55.642412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:55.262077Z","title":"Large scale image annotation: learning to rank with joint word-image embeddings","venue":null,"work_id":"1348ae74-bbf8-4511-babe-7d1adbde810d","year":2010},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.637255Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:870748a2ae02dcb7ccea5236feb93711f0b55bf710588fb0d954a9234935108d","observation_id":"246f2540-ef4c-4778-963c-de6851ae21af","resolution":{"observed_at":"2026-08-07T10:43:55.392339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:53.721604Z","title":"X., and Lin, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.721604Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c5e08d5d9a4277057c2d2aecb43e1e4e369b56ec804c460ac54f72818481ad12","observation_id":"8831b193-84d1-459c-aa61-835e83c4d88b","resolution":{"observed_at":"2026-08-07T10:43:53.721604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:55.043964Z","title":null,"venue":null,"work_id":"3de8dcd3-0bc4-4210-bdb3-40e253ba1897","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.813507Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:838376d9fbc0e48310f753c5588987718b3d98d75dd5b5dd8ba67840381dfc19","observation_id":"ac0b7945-438d-4213-8433-b61b1623e624","resolution":{"observed_at":"2026-08-07T10:43:55.145579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-07T10:43:53.900356Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.900356Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:03ad98e415b8173f47548128db13a7ecbbdf8be975740d9fbe49669a673d967b","observation_id":"1d03ffe8-d8c3-4558-9a22-81ccdd0cfdac","resolution":{"observed_at":"2026-08-07T10:43:53.900356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10689","last_updated":"2020-02-25T06:09:30Z","snapshot_observed_at":"2026-08-02T06:23:27.066738Z","submitted_at":"2020-02-25T06:09:30Z","title":"A Theory of Usable Information Under Computational Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.10689","snapshot_observed_at":"2026-08-07T10:43:53.975431Z","title":"A theory of usable information under computational constraints","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.975431Z"},"links":{"cited_paper":"/paper/2002.10689","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:a80b1d5aa9ce14d68c0c23d4d3c63ef420c958ad93e0a5d1887bbc28204c8595","observation_id":"ccc34d92-69f0-4757-ae50-eb8e762be252","resolution":{"observed_at":"2026-08-07T10:43:53.975431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:54.830300Z","title":null,"venue":null,"work_id":"1b31325a-d0dd-4552-b8a6-84eddc099aac","year":1988},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:54.097936Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:0fddd52af12397650e5b78f51fcfe584b0a4dfe6be469715edcc33d39af95553","observation_id":"badf7ca8-b6ac-4039-878e-f64828ad176c","resolution":{"observed_at":"2026-08-07T10:43:54.922513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:54.223613Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:54.223613Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:dfedb22ca107dcf8afd70d3ae57d372d426bbfd4afe35c54f8a6e4661041e5e1","observation_id":"6db1ae11-4405-4f9e-b140-f5941cf85b96","resolution":{"observed_at":"2026-08-07T10:43:54.223613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T20:19:05.361909Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2506.04870."}