{"as_of":"2026-08-10T17:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dcb2453b548b4c48f25a3ce87a983677abd92b27c0caadb2e42a37838663f133","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T15:04:35.449560Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:38:00.558288Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01530","snapshot_observed_at":"2026-08-01T17:38:00.558288Z","title":"arXiv preprint arXiv:2502.01530 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26355","last_updated":"2026-07-29T00:08:35Z","snapshot_observed_at":"2026-08-06T21:49:05.066396Z","submitted_at":"2026-07-29T00:08:35Z","title":"Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-08-01T17:38:00.558288Z"},"links":{"cited_paper":"/paper/2502.01530","citing_paper":"/paper/2607.26355"},"observation_digest":"sha256:ee7a6cdd6489d329fab0a5b8ca3d153ce5bba5c120080ae0828af601b1ae0000","observation_id":"d06f6240-a08d-4c04-9a8b-60082a742f1f","resolution":{"observed_at":"2026-08-01T17:38:00.558288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01530/citation-record","integrity":"/paper/2502.01530/integrity","json":"/paper/2502.01530/citation-record.json","paper":"/paper/2502.01530"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.327832Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.327832Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:b6c26726864248e89265e72736b62b64b6fab26fcba7192317c19f5e303e30a3","observation_id":"632f3338-6350-4f67-8c87-82e17ddce842","resolution":{"observed_at":"2026-08-09T15:04:35.327832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.753860Z","title":"Colour-name versus shape-name learning in young children","venue":null,"work_id":"39c95c42-0f9b-4187-9b52-79bc737abaf9","year":1985},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.332776Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:b7c51449e5efae3ad9d16554fff78fd811a7243f237ebdeae1035882ca28f346","observation_id":"29d0f044-b06e-44dd-8eef-d7a3706fb66f","resolution":{"observed_at":"2026-08-09T15:04:35.759882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-09T15:04:35.336573Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.336573Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:5d87c19a8da348938111f91e5b0c4d4c1ccd75664c088424f7ec391f0e142377","observation_id":"4ea83377-4818-4216-a14f-f0b6d31930d4","resolution":{"observed_at":"2026-08-09T15:04:35.336573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.740692Z","title":"Transformers generalize differently from information stored in context vs in weights","venue":null,"work_id":"3c18d6c6-92bc-46b2-a5b2-c6b80c11c941","year":2022},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.340817Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:e4a4c5f6124fa0680e9b9fda07081c363e3743dc25178672ec98cf7e39cdeb3c","observation_id":"1b099067-f2a2-4a7d-be50-53140eb69d77","resolution":{"observed_at":"2026-08-09T15:04:35.745176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.728427Z","title":"The different representational frameworks underpinning abstract and concrete knowledge: Evidence from odd-one-out judgements","venue":null,"work_id":"d9140f5f-f32a-4a93-a23b-d8b996edb9ab","year":2009},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.349461Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:c0cd82ce684f4efedcc5976d0d6fae99dc08b9152b5719a5cbc7b7c0ddfd6e18","observation_id":"4e96c286-cfdd-4e2f-8f61-85c6f9002d54","resolution":{"observed_at":"2026-08-09T15:04:35.732719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.714901Z","title":"Dreamsim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":"7d3fd3a0-afcf-4bcb-a434-ef0671bf60c7","year":2024},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.355141Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:9aa24f9dcd5867290fd57a3b27324c398af8988ad728bf2949908be9f1557084","observation_id":"d5eadd47-6556-4f83-a50a-1ec1702b9579","resolution":{"observed_at":"2026-08-09T15:04:35.719158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.701694Z","title":"Ordering adjectives in referential communication","venue":null,"work_id":"899c6548-0e93-45a8-9a39-d3e1afd29d1c","year":2018},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.359616Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:8930dde82cc1c5d84ed2a1f63bed7469d6dabe19b9355f60b56ef6321da85a3a","observation_id":"aa95eb3f-1628-4291-87da-c49cba0aa8d3","resolution":{"observed_at":"2026-08-09T15:04:35.706032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09193","last_updated":"2025-03-05T19:01:00Z","snapshot_observed_at":"2026-08-04T05:28:06.955488Z","submitted_at":"2024-03-14T09:07:14Z","title":"Can We Talk Models Into Seeing the World Differently?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09193","snapshot_observed_at":"2026-08-09T15:04:35.363001Z","title":"Are vision language models texture or shape biased and can we steer them? arXiv preprint arXiv:2403.09193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.363001Z"},"links":{"cited_paper":"/paper/2403.09193","citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:cda7330b69c4192c7769f58ad5807d998f781916388f039e8c70ecf167bb1bcd","observation_id":"89178649-e182-40a8-8d17-59889033142a","resolution":{"observed_at":"2026-08-09T15:04:35.363001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.366822Z","title":"Imagenet-trained cnns are biased towards texture; increasing shape bias improves accuracy and robustness","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.366822Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:89087e4ec937c20a2bd52b2f8944c6267c23edee3555d658ef259091becaf2f3","observation_id":"919f6bc9-a5dd-4998-ab2a-aa2ffe5cfe16","resolution":{"observed_at":"2026-08-09T15:04:35.366822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.370467Z","title":"Shortcut learning in deep neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.370467Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:c5285a5361c1fc3f878fa227ed12e93d9ec8874aa531ca631e09c283ee08a389","observation_id":"9b6bdda7-6d07-4b76-a214-ac6f42ebfa02","resolution":{"observed_at":"2026-08-09T15:04:35.370467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.374251Z","title":"Partial success in closing the gap between human and machine vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.374251Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:6b005e1b81b195893c65d3b2f1ad77d7b3e97b5d9eb9203cf65620be53401ac8","observation_id":"ed4d4125-e2b0-4a67-80f9-2b11c493c7a9","resolution":{"observed_at":"2026-08-09T15:04:35.374251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.670747Z","title":"Logic and conversation","venue":null,"work_id":"106d0cf2-4233-4156-8730-227b2cfdcc1f","year":1975},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.377893Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:f92766936cd60d5621172071f20b7d88a689e44eb7bf2507f94a32e334e495b6","observation_id":"5c12d530-980f-4d81-bdc0-1643d2ff597f","resolution":{"observed_at":"2026-08-09T15:04:35.674507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.659236Z","title":"Revealing the multidimensional mental representations of natural objects underlying human similarity judgements","venue":null,"work_id":"681a3e5f-5132-4c25-8c62-9ceaecf160c1","year":2020},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.383206Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:70f7f8164fff031b579c1b1f1945e2dcb809bf37c8b71e19712d587b16c99618","observation_id":"3a864aec-8413-4d71-951d-e12c1d91c422","resolution":{"observed_at":"2026-08-09T15:04:35.663386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.645949Z","title":"What shapes feature representations? exploring datasets, architectures, and training","venue":null,"work_id":"f35673db-cae9-4b91-8144-934d5082f266","year":2020},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.389182Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:881fc306026160ee7038493bd51fe0b956c0f7b2e575f79917e7a29d461043e6","observation_id":"be61e304-e86a-44f1-b1c8-7701f53ed20f","resolution":{"observed_at":"2026-08-09T15:04:35.650489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03782","last_updated":"2025-06-05T17:58:57Z","snapshot_observed_at":"2026-08-10T13:51:11.090777Z","submitted_at":"2024-12-05T00:05:11Z","title":"The broader spectrum of in-context learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03782","snapshot_observed_at":"2026-08-09T15:04:35.394368Z","title":"The broader spectrum of in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.394368Z"},"links":{"cited_paper":"/paper/2412.03782","citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:dd50790d4a0f399d583003120f6d1bc4430a145260dd07d751a7e9306d2ea88d","observation_id":"a1404e10-6e47-4563-9899-1ca548c6b98d","resolution":{"observed_at":"2026-08-09T15:04:35.394368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.634287Z","title":"The importance of shape in early lexical learning","venue":null,"work_id":"1cc4b3b8-fea6-416a-95f9-1476c8b85366","year":1988},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.398462Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:0e3c116f96e64db2e00153a0914874f660a56c03abe6d9f91eebac2135dff5d7","observation_id":"815f8d0e-199a-4082-a2fc-e0c1c85c004b","resolution":{"observed_at":"2026-08-09T15:04:35.638485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06509","last_updated":"2025-09-03T10:31:46Z","snapshot_observed_at":"2026-08-10T13:53:33.085803Z","submitted_at":"2024-09-10T13:41:08Z","title":"Aligning Machine and Human Visual Representations across Abstraction Levels","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06509","snapshot_observed_at":"2026-08-09T15:04:35.404895Z","title":"Aligning machine and human visual representations across abstraction levels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.404895Z"},"links":{"cited_paper":"/paper/2409.06509","citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:5291977456ddef0a0fc9cc88cde0029532af24e65e16e11e87e29a28bf9b7d92","observation_id":"949b7e2e-0fcb-4415-bd04-dd239d8e855f","resolution":{"observed_at":"2026-08-09T15:04:35.404895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.412082Z","title":"Adversarial training for free! Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.412082Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:25746f0fb9003471c3a64c0262719854758a0f5b9cbc5e1922f97b9d18f474db","observation_id":"56766abc-6cfe-4bbc-9c7e-adae61da79d4","resolution":{"observed_at":"2026-08-09T15:04:35.412082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-09T15:04:35.416921Z","title":"Intriguing properties of neural networks, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.416921Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:1c51332ab9b068d6208376c5dfb8862b04fd5f624c1843ff3d7481e323a818d3","observation_id":"02f32883-6932-4d63-916f-9d85c6e4a1b1","resolution":{"observed_at":"2026-08-09T15:04:35.416921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.612733Z","title":"What does kiki look like? cross-modal associations between speech sounds and visual shapes in vision-and-language models","venue":null,"work_id":"f0670dcc-510a-40fa-b23c-27b0c0e237e1","year":2024},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.421381Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:894c877cae98cbaaa35b4bf75f83ecc8dd09c9b2817ff4c9395d74c896a7f88b","observation_id":"3dd74afd-215a-4f9c-aea2-66a248d522d4","resolution":{"observed_at":"2026-08-09T15:04:35.616811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03846","last_updated":"2023-03-08T07:37:43Z","snapshot_observed_at":"2026-08-10T13:53:36.347431Z","submitted_at":"2023-03-07T12:24:17Z","title":"Larger language models do in-context learning differently","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03846","snapshot_observed_at":"2026-08-09T15:04:35.425399Z","title":"Larger language models do in-context learning differently","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.425399Z"},"links":{"cited_paper":"/paper/2303.03846","citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:e131a3e4a746f9a6ec39c217725049b5eeb5a5b1158b982954537108c1189cba","observation_id":"23296d28-0426-4f7e-b581-d67b34d7db99","resolution":{"observed_at":"2026-08-09T15:04:35.425399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.598535Z","title":"Word learning as bayesian inference","venue":null,"work_id":"b1e7e5a8-2692-495a-94e5-4dbbe30f7e4f","year":2007},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.429873Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:b60ff424f1cef05bce2498a5d8dc384e20e01fe4c2fb77d43aa5aa7576067632","observation_id":"2c06b120-441d-44ef-b34e-7e0eff0858d3","resolution":{"observed_at":"2026-08-09T15:04:35.604365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.433581Z","title":"What makes good examples for visual in-context learning? Advances in Neural Information Processing Systems, 36: 0 17773--17794, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.433581Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:40e861fdc7fa8b3dfdc69fe1e04cd9216e2957d3c61dc717b27940f632e5e8fe","observation_id":"0fa84074-350b-4d98-b226-d267066c5e05","resolution":{"observed_at":"2026-08-09T15:04:35.433581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.437148Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.437148Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:36bccb08d46a814859599e401cd1e0e208c27b596507d0e7fee994da6441161f","observation_id":"b3d06aa3-6000-40c4-8135-710786633bab","resolution":{"observed_at":"2026-08-09T15:04:35.437148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.441637Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.441637Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:9d678fa1c334c1357c6bc3a5fbae780854ee0b99acee83c0245c338b2561ba4b","observation_id":"8ac483a6-3e46-4cfc-b126-80dbfd4a62d6","resolution":{"observed_at":"2026-08-09T15:04:35.441637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.445663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.445663Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:c8ef033e19eec66e59dc61de7d18e846d12854ddf13d7b483c0dc205fe27ff4b","observation_id":"8b0d6d83-99cb-4a88-a8e6-dbfcbc83db96","resolution":{"observed_at":"2026-08-09T15:04:35.445663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:04:35.449560Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T15:04:35.449560Z"},"links":{"citing_paper":"/paper/2502.01530"},"observation_digest":"sha256:7e5691f3eb8c94f21a89caff31470e989a481ca6f186285f622dd555d8099ef1","observation_id":"9337145e-ba16-43af-83e0-bb3fd8fcbe85","resolution":{"observed_at":"2026-08-09T15:04:35.449560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01530","last_updated":"2025-03-13T21:35:13Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T13:51:47.919882Z","submitted_at":"2025-02-03T17:11:03Z","title":"The in-context inductive biases of vision-language models differ across modalities"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2502.01530."}