{"as_of":"2026-08-13T11:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf058d3c1107d345551fcc139537004549e489f5b77310af90a732f223bd8e58","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:15:49.702336Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.16762/citation-record","integrity":"/paper/2508.16762/integrity","json":"/paper/2508.16762/citation-record.json","paper":"/paper/2508.16762"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.502637Z","title":"To- wards measuring and modeling “culture” in LLMs: A sur- vey","venue":null,"work_id":"172f0954-360b-4928-8188-d5b296e2cb80","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.487041Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:e2156186a155b4b3f1a8cbb80c1eda6f8fa1396eb36d74748399fcba3feb946f","observation_id":"b2c894af-23a1-4d9e-874a-f1d50757802f","resolution":{"observed_at":"2026-08-05T17:15:50.507144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13231","last_updated":"2024-07-06T12:23:56Z","snapshot_observed_at":"2026-08-13T04:14:18.034604Z","submitted_at":"2024-02-20T18:47:28Z","title":"Investigating Cultural Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13231","snapshot_observed_at":"2026-08-05T17:15:49.496287Z","title":"Investigating cultural alignment of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.496287Z"},"links":{"cited_paper":"/paper/2402.13231","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:3cb8d64bed62b7c7c232be7418d1b61ec8c7a7897a0a14098d79a0aba5d6f6a9","observation_id":"e6385693-90d8-416f-9ec7-ffe9cbb1395b","resolution":{"observed_at":"2026-08-05T17:15:49.496287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13722","last_updated":"2025-08-28T17:30:05Z","snapshot_observed_at":"2026-07-06T12:52:34.302457Z","submitted_at":"2022-03-25T15:45:49Z","title":"Probing Pre-Trained Language Models for Cross-Cultural Differences in Values","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13722","snapshot_observed_at":"2026-08-05T17:15:49.502065Z","title":"Probing pre-trained language models for cross-cultural dif- ferences in values","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.502065Z"},"links":{"cited_paper":"/paper/2203.13722","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:d0044945b84a2d3e8b2377ba5a45d33b81e895aa0927c23a5977ad809d400723","observation_id":"e26cacf3-710f-4600-b4af-5286c44cab1c","resolution":{"observed_at":"2026-08-05T17:15:49.502065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.483213Z","title":"Probing pre-trained language models for cross-cultural dif- ferences in values","venue":null,"work_id":"2c52720a-81bf-4539-a3b6-b6934b3d4ba9","year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.511930Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:aba8731b2f8bebbb9f5a65dd0cf1f313abbe16bac5a4e98fab26e6aa672fb939","observation_id":"eeff2b56-5420-42a3-a3ee-a0d9ff2c354e","resolution":{"observed_at":"2026-08-05T17:15:50.488957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.465268Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"b7694de9-c3b5-4992-af28-d465eb4d6b19","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.518870Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:45eda80c96df8ba8cf6cd87ca3075b61076ec29d50c8287596f5982128706627","observation_id":"66a2cf49-afc4-4e96-b9ad-aeec69601ceb","resolution":{"observed_at":"2026-08-05T17:15:50.470713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.445867Z","title":"Venkatesh Babu, and Danish Pruthi","venue":null,"work_id":"ab991fb4-292d-498c-83d3-ebadbd9f2a2b","year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.526751Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:2bca7b8d79430f7d25fce1403838fd7ea468a39d7ca21f04ec4f8108cae8232a","observation_id":"4f13b1f1-b300-4206-8e75-309ffe398716","resolution":{"observed_at":"2026-08-05T17:15:50.451398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.429562Z","title":"From local concepts to univer- sals: Evaluating the multicultural understanding of vision- language models","venue":null,"work_id":"6d59987e-6999-4646-864b-b78cf99ffe3b","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.534440Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:99e69f9f3200976f36bcad28c1d0cc3a7c5c90c0f5b19f1ca7f81862aa1b2c31","observation_id":"91957dbb-4d85-4206-aead-d19ce5c8ec25","resolution":{"observed_at":"2026-08-05T17:15:50.434223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.414794Z","title":"Extrinsic evaluation of cultural competence in large language models","venue":null,"work_id":"c840702f-267e-4016-8ff3-ca64e9877525","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.540424Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:f2701e509bdc201e2cda57d943c6ef3bf995047c0a1277179bc7e76c366f69e4","observation_id":"97432fa6-e243-42be-9367-9868606a8645","resolution":{"observed_at":"2026-08-05T17:15:50.419391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.255227Z","title":"Language (technology) is power: A critical sur- vey of “bias” in NLP","venue":null,"work_id":"7765183d-a426-4f3b-982a-1714114a9c1b","year":2020},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.545812Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:d8525e1bd0c4606336f9376b765e06a39f8750d7f61987e51204f4b9a22ed0a1","observation_id":"ce25a871-4a72-407e-9cf4-76306ed76a63","resolution":{"observed_at":"2026-08-05T17:15:50.400342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17466","last_updated":"2023-03-31T15:02:48Z","snapshot_observed_at":"2026-08-12T10:48:23.734236Z","submitted_at":"2023-03-30T15:43:39Z","title":"Assessing Cross-Cultural Alignment between ChatGPT and Human Societies: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17466","snapshot_observed_at":"2026-08-05T17:15:49.550399Z","title":"Assessing cross-cultural alignment between chatgpt and human societies: An empirical study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.550399Z"},"links":{"cited_paper":"/paper/2303.17466","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:5e571297bbd0402c035bcd629e5c41f39c8d0a302bf3a24b0dd9ae96e3d9dade","observation_id":"b419d52b-e392-4a3a-9732-fd291315fdf8","resolution":{"observed_at":"2026-08-05T17:15:49.550399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.239135Z","title":"MaXM: Towards multilingual visual question an- swering","venue":null,"work_id":"4e278281-ef90-4895-85e7-7b91464d669f","year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.556238Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:eeacbbb6175ff7a30dfdabd993048c07cdcc5f09da8a5d73ac64f806ee562490","observation_id":"9f93418e-cef3-412c-af0f-cd8c33a085aa","resolution":{"observed_at":"2026-08-05T17:15:50.244100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.212991Z","title":"The SAGE handbook of intercultural competence","venue":null,"work_id":"cc6cc125-ffc8-4a27-be6b-a78dfe385d92","year":2009},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.566255Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:97d2e6825f90c450a447be7b3318900b7c716c67ab8eaccb65552ff1b3c2e334","observation_id":"bd15319a-ccc5-41a6-b263-edc9fac94030","resolution":{"observed_at":"2026-08-05T17:15:50.217411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16388","last_updated":"2024-04-12T00:05:53Z","snapshot_observed_at":"2026-07-30T00:01:16.818092Z","submitted_at":"2023-06-28T17:31:53Z","title":"Towards Measuring the Representation of Subjective Global Opinions in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16388","snapshot_observed_at":"2026-08-05T17:15:49.570715Z","title":"Towards measuring the representation of subjec- tive global opinions in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.570715Z"},"links":{"cited_paper":"/paper/2306.16388","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:cc98fd8510e65b39dba23db4655243d6a25e7c0199b2e51c6ca610a0e87d690f","observation_id":"44af451b-f7bc-47fb-ac35-773a8126fcff","resolution":{"observed_at":"2026-08-05T17:15:49.570715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.196936Z","title":"”i wouldn’t say offensive but...”: Disability-centered perspectives on large language models","venue":null,"work_id":"6b2a3bbe-73e8-4b2a-8335-a89e0a4d127c","year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.575968Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:f9658d024d6cae86250d5399aea5ca1ae2c861b5a488539d32b691d3f5b875dd","observation_id":"f5c7ff0f-a9b3-41d4-9292-2a671d4991b2","resolution":{"observed_at":"2026-08-05T17:15:50.201890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.177498Z","title":"World values survey: Round seven - country-pooled datafile version 5.0, 2022","venue":null,"work_id":"7c45ddc3-3304-467a-a0ea-5fcd3683a3be","year":2022},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.581681Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:b988dc5b15dd03f4b4e6abf620aadf58b4fff519813db1f00c467e2654947d86","observation_id":"36a82315-2055-48ba-be2e-18e18cb78857","resolution":{"observed_at":"2026-08-05T17:15:50.183490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.157622Z","title":"Challenges and strategies in cross- cultural NLP","venue":null,"work_id":"f38552db-68cd-4592-8346-5ff9d775f689","year":2022},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.586036Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:53115e9aaa1619d93e4fbbdbdb46e15e9fabb75f0b7b9b30772a4a93b07203f5","observation_id":"6a98888b-6b7f-41f2-9525-77fb27da3e41","resolution":{"observed_at":"2026-08-05T17:15:50.161813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.143014Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning, 2022","venue":null,"work_id":"1848439e-04f4-4e4e-898a-1c4fb044e307","year":2022},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.591603Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:accb68ff3ef2234536a7773989a9c242c24bb9958e62223aa59f25b9a26a8dbd","observation_id":"ab7e2c3b-6d81-492f-8621-97fa4e3f144a","resolution":{"observed_at":"2026-08-05T17:15:50.147569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.129529Z","title":"Dimensionalizing cultures: The hofstede model in context","venue":null,"work_id":"0fc581ca-2b7a-4c01-9b92-c0ae1acc24fc","year":2011},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.601101Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:6a56437dad944c7fed8a0dc41f23ac0c3480cb41d04157795a22756198f149eb","observation_id":"8a2bcde3-1a01-4517-bc7d-f93ac753c396","resolution":{"observed_at":"2026-08-05T17:15:50.133979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16019","last_updated":"2024-12-03T16:18:10Z","snapshot_observed_at":"2026-08-13T00:22:53.103037Z","submitted_at":"2024-04-24T17:51:36Z","title":"The PRISM Alignment Dataset: What Participatory, Representative and Individualised Human Feedback Reveals About the Subjective and Multicultural Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16019","snapshot_observed_at":"2026-08-05T17:15:49.605724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.605724Z"},"links":{"cited_paper":"/paper/2404.16019","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:f9299b6cfd2cc5aad87f3a43a01be04621f7af7b04348301a64102d1fc2b59b7","observation_id":"07b5b54a-1e3c-40a4-961c-e0fe3acb6855","resolution":{"observed_at":"2026-08-05T17:15:49.605724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.115980Z","title":"Visually 9 grounded reasoning across languages and cultures","venue":null,"work_id":"5901873d-21c2-46cc-8ee7-93b0c7a45a99","year":2021},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.613174Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:7797a17f8fdab2b350c539f682091ff44e53cbef36f7f043c83dbaecb19a7e55","observation_id":"51157317-dd22-42c3-8893-0d9745f895a1","resolution":{"observed_at":"2026-08-05T17:15:50.120240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.101202Z","title":"Wong, Qing- song Wen, Lichao Sun, Haipeng Chen, Xing Xie, and Jin- dong Wang","venue":null,"work_id":"90ff689d-7832-4495-a4a0-18dc5c655c82","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.619857Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:759a796e6fecbf7702d674a3f61cbf744c71ad5df466061acd6bb8e3d52f9a3c","observation_id":"7b1f3961-56ea-4081-9caa-e6ffaeb19ea3","resolution":{"observed_at":"2026-08-05T17:15:50.106486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.083974Z","title":"Smolvlm: Re- defining small and efficient multimodal models, 2025","venue":null,"work_id":"4b6393cf-a8e0-45a4-9d3f-83f8c3fffbc2","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.624563Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:21cd5abf54a092643d918a45002ed3b548d1da39e4485b01294241005c6cb19b","observation_id":"feb9ebcd-dc92-4475-8b1b-1c7fc41cec29","resolution":{"observed_at":"2026-08-05T17:15:50.089084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12342","last_updated":"2024-05-08T14:48:39Z","snapshot_observed_at":"2026-08-13T10:27:37.646163Z","submitted_at":"2023-08-25T14:50:13Z","title":"Cultural Alignment in Large Language Models: An Explanatory Analysis Based on Hofstede's Cultural Dimensions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12342","snapshot_observed_at":"2026-08-05T17:15:49.632259Z","title":"Cultural alignment in large language models: An explanatory analysis based on hofst- ede’s cultural dimensions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.632259Z"},"links":{"cited_paper":"/paper/2309.12342","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:57d1a579d55a2d5aceea7be1d60ce2db49d59d3e4c5c08dc37fd1bc4e47f0204","observation_id":"382ea78f-496d-486c-b6c1-0567dd6a0531","resolution":{"observed_at":"2026-08-05T17:15:49.632259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.065101Z","title":"Assessing demographic bias in named entity recognition, 2020","venue":null,"work_id":"d26519bc-1733-47bb-a9d3-f7bcf8bd2346","year":2020},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.638211Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:aa0253713dd055d919ca5b892c848bdbf9643c75a7ba7d2dcfdc16083c63d0c8","observation_id":"b035525d-fed5-4b4d-b39f-9d007f0fa8ef","resolution":{"observed_at":"2026-08-05T17:15:50.071548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.048511Z","title":"Benchmarking vision language models for cultural understanding","venue":null,"work_id":"8912f4d5-dec6-45a3-8443-8140b7e77a51","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.642962Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:50ca37bd233215fa7660a65bdb358211916339cbff4a5134bcbcc7f590901c0c","observation_id":"e4b1d5bd-0ba2-4192-bea4-f45810b8508b","resolution":{"observed_at":"2026-08-05T17:15:50.053582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.026339Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"60a8d240-3628-494b-b257-b494ff8cc983","year":2002},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.647539Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:96f358c7e4e49c3b1408db83b919806ffe7b2c3d5a84e0b3857d831fb5c243b3","observation_id":"56c09c94-b480-49b8-b306-f218cdf8f666","resolution":{"observed_at":"2026-08-05T17:15:50.034075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01857","last_updated":"2023-06-02T18:23:35Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T18:23:35Z","title":"Knowledge of cultural moral norms in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01857","snapshot_observed_at":"2026-08-05T17:15:49.655207Z","title":"Knowledge of cultural moral norms in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.655207Z"},"links":{"cited_paper":"/paper/2306.01857","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:bdec162e7797aea2d48496ba0e45d00eea65c54ee183a13cf5cac1f47fecf485","observation_id":"6f975014-75c2-46a3-9868-a7711e77cba0","resolution":{"observed_at":"2026-08-05T17:15:49.655207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.002807Z","title":"Normad: A benchmark for measuring the cultural adaptability of large language mod- els","venue":null,"work_id":"391325c7-48ec-453d-9cb6-b68ba8768dc7","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.664060Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:3f52075c2fab478c1216ef3673567e490e6e57c0bf3ae87029a1449e4a3ee0ff","observation_id":"1694d9d3-b235-4ed8-beb3-5dc8c4667c2c","resolution":{"observed_at":"2026-08-05T17:15:50.007915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.981640Z","title":"Cvqa: culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":"a225c217-5a0b-4141-aab7-5c598f50208f","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.669594Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:f9e080a42951201bbe8cb29c08a64d00a3e4250d88119349d7b9e2b41900873c","observation_id":"bcbf7f3f-335a-4d07-8dfa-752d6484d6a3","resolution":{"observed_at":"2026-08-05T17:15:49.988507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.964238Z","title":"Geographical erasure in language generation","venue":null,"work_id":"e600a32d-bf46-42ed-b254-cf04bdb676f2","year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.676360Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:270d05db73a530692476e61aa813b4763e2029f16f9899a4b1bc1ea72d68f381","observation_id":"4caac69a-eeaa-4e52-9984-a26eca4641b5","resolution":{"observed_at":"2026-08-05T17:15:49.969879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.948783Z","title":"Cultural bias and cultural alignment of large language mod- els","venue":null,"work_id":"b5ebae3f-df04-4bd6-93be-4a6550f8e079","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.683290Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:5775205dad2cad51679e04cacc3f854ccb7225ff1bd1d8e9b9e0bdf62dd0ca09","observation_id":"8ea07621-8980-4273-b82c-8f15f33284f4","resolution":{"observed_at":"2026-08-05T17:15:49.953680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.928634Z","title":null,"venue":null,"work_id":"acd18de6-c60d-41d1-aeed-b8173c9f7ecc","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.689074Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:e2afcd5f50fc07845fd3d461bbef47818ac15fba066d4caf116248f1812ad212","observation_id":"79701dd4-3670-4960-82c9-139fbec99289","resolution":{"observed_at":"2026-08-05T17:15:49.933681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.909082Z","title":"Broaden the vision: Geo-diverse visual com- monsense reasoning","venue":null,"work_id":"79bcac01-44fb-4c94-bf99-556d47f7b912","year":2021},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.694750Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:ff0df7c40832755b674111735ae6a42f1b3cfb1fc1a6a8f47ee97adcb62d4c60","observation_id":"cc5f8c52-4426-499d-8f33-852afcc446fe","resolution":{"observed_at":"2026-08-05T17:15:49.914244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.889012Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"b177fd6e-8514-44d9-bb54-c6e277605d72","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.702336Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:52c3b9e76ed5b1276b8d4b05f155e49f6be97a785b07b8cfa58ca70e7f1e08f4","observation_id":"76a60ec6-aed8-4285-85f8-955bc4c04e0c","resolution":{"observed_at":"2026-08-05T17:15:49.897339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.561069Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.561069Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:7236471006a1fef3024943a1117c3c44f24d476a34802c6e3d0bb03ec03cc5ba","observation_id":"0e39aa5f-683e-468c-932e-56a15a210dc5","resolution":{"observed_at":"2026-08-05T17:15:49.561069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T12:32:21.470492Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2508.16762."}