{"as_of":"2026-08-17T17:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b5dd2ace457a6bf24c783909d45a85fe270122cfa91153a4bd01fc1071db1fc","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:43:53.885759Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:21:56.069608Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02088","snapshot_observed_at":"2026-08-04T11:21:56.069608Z","title":"McBE: A multi-task chinese bias evaluation benchmark for large language models.arXiv preprint arXiv:2507.02088,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05291","last_updated":"2026-05-27T02:09:31Z","snapshot_observed_at":"2026-08-13T14:50:11.272229Z","submitted_at":"2025-10-06T18:59:11Z","title":"Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T11:21:56.069608Z"},"links":{"cited_paper":"/paper/2507.02088","citing_paper":"/paper/2510.05291"},"observation_digest":"sha256:61545117f7e7edfecf1f619036d9d9b57f458b28e2841b7a5adc7eeb27d088d7","observation_id":"dcb47e15-903c-4418-9f64-2f1fc147d8d6","resolution":{"observed_at":"2026-08-04T11:21:56.069608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02088/citation-record","integrity":"/paper/2507.02088/integrity","json":"/paper/2507.02088/citation-record.json","paper":"/paper/2507.02088"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:49.123150Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.123150Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:923e61e4b1bb815f76f83b06c11bbbc8485f04413c453af018a7e87189717c16","observation_id":"70abc207-a1eb-458a-8883-cd69d079d4f5","resolution":{"observed_at":"2026-08-06T20:43:49.123150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:49.226291Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.226291Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:4c9a142bbcc76921cd5bd6385aaca729dced8c1d0b070f58473dd706d080e2d6","observation_id":"11fc4adf-2604-49d5-9d04-3ac95f35fba7","resolution":{"observed_at":"2026-08-06T20:43:49.226291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.707422Z","title":null,"venue":null,"work_id":"5d4b76c9-d7d4-4aca-becc-5ff01563e3c1","year":2021},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.315950Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:9b6d2cfbd0aa7cdbfeb159c4b52e9242b053ac29a1f681c6a381cfe99e142a76","observation_id":"b37ad127-5536-4c43-a507-75a2e287896c","resolution":{"observed_at":"2026-08-06T20:43:57.783403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.561020Z","title":null,"venue":null,"work_id":"2c1bcd1a-e625-4eb5-9f74-77dff426cb72","year":2020},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.425837Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:d4e9165ac6e115d6c21a37869df1edc8a63f8b279a89e8680be2948d62e94609","observation_id":"140c1b4a-2550-4dd6-9fcc-5f6760e6fdd9","resolution":{"observed_at":"2026-08-06T20:43:57.633355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.358757Z","title":null,"venue":null,"work_id":"fdbe07d1-d35b-4000-9f41-4c65751e6b11","year":2016},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.527301Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:a68aee5e3a8df0535df772f0f3a70173c3f3e20ae99e67cca9b318b705fe9990","observation_id":"579d1fd5-ec8d-41fb-ba9f-0ca66bfbdd6b","resolution":{"observed_at":"2026-08-06T20:43:57.451103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.206856Z","title":null,"venue":null,"work_id":"ee60a314-63a2-4dac-9386-1a6ffd3c45fe","year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.639647Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:afe1ee376e0dd929699217ae3f2556d90b145a1f6a1bfd12050735f18cf9b3d5","observation_id":"c00e381d-2a85-450b-abe4-4ce14f24f5e6","resolution":{"observed_at":"2026-08-06T20:43:57.259950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:49.752463Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.752463Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:97badb771c556ea2e6b2d794a07d9a2d6e377e1015380fa0d91c36eb692bb380","observation_id":"c74d4ac1-3d19-4634-b0ba-f2bf0f9e0a96","resolution":{"observed_at":"2026-08-06T20:43:49.752463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T20:43:49.853394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.853394Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:03250c8e1693584cab0f37025e40e0407a9e0cf19847f135f1be7ff1571c47c1","observation_id":"5857c4b6-59ff-4de3-9e51-24ceca7200f1","resolution":{"observed_at":"2026-08-06T20:43:49.853394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:49.938219Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.938219Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:eec3df4b1a874b6dc02c5269f492c38fbe718ab9479fd9e59ad2fdb3413b7dca","observation_id":"19d5d1f3-28f0-48ef-9d4e-5c1800b785ee","resolution":{"observed_at":"2026-08-06T20:43:49.938219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15087","last_updated":"2024-10-17T19:30:08Z","snapshot_observed_at":"2026-08-16T15:20:55.831939Z","submitted_at":"2023-06-26T22:07:33Z","title":"WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15087","snapshot_observed_at":"2026-08-06T20:43:50.098492Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.098492Z"},"links":{"cited_paper":"/paper/2306.15087","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:d775a01f476d5307cbe7dc184d64b843fc8c2c7923676c77fc646da5cac1687d","observation_id":"50fd2ee8-154e-4584-9183-5a498eb5753b","resolution":{"observed_at":"2026-08-06T20:43:50.098492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-06T20:43:50.227498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.227498Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:52abb0112466fa87c9b83ef6d34491db9a6f1d91c1b9968a59b1ddd39ecdee74","observation_id":"0a67863e-e0d6-411c-b7e0-bc8d4ec444bc","resolution":{"observed_at":"2026-08-06T20:43:50.227498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.015123Z","title":null,"venue":null,"work_id":"d72111eb-7863-4331-911d-69b624461b57","year":2016},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.433474Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:2d3a1ce6e3e7217b85c14a86520d7f020101f4e9a04caea734ca2d555fec99b7","observation_id":"711881eb-41c9-4394-8e25-1bb9cf8f1e5e","resolution":{"observed_at":"2026-08-06T20:43:57.084220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17553","last_updated":"2024-03-26T10:01:01Z","snapshot_observed_at":"2026-08-16T14:06:20.516668Z","submitted_at":"2024-03-26T10:01:01Z","title":"RuBia: A Russian Language Bias Detection Dataset","version":1},"cited_work":{"arxiv_id":"2403.17553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.17553","snapshot_observed_at":"2026-08-06T20:43:54.486987Z","title":"RuBia: A Russian Language Bias Detection Dataset","venue":"cs.CL","work_id":"51d4fe2c-7b87-443d-8371-113bce06ce77","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.584453Z"},"links":{"cited_paper":"/paper/2403.17553","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:e1dc5ddee7d9064c74b639a98f231a772792e47f9cec63c0683f185026d7bd89","observation_id":"eea9c54a-c79d-48d7-98e3-56ffa50cceb0","resolution":{"observed_at":"2026-08-06T20:43:54.557581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.839678Z","title":null,"venue":null,"work_id":"1516e203-4fb4-4e3a-b4f9-e7a7ae1a854c","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.740044Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:36a496e0b1f93c4218157829805272786365b25e1d2a4abf233d782587f5fc19","observation_id":"b7655efe-803e-4065-804a-cc4b883dbd81","resolution":{"observed_at":"2026-08-06T20:43:56.929909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:50.823334Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.823334Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:026997d4971ca139d8b94cfad38ac4cd9c51e3442f3b771dc74cf911ecb7c964","observation_id":"60f3b0c1-5e71-4e43-a9aa-8466e799799e","resolution":{"observed_at":"2026-08-06T20:43:50.823334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.589190Z","title":null,"venue":null,"work_id":"08084bc1-5b48-431e-9101-34b1990b1fff","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.920491Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:5ea200fc9e4f75690c34a6779e73326104743e68d5eab0cb2effcafa435f0e31","observation_id":"4d597594-5ac7-44a8-87f2-1a412b48ff08","resolution":{"observed_at":"2026-08-06T20:43:56.722708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.459448Z","title":null,"venue":null,"work_id":"a5a865b9-b771-4f55-89f6-d97d10c2ba16","year":2020},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.026171Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:34662bca7764659b90ae8016194e2121c2901db9966cad15c5976ae860962421","observation_id":"21b1fcfc-3760-4be6-9caa-dbbbb477bad0","resolution":{"observed_at":"2026-08-06T20:43:56.520559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.347690Z","title":null,"venue":null,"work_id":"187a5aaa-e147-4f1c-85c2-d3acb751ac64","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.129634Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:a5cd3936a27e3056a837fbc9d0f81b6bc129af56e384d0cbd6a5fed19d6ccd2a","observation_id":"414bec75-ebbf-4aea-a2d0-dc4def6fd23c","resolution":{"observed_at":"2026-08-06T20:43:56.401960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16244","last_updated":"2023-06-28T14:14:44Z","snapshot_observed_at":"2026-08-16T15:20:23.503112Z","submitted_at":"2023-06-28T14:14:44Z","title":"CBBQ: A Chinese Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16244","snapshot_observed_at":"2026-08-06T20:43:51.221195Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.221195Z"},"links":{"cited_paper":"/paper/2306.16244","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:2f9251d8e340e9a468dbff1b0e1a36c91428ec4e09508351858204153994666c","observation_id":"b6ca40df-5202-4e74-9d4c-d7ccea68f00e","resolution":{"observed_at":"2026-08-06T20:43:51.221195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T20:43:51.288121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.288121Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:aef2e202f4d0b5c51690c718b3c0914f1dc0cc20cecb375c242c0866c377a03d","observation_id":"a11af52c-2bf3-4bf4-be6b-59a079bfd91a","resolution":{"observed_at":"2026-08-06T20:43:51.288121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.200234Z","title":null,"venue":null,"work_id":"7a8d1512-57d3-4290-9dc6-987160e9f754","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.461104Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:e38fedc470a7c4fb2214f514f8c9fc1785859de3353a132ee09f8fc00f441baa","observation_id":"c5a13ecc-504a-4c5f-b138-7ef275f6a922","resolution":{"observed_at":"2026-08-06T20:43:56.259778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.041007Z","title":null,"venue":null,"work_id":"5c930b7c-22e6-4dc5-bc2f-014d0a92440f","year":2022},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.569770Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:65b0a9eeec1c56e8dbbc955d90bd35af7055cecb893c153273c21f9e00d5dd11","observation_id":"c98fa4de-2435-4b8c-82be-5c4916487221","resolution":{"observed_at":"2026-08-06T20:43:56.116278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07213","last_updated":"2019-05-17T11:39:21Z","snapshot_observed_at":"2026-08-14T16:30:43.961945Z","submitted_at":"2019-05-17T11:39:21Z","title":"Adaptation of Deep Bidirectional Multilingual Transformers for Russian Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07213","snapshot_observed_at":"2026-08-06T20:43:51.655254Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.655254Z"},"links":{"cited_paper":"/paper/1905.07213","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:78f3e13f54ca44fda115b491c04ee57d898b3982f9875e2b46585ed18ae66254","observation_id":"5ad80883-d926-42b7-9fb2-81e0fe2de551","resolution":{"observed_at":"2026-08-06T20:43:51.655254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.890810Z","title":null,"venue":null,"work_id":"285121d6-e56f-4ec7-a69b-e2a149d6db32","year":2015},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.735395Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:7be3766804882e4ad84a98d58f0bc81114af917670fb84530b9a615662e8c9aa","observation_id":"27243f0e-bde1-493f-bec9-c19cc552c9b8","resolution":{"observed_at":"2026-08-06T20:43:55.959436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04419","last_updated":"2026-05-05T09:32:34Z","snapshot_observed_at":"2026-08-12T16:06:40.953262Z","submitted_at":"2025-02-06T15:20:58Z","title":"Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04419","snapshot_observed_at":"2026-08-06T20:43:51.814181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.814181Z"},"links":{"cited_paper":"/paper/2502.04419","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:44585a01a88dbd2f7c5eca94d37b5524e8127bc51203e5ecaca39c13d8ff8d9b","observation_id":"339dddbf-8122-4751-8ac9-b2e0d8799660","resolution":{"observed_at":"2026-08-06T20:43:51.814181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.729862Z","title":null,"venue":null,"work_id":"bf41bb53-ca14-49c6-961c-f6fc7e3f05ea","year":2020},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.877921Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:440c5e37ee7686a4700ed0e53f22a591895bbee14973273a5560adcd88b8d5cc","observation_id":"67dae05b-d3a9-4b9a-872b-4e1f2c8e8f8b","resolution":{"observed_at":"2026-08-06T20:43:55.791668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:43:51.950417Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.950417Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:0df811e38d6b6923b8fa2b9b271b51f034265fa5c5a04aa96784ada791641808","observation_id":"13fa5e33-fe40-4336-a0d7-54fcc4c693e7","resolution":{"observed_at":"2026-08-06T20:43:51.950417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09456","last_updated":"2020-04-20T17:14:33Z","snapshot_observed_at":"2026-07-06T09:13:46.854094Z","submitted_at":"2020-04-20T17:14:33Z","title":"StereoSet: Measuring stereotypical bias in pretrained language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09456","snapshot_observed_at":"2026-08-06T20:43:52.015253Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.015253Z"},"links":{"cited_paper":"/paper/2004.09456","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:424211b955d29a782a6d0d1b27660367953b40fb715e5ed4e95fd1aff5657bdc","observation_id":"15aaa887-d913-426b-b5e8-10cec00af024","resolution":{"observed_at":"2026-08-06T20:43:52.015253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00133","last_updated":"2020-09-30T22:38:40Z","snapshot_observed_at":"2026-08-16T19:16:42.359587Z","submitted_at":"2020-09-30T22:38:40Z","title":"CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00133","snapshot_observed_at":"2026-08-06T20:43:52.107028Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.107028Z"},"links":{"cited_paper":"/paper/2010.00133","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:617d37ebf2b9f8b4fd972c0719cfd70e960ca92f4fc9ea3af4b50b246b5a3750","observation_id":"956799bb-5b48-4886-a37a-afef76e8b8bd","resolution":{"observed_at":"2026-08-06T20:43:52.107028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.617493Z","title":null,"venue":null,"work_id":"354cda4c-f2c8-4bed-a556-819b6cc9839b","year":2022},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.191096Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:8b2ec373456901555ee644b6a88ee5a0dc71636317c63c0d77aa09e67cd3a23c","observation_id":"822d56e8-7382-462d-8647-94fbd17a5cfe","resolution":{"observed_at":"2026-08-06T20:43:55.668459Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08193","last_updated":"2022-03-16T01:35:45Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T16:43:46Z","title":"BBQ: A Hand-Built Bias Benchmark for Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08193","snapshot_observed_at":"2026-08-06T20:43:52.282476Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.282476Z"},"links":{"cited_paper":"/paper/2110.08193","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:3f68684c3fab64342d926a6c8ae1b59c8f813cda0382bc370d7f166d13a97f69","observation_id":"95106ad7-492a-481e-be92-a869e79e368f","resolution":{"observed_at":"2026-08-06T20:43:52.282476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.502268Z","title":null,"venue":null,"work_id":"e1108d7c-9f8d-4651-baf6-686ad5aad991","year":2021},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.373254Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:60227ab00f17ef8791c3c5c74cb5e3ada1c664a55e26a2da0da75ccfc9cd7fd6","observation_id":"5ed5d67c-23b9-472e-99fb-0df4755d1218","resolution":{"observed_at":"2026-08-06T20:43:55.571998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09301","last_updated":"2018-04-25T00:46:14Z","snapshot_observed_at":"2026-08-14T19:22:19.120539Z","submitted_at":"2018-04-25T00:46:14Z","title":"Gender Bias in Coreference Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09301","snapshot_observed_at":"2026-08-06T20:43:52.465611Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.465611Z"},"links":{"cited_paper":"/paper/1804.09301","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:7caf48e4d6e9f19e3cdc82451fefef29148b10ec19e45e8bde68c8c296251c14","observation_id":"b79a0352-d996-4431-84c1-4747ed27f94c","resolution":{"observed_at":"2026-08-06T20:43:52.465611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20147","last_updated":"2024-04-03T11:59:19Z","snapshot_observed_at":"2026-08-16T14:05:12.715420Z","submitted_at":"2024-03-29T12:32:06Z","title":"IndiBias: A Benchmark Dataset to Measure Social Biases in Language Models for Indian Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20147","snapshot_observed_at":"2026-08-06T20:43:52.544990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.544990Z"},"links":{"cited_paper":"/paper/2403.20147","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:e8d75cb4ecc8afbfb54c4eb323531130bfe85845012af71e8cc218f7b5266fc5","observation_id":"495eeaea-a1db-40cf-9318-d9bb0771aa49","resolution":{"observed_at":"2026-08-06T20:43:52.544990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.336058Z","title":null,"venue":null,"work_id":"5d5543f7-8a91-4ee9-ba6f-9c13c794d25e","year":2025},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.646131Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:0369d74e1ce8baaf2df36dfd2efccb41caac1db97de4f27edb68adeddbd4ccc7","observation_id":"660fae65-61ce-4433-ab83-96b4d6077ec1","resolution":{"observed_at":"2026-08-06T20:43:55.417463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02453","last_updated":"2023-02-05T18:35:21Z","snapshot_observed_at":"2026-08-16T15:57:35.185539Z","submitted_at":"2023-02-05T18:35:21Z","title":"FineDeb: A Debiasing Framework for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02453","snapshot_observed_at":"2026-08-06T20:43:52.727546Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.727546Z"},"links":{"cited_paper":"/paper/2302.02453","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:0f3ece99d26acefac91af065ec8f04fc4dd04510619b6578318d546a934c29cb","observation_id":"188f3a01-cd5b-4912-8827-6a5a68477e9d","resolution":{"observed_at":"2026-08-06T20:43:52.727546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.218940Z","title":null,"venue":null,"work_id":"5d7c47b4-1be4-4342-90f9-05414a7f7293","year":2014},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.818717Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:9ae447fd77bafef8c729e04e814c313f02eb834d14a1a07a05542c89fc9f30d1","observation_id":"33389b95-9cd5-4c41-a542-d58029060d49","resolution":{"observed_at":"2026-08-06T20:43:55.274110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.072391Z","title":null,"venue":null,"work_id":"552a9755-968c-43f9-82e4-08a415670cbe","year":2022},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.864756Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:90f72903650e23e98ab0da66458096e000698ac60091250df23c648e13649fa1","observation_id":"c50c5c8d-83b8-4e69-9b03-7946e5c9643b","resolution":{"observed_at":"2026-08-06T20:43:55.160238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:54.930754Z","title":null,"venue":null,"work_id":"bfdc2160-487c-450c-aafa-31b057475ad9","year":2022},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.940549Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:5f58a5d51aa86276b90cc468ef4f28737153133f878c43889e4d5a49ce6789fd","observation_id":"d8eafa20-d2bf-47d2-b74a-483033cb4afa","resolution":{"observed_at":"2026-08-06T20:43:55.004800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09860","last_updated":"2022-06-20T15:52:40Z","snapshot_observed_at":"2026-08-16T17:14:22.292694Z","submitted_at":"2022-06-20T15:52:40Z","title":"Fewer Errors, but More Stereotypes? The Effect of Model Size on Gender Bias","version":1},"cited_work":{"arxiv_id":"2206.09860","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.09860","snapshot_observed_at":"2026-08-06T20:43:54.152512Z","title":"Fewer Errors, but More Stereotypes? The Effect of Model Size on Gender Bias","venue":"cs.CL","work_id":"aca33c21-cd0a-46db-8ea3-a42704c5863e","year":2022},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.025679Z"},"links":{"cited_paper":"/paper/2206.09860","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:6143198ff4b3f6b7c8cf0262fa48857576dfbc88df7ebf158157a4c0c4b67bf2","observation_id":"5072e452-4ab7-462d-91a6-0ed79477adcb","resolution":{"observed_at":"2026-08-06T20:43:54.221961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:54.817398Z","title":null,"venue":null,"work_id":"4d105d62-52ee-41e1-bcdb-a0bed5d8bda1","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.083634Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:e632b81ca0c6d9f892f561f1fae8fbca26e5ca205adcf2f52d9b277a87d0ecef","observation_id":"8477accb-86c4-4061-846b-7bb701530001","resolution":{"observed_at":"2026-08-06T20:43:54.870070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T20:43:53.162694Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.162694Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:438d493c6e51af54ca13f8be9eac948c027c18ceb253cb9548d7daf9f76a1af5","observation_id":"c61b1df8-725e-4e2f-aba9-29824afb4487","resolution":{"observed_at":"2026-08-06T20:43:53.162694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02463","last_updated":"2023-02-14T21:34:34Z","snapshot_observed_at":"2026-08-16T15:57:34.898224Z","submitted_at":"2023-02-05T19:15:33Z","title":"Nationality Bias in Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02463","snapshot_observed_at":"2026-08-06T20:43:53.240019Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.240019Z"},"links":{"cited_paper":"/paper/2302.02463","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:d0f3d5f28d0c35d3809f028b1d796386cb546d06b575b9a48958d7199fbb19f9","observation_id":"4a1e8297-fdc4-4be5-ac49-e0b56ca7201d","resolution":{"observed_at":"2026-08-06T20:43:53.240019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10508","last_updated":"2025-05-30T22:39:05Z","snapshot_observed_at":"2026-08-16T14:00:30.715802Z","submitted_at":"2024-04-16T12:27:54Z","title":"White Men Lead, Black Women Help? Benchmarking and Mitigating Language Agency Social Biases in LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10508","snapshot_observed_at":"2026-08-06T20:43:53.300456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.300456Z"},"links":{"cited_paper":"/paper/2404.10508","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:b2f57951a72c275d9971d1588980a3ebad438bcfc2d6fbf0123edbda3f78987c","observation_id":"70271fd1-06bf-41e7-8540-248463cab8de","resolution":{"observed_at":"2026-08-06T20:43:53.300456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09219","last_updated":"2023-12-01T19:21:20Z","snapshot_observed_at":"2026-08-16T14:52:18.095948Z","submitted_at":"2023-10-13T16:12:57Z","title":"\"Kelly is a Warm Person, Joseph is a Role Model\": Gender Biases in LLM-Generated Reference Letters","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09219","snapshot_observed_at":"2026-08-06T20:43:53.367103Z","title":"kelly is a warm person, joseph is a role model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.367103Z"},"links":{"cited_paper":"/paper/2310.09219","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:6885c26d553be7d2e8f820d7989f75b26d331d1c884027aa9de9645ce1e69e60","observation_id":"877703ff-2ac7-4b28-be53-30272425dd63","resolution":{"observed_at":"2026-08-06T20:43:53.367103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02408","last_updated":"2025-02-22T02:44:54Z","snapshot_observed_at":"2026-08-16T13:37:41.010075Z","submitted_at":"2024-07-02T16:31:37Z","title":"CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02408","snapshot_observed_at":"2026-08-06T20:43:53.456321Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.456321Z"},"links":{"cited_paper":"/paper/2407.02408","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:610f049dbca2b54d13949f8761b00b712731ba2ad63cc56e4e0c08bb23168981","observation_id":"ff44f5cd-30d7-4cb2-83c9-1110f53c9b92","resolution":{"observed_at":"2026-08-06T20:43:53.456321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-06T20:43:53.513331Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.513331Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:497bc4eee150ad72aef80853719d5236e189d599c5a63c7562f1f6029af95891","observation_id":"1c487782-603d-477f-9d56-0034ad23110a","resolution":{"observed_at":"2026-08-06T20:43:53.513331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02050","last_updated":"2025-06-13T09:44:56Z","snapshot_observed_at":"2026-08-16T13:46:24.910412Z","submitted_at":"2024-06-04T07:31:06Z","title":"JBBQ: Japanese Bias Benchmark for Analyzing Social Biases in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02050","snapshot_observed_at":"2026-08-06T20:43:53.588373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.588373Z"},"links":{"cited_paper":"/paper/2406.02050","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:afe43910520d99b454f7ad3454a89fa462a23780ba6e42a987c21e1ecd8e4046","observation_id":"7ff40210-2587-489d-a6db-d2b757d2e7f4","resolution":{"observed_at":"2026-08-06T20:43:53.588373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-14T19:59:05.307983Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-06T20:43:53.690428Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.690428Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:c0e61b95bcaea617fab3869773b19b8ad05f04a94201c72e51993cb7c45191b5","observation_id":"9137be06-1e66-4d95-857b-bebef2820f60","resolution":{"observed_at":"2026-08-06T20:43:53.690428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11262","last_updated":"2023-05-18T18:58:30Z","snapshot_observed_at":"2026-08-16T15:31:53.600968Z","submitted_at":"2023-05-18T18:58:30Z","title":"CHBias: Bias Evaluation and Mitigation of Chinese Conversational Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11262","snapshot_observed_at":"2026-08-06T20:43:53.769413Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.769413Z"},"links":{"cited_paper":"/paper/2305.11262","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:6842d7157d5650fca948952ae9f682ea278164198a0480b8b19e5b9fbf5bd571","observation_id":"f7a8b70f-23c1-4cb3-9ad5-aeab1bcf4259","resolution":{"observed_at":"2026-08-06T20:43:53.769413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.06876","last_updated":"2018-04-18T18:51:00Z","snapshot_observed_at":"2026-08-14T19:24:31.474740Z","submitted_at":"2018-04-18T18:51:00Z","title":"Gender Bias in Coreference Resolution: Evaluation and Debiasing Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.06876","snapshot_observed_at":"2026-08-06T20:43:53.846796Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.846796Z"},"links":{"cited_paper":"/paper/1804.06876","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:5c58a8dbe32bbd41a9d6f3e5639e389659d944243e1d320cbb047df7f0f3572f","observation_id":"221ed02f-c165-45ca-8ca4-c281abc1fa5f","resolution":{"observed_at":"2026-08-06T20:43:53.846796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:53.858313Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.858313Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:f7943223ca52ca5405a3f40ef2e963812712f43651fda1b1137a68c92c3a0e4c","observation_id":"163053ac-8f4e-47d8-a93c-afba362ab467","resolution":{"observed_at":"2026-08-06T20:43:53.858313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:54.660976Z","title":"Markov, Vladislav Mikhailov, and Alena Fenogenova","venue":null,"work_id":"4ca51db1-d3b3-4f2c-850e-8b3f34930ee3","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.885759Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:33317e0346321b291b79fe69b5b5b64183a5d02d7ee43ce03f6fe085c691bb7e","observation_id":"7cbd701e-4012-4d63-8239-d3eb8b1d673c","resolution":{"observed_at":"2026-08-06T20:43:54.739474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T14:53:38.866223Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2507.02088."}