{"as_of":"2026-08-09T11:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1dc4c5e9d38c92f9ce887dd97c8419997d593c46e1df27dd76bb9e5d67116698","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:16:11.626141Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19949/citation-record","integrity":"/paper/2607.19949/integrity","json":"/paper/2607.19949/citation-record.json","paper":"/paper/2607.19949"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.05459","last_updated":"2024-05-08T06:16:23Z","snapshot_observed_at":"2026-08-02T13:57:57.119489Z","submitted_at":"2024-01-10T09:25:45Z","title":"Personal LLM Agents: Insights and Survey about the Capability, Efficiency and Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05459","snapshot_observed_at":"2026-08-01T11:16:11.566766Z","title":"Personal LLM agents: In- sights and survey about the capability, efficiency and security,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.566766Z"},"links":{"cited_paper":"/paper/2401.05459","citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:bc820a7eeb1ec1a15bfa767eba2d3b4d30fdd21344415931796b20a3ff6cfa5b","observation_id":"782ee592-9f37-4862-9691-9917e79dc242","resolution":{"observed_at":"2026-08-01T11:16:11.566766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-07T08:11:20.950548Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-01T11:16:11.571389Z","title":"AndroidWorld: A dynamic benchmarking environment for autonomous agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.571389Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:a93222c017fcfb3b6c884c68e25ba96858e95ba4ba8cac3c7c0efab248f02165","observation_id":"8dbaf61d-892a-4368-9d18-ddf51eab70a4","resolution":{"observed_at":"2026-08-01T11:16:11.571389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.574599Z","title":"MobileWorld: Benchmarking autonomous mobile agents in agent-user interactive and MCP-augmented environments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.574599Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:d790d6cb23b4d737a5e34601edc422ac9b0587e9eea799ef611c392327c8507c","observation_id":"55bfb42d-4089-4f55-bfd6-bbfb934051db","resolution":{"observed_at":"2026-08-01T11:16:11.574599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.577375Z","title":"A survey on evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.577375Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:35041562a712052757e6df983aedb3940f5d263a3f107001be64b34b81ffd646","observation_id":"cc641c5d-932c-461c-9acd-c375094a9ff3","resolution":{"observed_at":"2026-08-01T11:16:11.577375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.580117Z","title":"A survey on LLM-as-a-judge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.580117Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:42c5f65f36492bf8c21b644a622363b407879e39be0f1a6d96908cb516308b40","observation_id":"27e5f41a-b1de-41f8-a4b7-578ef525b564","resolution":{"observed_at":"2026-08-01T11:16:11.580117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.583613Z","title":"Test oracle automation in the era of LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.583613Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:a6c6fa4e18bb919d10fd3cc35534fa268ecae41538159ce360113ec3ec204c70","observation_id":"99b3ad91-3b21-46ba-aa08-f1b38a5dc336","resolution":{"observed_at":"2026-08-01T11:16:11.583613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.586676Z","title":"State-grounded multi-agent synthetic data generation for tool-augmented LLMs,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.586676Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:77bf344c1c9fb4d9d32e4ee542db6d25267f6b536ae5716c719008b7df7b9c32","observation_id":"e93d289a-a1de-44a8-ad96-dc97a74544ad","resolution":{"observed_at":"2026-08-01T11:16:11.586676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.589559Z","title":"AutoDroid: LLM- powered task automation in Android,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.589559Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:e520c1cd709f578b411fabeba21a0ec9d672b4cf578c0f8dc6f7c088bc2b226b","observation_id":"758affce-46c2-4264-ad9f-06768281f96e","resolution":{"observed_at":"2026-08-01T11:16:11.589559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.593027Z","title":"GPTV oiceTasker: Advancing multi-step mobile task efficiency through dynamic interface exploration and learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.593027Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:4c7dc434bc7d984302055cf0562bf4924c3b9efb685de8eda912c62f3774aa33","observation_id":"8b08d951-f25b-4ba6-be61-0088afa7d432","resolution":{"observed_at":"2026-08-01T11:16:11.593027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08755","last_updated":"2024-04-12T18:28:44Z","snapshot_observed_at":"2026-08-04T02:35:48.210622Z","submitted_at":"2024-04-12T18:28:44Z","title":"Training a Vision Language Model as Smartphone Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08755","snapshot_observed_at":"2026-08-01T11:16:11.595838Z","title":"Training a vision language model as smartphone assistant,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.595838Z"},"links":{"cited_paper":"/paper/2404.08755","citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:949a39bbf70293f640a2f0994f47ed6916bee1e70c214cc77f1f253c63258575","observation_id":"5fe55f0f-b8cb-4772-9820-5fa2c5d4dd13","resolution":{"observed_at":"2026-08-01T11:16:11.595838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.598887Z","title":"SmartBench: Is your LLM truly a good Chinese smart- phone assistant?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.598887Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:1ded822b0dd00cc96f06302ad97b31aead25de9083bfbc22c6b6c964cd93b328","observation_id":"1c0d6778-23c8-4a6b-9ddc-8a154cda49ba","resolution":{"observed_at":"2026-08-01T11:16:11.598887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.601411Z","title":"Large language models empowered agent-based modeling and simulation: A survey and perspectives,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.601411Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:162e806d25a1ea3ad226d4c0ccb139e74920842f15d62f608d24929dfc559781","observation_id":"1f884c87-7bba-400a-b822-682e121af4e3","resolution":{"observed_at":"2026-08-01T11:16:11.601411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03442","last_updated":"2023-08-06T00:21:19Z","snapshot_observed_at":"2026-07-06T15:13:13.695535Z","submitted_at":"2023-04-07T01:55:19Z","title":"Generative Agents: Interactive Simulacra of Human Behavior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03442","snapshot_observed_at":"2026-08-01T11:16:11.604135Z","title":"Generative agents: Interactive simulacra of human behavior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.604135Z"},"links":{"cited_paper":"/paper/2304.03442","citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:778952764cbff23561d62e044a0b9958139a571599b05b1d0d00f9dcf13c9357","observation_id":"212a255a-602d-473d-b0fe-e4ec2fc53984","resolution":{"observed_at":"2026-08-01T11:16:11.604135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10109","last_updated":"2026-06-28T22:37:51Z","snapshot_observed_at":"2026-07-06T19:50:52.652955Z","submitted_at":"2024-11-15T11:14:34Z","title":"LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10109","snapshot_observed_at":"2026-08-01T11:16:11.607015Z","title":"LLM agents grounded in self-reports enable general- purpose simulation of individuals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.607015Z"},"links":{"cited_paper":"/paper/2411.10109","citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:346f65e5fdab5aa911cc304acff9df8295bfb2a5c23b2ac89456add2f22408cc","observation_id":"ec0901b9-30b6-4e9a-a1a9-5f0c97101493","resolution":{"observed_at":"2026-08-01T11:16:11.607015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.609930Z","title":"A survey on digital twin: Definitions, characteristics, applications, and design implications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.609930Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:d9da7d4616ad186578884789f9fb183db1a2bff72b227887863916032224e6f3","observation_id":"62c23634-4976-4e12-9fc0-01a183afb79e","resolution":{"observed_at":"2026-08-01T11:16:11.609930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.612611Z","title":"Digital-twin-based testing for cyber-physical systems: A systematic literature review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.612611Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:697e05f2a67877355384d322fc7469d6c692ae15afbbbe6e88940a678c60a977","observation_id":"7ba2aadd-735b-4016-bee5-6eeb3c5730e6","resolution":{"observed_at":"2026-08-01T11:16:11.612611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.615106Z","title":"Digital twins in soft- ware engineering—a systematic literature review and vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.615106Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:638fd5b190259a1d37fd19868ca840e25cf46d6c6a7e607fa801e648d6bc2b89","observation_id":"ce6e4a89-10b3-49ca-9587-caf0b7a59604","resolution":{"observed_at":"2026-08-01T11:16:11.615106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.618035Z","title":"The oracle problem in software testing: A survey,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.618035Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:d17416b3bd16633f1c6856ed620c748e9d2071493c5e999b47cf95a6cbc9281d","observation_id":"34a48ca8-f923-42d4-b137-55fd81630abb","resolution":{"observed_at":"2026-08-01T11:16:11.618035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.620631Z","title":"Challenges in testing large language model based software: A faceted taxonomy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.620631Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:68c18bd85e24c0059952c95e6367402458e256aea4f0caeb1764e48a0c67c3e6","observation_id":"7460673a-a189-443e-b8ff-51e205613ef1","resolution":{"observed_at":"2026-08-01T11:16:11.620631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:16:11.623050Z","title":"An empirical study of the non-determinism of ChatGPT in code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.623050Z"},"links":{"citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:4157254b47cca26a6eaca98f4b27e2fcebfa5ec3019f253912487d6444f895aa","observation_id":"dfb26f1d-4d40-4dd5-8cdd-665fdfb8e50c","resolution":{"observed_at":"2026-08-01T11:16:11.623050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-07-06T18:07:10.639325Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-01T11:16:11.626141Z","title":"Benchmarking benchmark leakage in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.626141Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:4d7f01527f22d35aa9d637678f3dc7a67e049315f549972a0d904e0d0c38ffdd","observation_id":"403211e6-ef5c-494e-a568-3b88a48bfefb","resolution":{"observed_at":"2026-08-01T11:16:11.626141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19949","last_updated":"2026-07-30T13:38:59Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T18:33:41.738909Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2607.19949."}